{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:PFSNMZPSS6Y2H7ZODVW6GNICGX","short_pith_number":"pith:PFSNMZPS","schema_version":"1.0","canonical_sha256":"7964d665f297b1a3ff2e1d6de3350235d61447db69838e729d9e66434fa96720","source":{"kind":"arxiv","id":"2502.11886","version":1},"attestation_state":"computed","paper":{"title":"LIMR: Less is More for RL Scaling","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.LG","authors_text":"Haoyang Zou, Pengfei Liu, Xuefeng Li","submitted_at":"2025-02-17T15:13:29Z","abstract_excerpt":"In this paper, we ask: what truly determines the effectiveness of RL training data for enhancing language models' reasoning capabilities? While recent advances like o1, Deepseek R1, and Kimi1.5 demonstrate RL's potential, the lack of transparency about training data requirements has hindered systematic progress. Starting directly from base models without distillation, we challenge the assumption that scaling up RL training data inherently improves performance. we demonstrate that a strategically selected subset of just 1,389 samples can outperform the full 8,523-sample dataset. We introduce Le"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.11886","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2025-02-17T15:13:29Z","cross_cats_sorted":["cs.AI","cs.CL"],"title_canon_sha256":"f521f48a1175b6efd34991d6c584c1d014d86d9a810de266c1ebd5918bf8dea4","abstract_canon_sha256":"e29186fa51449f5798035f511b6e43742fd96fc4a8ce3f1f9536decc10eadfea"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:15:35.721094Z","signature_b64":"oz5T+dFKGEN/QFM1Ow0YgjsI4f5J4XwUd8U/7sblfenWJUJRxV3g+AXLkhOL8RakNxlwWHOD4IuID+COctg2Dw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"7964d665f297b1a3ff2e1d6de3350235d61447db69838e729d9e66434fa96720","last_reissued_at":"2026-07-05T10:15:35.720615Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:15:35.720615Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"LIMR: Less is More for RL Scaling","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.LG","authors_text":"Haoyang Zou, Pengfei Liu, Xuefeng Li","submitted_at":"2025-02-17T15:13:29Z","abstract_excerpt":"In this paper, we ask: what truly determines the effectiveness of RL training data for enhancing language models' reasoning capabilities? While recent advances like o1, Deepseek R1, and Kimi1.5 demonstrate RL's potential, the lack of transparency about training data requirements has hindered systematic progress. Starting directly from base models without distillation, we challenge the assumption that scaling up RL training data inherently improves performance. we demonstrate that a strategically selected subset of just 1,389 samples can outperform the full 8,523-sample dataset. We introduce Le"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.11886","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.11886/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.11886","created_at":"2026-07-05T10:15:35.720668+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.11886v1","created_at":"2026-07-05T10:15:35.720668+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.11886","created_at":"2026-07-05T10:15:35.720668+00:00"},{"alias_kind":"pith_short_12","alias_value":"PFSNMZPSS6Y2","created_at":"2026-07-05T10:15:35.720668+00:00"},{"alias_kind":"pith_short_16","alias_value":"PFSNMZPSS6Y2H7ZO","created_at":"2026-07-05T10:15:35.720668+00:00"},{"alias_kind":"pith_short_8","alias_value":"PFSNMZPS","created_at":"2026-07-05T10:15:35.720668+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":20,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.11119","citing_title":"TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01249","citing_title":"Trust Region On-Policy Distillation","ref_index":285,"is_internal_anchor":false},{"citing_arxiv_id":"2605.28631","citing_title":"Single-Rollout Hidden-State Dynamics for Training-Free RLVR Data Selection","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2602.01970","citing_title":"Small Generalizable Prompt Predictive Models Can Steer Efficient RL Post-Training of Large Reasoning Models","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2508.10164","citing_title":"Pruning Long Chain-of-Thought of Large Reasoning Models via Small-Scale Preference Optimization","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2511.07940","citing_title":"ISExplore:Informative Segment Selection for Efficient Personalized 3D Talking Face Generation","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2509.08827","citing_title":"A Survey of Reinforcement Learning for Large Reasoning Models","ref_index":289,"is_internal_anchor":false},{"citing_arxiv_id":"2602.03452","citing_title":"Beyond Variance: Prompt-Efficient RLVR via Rare-Event Amplification and Bidirectional Pairing","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2605.15012","citing_title":"Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance","ref_index":49,"is_internal_anchor":false},{"citing_arxiv_id":"2504.13958","citing_title":"ToolRL: Reward is All Tool Learning Needs","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2604.03993","citing_title":"Can LLMs Learn to Reason Robustly under Noisy Supervision?","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2502.17419","citing_title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","ref_index":276,"is_internal_anchor":false},{"citing_arxiv_id":"2604.28020","citing_title":"Cost-Aware Learning","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08441","citing_title":"DUET: Optimize Token-Budget Allocation for Reinforcement Learning with Verifiable Rewards","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09188","citing_title":"DARE: Difficulty-Adaptive Reinforcement Learning with Co-Evolved Difficulty Estimation","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24171","citing_title":"POCA: Pareto-Optimal Curriculum Alignment for Visual Text Generation","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06755","citing_title":"Gradient Extrapolation-Based Policy Optimization","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2604.18381","citing_title":"Learning from Less: Measuring the Effectiveness of RLVR in Low Data and Compute Regimes","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17928","citing_title":"HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment","ref_index":96,"is_internal_anchor":false},{"citing_arxiv_id":"2605.00015","citing_title":"TimeRFT: Stimulating Generalizable Time Series Forecasting for TSFMs via Reinforcement Finetuning","ref_index":29,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/PFSNMZPSS6Y2H7ZODVW6GNICGX","json":"https://pith.science/pith/PFSNMZPSS6Y2H7ZODVW6GNICGX.json","graph_json":"https://pith.science/api/pith-number/PFSNMZPSS6Y2H7ZODVW6GNICGX/graph.json","events_json":"https://pith.science/api/pith-number/PFSNMZPSS6Y2H7ZODVW6GNICGX/events.json","paper":"https://pith.science/paper/PFSNMZPS"},"agent_actions":{"view_html":"https://pith.science/pith/PFSNMZPSS6Y2H7ZODVW6GNICGX","download_json":"https://pith.science/pith/PFSNMZPSS6Y2H7ZODVW6GNICGX.json","view_paper":"https://pith.science/paper/PFSNMZPS","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.11886&json=true","fetch_graph":"https://pith.science/api/pith-number/PFSNMZPSS6Y2H7ZODVW6GNICGX/graph.json","fetch_events":"https://pith.science/api/pith-number/PFSNMZPSS6Y2H7ZODVW6GNICGX/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/PFSNMZPSS6Y2H7ZODVW6GNICGX/action/timestamp_anchor","attest_storage":"https://pith.science/pith/PFSNMZPSS6Y2H7ZODVW6GNICGX/action/storage_attestation","attest_author":"https://pith.science/pith/PFSNMZPSS6Y2H7ZODVW6GNICGX/action/author_attestation","sign_citation":"https://pith.science/pith/PFSNMZPSS6Y2H7ZODVW6GNICGX/action/citation_signature","submit_replication":"https://pith.science/pith/PFSNMZPSS6Y2H7ZODVW6GNICGX/action/replication_record"}},"created_at":"2026-07-05T10:15:35.720668+00:00","updated_at":"2026-07-05T10:15:35.720668+00:00"}