{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:WL63WTSC3M7RLC22TVPRCYJX26","short_pith_number":"pith:WL63WTSC","schema_version":"1.0","canonical_sha256":"b2fdbb4e42db3f158b5a9d5f116137d7ab1f91a1b28a5fbc7092f3216f407f49","source":{"kind":"arxiv","id":"2509.01321","version":1},"attestation_state":"computed","paper":{"title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.LG","authors_text":"Jun Zhou, Wayne Xin Zhao, Xinyu Tang, Yurou Liu, Zhenduo Zhang, Zhiqiang Zhang, Zujie Wen","submitted_at":"2025-09-01T10:04:20Z","abstract_excerpt":"Recent advances in large reasoning models have leveraged reinforcement learning with verifiable rewards (RLVR) to improve reasoning capabilities. However, scaling these methods typically requires extensive rollout computation and large datasets, leading to high training costs and low data efficiency. To mitigate this issue, we propose DEPO, a Data-Efficient Policy Optimization pipeline that combines optimized strategies for both offline and online data selection. In the offline phase, we curate a high-quality subset of training samples based on diversity, influence, and appropriate difficulty."},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2509.01321","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2025-09-01T10:04:20Z","cross_cats_sorted":["cs.CL"],"title_canon_sha256":"e47e34f316a91e566d1e80ee06aefd030b08340e0aa4bf0fbff3bb9796e98048","abstract_canon_sha256":"669017d95238a5860de849bb3fbf92c93c5744fb9d60f970205371efb2a207f4"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T12:02:58.223365Z","signature_b64":"8pq8/LjyL8FJjs6cic1lwcH9wtYI7imFBEorYPMAGNSsOWsqUZB+KmipZsu+/pqs00WFZU/oKcX7WQL7LSjmAA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"b2fdbb4e42db3f158b5a9d5f116137d7ab1f91a1b28a5fbc7092f3216f407f49","last_reissued_at":"2026-07-05T12:02:58.222805Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T12:02:58.222805Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.LG","authors_text":"Jun Zhou, Wayne Xin Zhao, Xinyu Tang, Yurou Liu, Zhenduo Zhang, Zhiqiang Zhang, Zujie Wen","submitted_at":"2025-09-01T10:04:20Z","abstract_excerpt":"Recent advances in large reasoning models have leveraged reinforcement learning with verifiable rewards (RLVR) to improve reasoning capabilities. However, scaling these methods typically requires extensive rollout computation and large datasets, leading to high training costs and low data efficiency. To mitigate this issue, we propose DEPO, a Data-Efficient Policy Optimization pipeline that combines optimized strategies for both offline and online data selection. In the offline phase, we curate a high-quality subset of training samples based on diversity, influence, and appropriate difficulty."},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2509.01321","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2509.01321/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2509.01321","created_at":"2026-07-05T12:02:58.222880+00:00"},{"alias_kind":"arxiv_version","alias_value":"2509.01321v1","created_at":"2026-07-05T12:02:58.222880+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2509.01321","created_at":"2026-07-05T12:02:58.222880+00:00"},{"alias_kind":"pith_short_12","alias_value":"WL63WTSC3M7R","created_at":"2026-07-05T12:02:58.222880+00:00"},{"alias_kind":"pith_short_16","alias_value":"WL63WTSC3M7RLC22","created_at":"2026-07-05T12:02:58.222880+00:00"},{"alias_kind":"pith_short_8","alias_value":"WL63WTSC","created_at":"2026-07-05T12:02:58.222880+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":7,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.19750","citing_title":"Manifold Bandits: Bayesian Curriculum Learning over the Latent Geometry of Large Language Models","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2606.09380","citing_title":"Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2606.04503","citing_title":"Smart Picks in the Dark: Towards Efficient RLVR for Reasoning via Tracing Metacognitive Pivots","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01281","citing_title":"RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning","ref_index":50,"is_internal_anchor":false},{"citing_arxiv_id":"2605.28247","citing_title":"IRDS: Interpretable RLVR Data Selection via Verifier-Coupled Sparse Autoencoder Coverage","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2512.15146","citing_title":"Beyond Majority Voting: Towards Fine-grained and More Reliable Reward Signal for Test-Time Reinforcement Learning","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09188","citing_title":"DARE: Difficulty-Adaptive Reinforcement Learning with Co-Evolved Difficulty Estimation","ref_index":49,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/WL63WTSC3M7RLC22TVPRCYJX26","json":"https://pith.science/pith/WL63WTSC3M7RLC22TVPRCYJX26.json","graph_json":"https://pith.science/api/pith-number/WL63WTSC3M7RLC22TVPRCYJX26/graph.json","events_json":"https://pith.science/api/pith-number/WL63WTSC3M7RLC22TVPRCYJX26/events.json","paper":"https://pith.science/paper/WL63WTSC"},"agent_actions":{"view_html":"https://pith.science/pith/WL63WTSC3M7RLC22TVPRCYJX26","download_json":"https://pith.science/pith/WL63WTSC3M7RLC22TVPRCYJX26.json","view_paper":"https://pith.science/paper/WL63WTSC","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2509.01321&json=true","fetch_graph":"https://pith.science/api/pith-number/WL63WTSC3M7RLC22TVPRCYJX26/graph.json","fetch_events":"https://pith.science/api/pith-number/WL63WTSC3M7RLC22TVPRCYJX26/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/WL63WTSC3M7RLC22TVPRCYJX26/action/timestamp_anchor","attest_storage":"https://pith.science/pith/WL63WTSC3M7RLC22TVPRCYJX26/action/storage_attestation","attest_author":"https://pith.science/pith/WL63WTSC3M7RLC22TVPRCYJX26/action/author_attestation","sign_citation":"https://pith.science/pith/WL63WTSC3M7RLC22TVPRCYJX26/action/citation_signature","submit_replication":"https://pith.science/pith/WL63WTSC3M7RLC22TVPRCYJX26/action/replication_record"}},"created_at":"2026-07-05T12:02:58.222880+00:00","updated_at":"2026-07-05T12:02:58.222880+00:00"}