{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:3DTCYULKYVGXK4XWPGLGXWECBR","short_pith_number":"pith:3DTCYULK","schema_version":"1.0","canonical_sha256":"d8e62c516ac54d7572f679966bd8820c6f13a6f0c057abfb17f2fb907f8c5e9a","source":{"kind":"arxiv","id":"2504.14286","version":2},"attestation_state":"computed","paper":{"title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Bin Chen, Bing Yu, Chaohang Wen, Chao Wang, Haotian Zhang, Jinghui Wang, Junyi Peng, Minglei Zhang, Shaojie Wang, Shimiao Jiang, Shiqi Kuang, Shouyu Yin, Wenhao Zhuang, Xiaojiang Zhang, Yinghan Cui, Zheng Lin, Zifei Cheng","submitted_at":"2025-04-19T13:06:03Z","abstract_excerpt":"Recent advances of reasoning models, exemplified by OpenAI's o1 and DeepSeek's R1, highlight the significant potential of Reinforcement Learning (RL) to enhance the reasoning capabilities of Large Language Models (LLMs). However, replicating these advancements across diverse domains remains challenging due to limited methodological transparency. In this work, we present two-Staged history-Resampling Policy Optimization (SRPO), which surpasses the performance of DeepSeek-R1-Zero-32B on the AIME24 and LiveCodeBench benchmarks. SRPO achieves this using the same base model as DeepSeek (i.e. Qwen2."},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2504.14286","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2025-04-19T13:06:03Z","cross_cats_sorted":[],"title_canon_sha256":"bc275c0153e229821940e265fe4dfe26621ef1ce9137773c4181b33aea0c7b2e","abstract_canon_sha256":"59165306c115a3a92737b3e4d132add337c31405bc06367f3ea5487d46d7a418"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:52:23.156239Z","signature_b64":"unxpNb/aRpgv/YAKYzk221d9+1JH5441wyJOAz/5qx9GgUSWpg+wIfEwwSX5G3ob0vH2mwylDccH/6xi+M7XDA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"d8e62c516ac54d7572f679966bd8820c6f13a6f0c057abfb17f2fb907f8c5e9a","last_reissued_at":"2026-07-05T10:52:23.155763Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:52:23.155763Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Bin Chen, Bing Yu, Chaohang Wen, Chao Wang, Haotian Zhang, Jinghui Wang, Junyi Peng, Minglei Zhang, Shaojie Wang, Shimiao Jiang, Shiqi Kuang, Shouyu Yin, Wenhao Zhuang, Xiaojiang Zhang, Yinghan Cui, Zheng Lin, Zifei Cheng","submitted_at":"2025-04-19T13:06:03Z","abstract_excerpt":"Recent advances of reasoning models, exemplified by OpenAI's o1 and DeepSeek's R1, highlight the significant potential of Reinforcement Learning (RL) to enhance the reasoning capabilities of Large Language Models (LLMs). However, replicating these advancements across diverse domains remains challenging due to limited methodological transparency. In this work, we present two-Staged history-Resampling Policy Optimization (SRPO), which surpasses the performance of DeepSeek-R1-Zero-32B on the AIME24 and LiveCodeBench benchmarks. SRPO achieves this using the same base model as DeepSeek (i.e. Qwen2."},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2504.14286","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2504.14286/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2504.14286","created_at":"2026-07-05T10:52:23.155823+00:00"},{"alias_kind":"arxiv_version","alias_value":"2504.14286v2","created_at":"2026-07-05T10:52:23.155823+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2504.14286","created_at":"2026-07-05T10:52:23.155823+00:00"},{"alias_kind":"pith_short_12","alias_value":"3DTCYULKYVGX","created_at":"2026-07-05T10:52:23.155823+00:00"},{"alias_kind":"pith_short_16","alias_value":"3DTCYULKYVGXK4XW","created_at":"2026-07-05T10:52:23.155823+00:00"},{"alias_kind":"pith_short_8","alias_value":"3DTCYULK","created_at":"2026-07-05T10:52:23.155823+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":10,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.11119","citing_title":"TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2606.06828","citing_title":"AdaGRPO: A Capability-Aware Adaptive Enhancement for Flow-based GRPO","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01281","citing_title":"RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning","ref_index":66,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20865","citing_title":"Multi-Step Likelihood-Ratio Correction for Reinforcement Learning with Verifiable Rewards","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17295","citing_title":"DISA: Offline Importance Sampling for Distribution-Matching LLM-RL","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2509.02547","citing_title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","ref_index":55,"is_internal_anchor":false},{"citing_arxiv_id":"2510.18731","citing_title":"Mitigating Lost in Multi-turn Conversation via Curriculum RL with Verifiable Accuracy and Abstention Rewards","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2603.21440","citing_title":"KG-Hopper: Empowering Compact Open LLMs with Knowledge Graph Reasoning via Reinforcement Learning","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11922","citing_title":"StepCodeReasoner: Aligning Code Reasoning with Stepwise Execution Traces via Reinforcement Learning","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07244","citing_title":"Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models","ref_index":113,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/3DTCYULKYVGXK4XWPGLGXWECBR","json":"https://pith.science/pith/3DTCYULKYVGXK4XWPGLGXWECBR.json","graph_json":"https://pith.science/api/pith-number/3DTCYULKYVGXK4XWPGLGXWECBR/graph.json","events_json":"https://pith.science/api/pith-number/3DTCYULKYVGXK4XWPGLGXWECBR/events.json","paper":"https://pith.science/paper/3DTCYULK"},"agent_actions":{"view_html":"https://pith.science/pith/3DTCYULKYVGXK4XWPGLGXWECBR","download_json":"https://pith.science/pith/3DTCYULKYVGXK4XWPGLGXWECBR.json","view_paper":"https://pith.science/paper/3DTCYULK","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2504.14286&json=true","fetch_graph":"https://pith.science/api/pith-number/3DTCYULKYVGXK4XWPGLGXWECBR/graph.json","fetch_events":"https://pith.science/api/pith-number/3DTCYULKYVGXK4XWPGLGXWECBR/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/3DTCYULKYVGXK4XWPGLGXWECBR/action/timestamp_anchor","attest_storage":"https://pith.science/pith/3DTCYULKYVGXK4XWPGLGXWECBR/action/storage_attestation","attest_author":"https://pith.science/pith/3DTCYULKYVGXK4XWPGLGXWECBR/action/author_attestation","sign_citation":"https://pith.science/pith/3DTCYULKYVGXK4XWPGLGXWECBR/action/citation_signature","submit_replication":"https://pith.science/pith/3DTCYULKYVGXK4XWPGLGXWECBR/action/replication_record"}},"created_at":"2026-07-05T10:52:23.155823+00:00","updated_at":"2026-07-05T10:52:23.155823+00:00"}