{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:RY7NZG6CXHDWHXDQ2UGXJTA36J","short_pith_number":"pith:RY7NZG6C","schema_version":"1.0","canonical_sha256":"8e3edc9bc2b9c763dc70d50d74cc1bf25c64f5fb86350e2242feaab07501d213","source":{"kind":"arxiv","id":"2505.02391","version":1},"attestation_state":"computed","paper":{"title":"Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.LG","authors_text":"Hanning Zhang, HanZe Dong, Jiarui Yao, Nan Jiang, Tong Zhang, Wei Xiong, Yifan Hao","submitted_at":"2025-05-05T06:26:00Z","abstract_excerpt":"Chain-of-thought (CoT) reasoning in large language models (LLMs) can be formalized as a latent variable problem, where the model needs to generate intermediate reasoning steps. While prior approaches such as iterative reward-ranked fine-tuning (RAFT) have relied on such formulations, they typically apply uniform inference budgets across prompts, which fails to account for variability in difficulty and convergence behavior. This work identifies the main bottleneck in CoT training as inefficient stochastic gradient estimation due to static sampling strategies. We propose GVM-RAFT, a prompt-speci"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2505.02391","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2025-05-05T06:26:00Z","cross_cats_sorted":["cs.AI","cs.CL"],"title_canon_sha256":"355fe961c095e4c4f2eaed3694a74569799792cbb437218659000fd133f9c9b1","abstract_canon_sha256":"a2b4ce6e27b4325124f7672d04f62a03c476f7e3bdae7f6c0910812f9bae403a"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:58:36.396239Z","signature_b64":"krB+2sX3R8rkPlvwjzKNQhxIRT4xDNWtZflqqCzy/223tlrsKrqEilVBj2H96fJU/NagzpPoNSVt9uKbhdunCQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"8e3edc9bc2b9c763dc70d50d74cc1bf25c64f5fb86350e2242feaab07501d213","last_reissued_at":"2026-07-05T10:58:36.395841Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:58:36.395841Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.LG","authors_text":"Hanning Zhang, HanZe Dong, Jiarui Yao, Nan Jiang, Tong Zhang, Wei Xiong, Yifan Hao","submitted_at":"2025-05-05T06:26:00Z","abstract_excerpt":"Chain-of-thought (CoT) reasoning in large language models (LLMs) can be formalized as a latent variable problem, where the model needs to generate intermediate reasoning steps. While prior approaches such as iterative reward-ranked fine-tuning (RAFT) have relied on such formulations, they typically apply uniform inference budgets across prompts, which fails to account for variability in difficulty and convergence behavior. This work identifies the main bottleneck in CoT training as inefficient stochastic gradient estimation due to static sampling strategies. We propose GVM-RAFT, a prompt-speci"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2505.02391","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2505.02391/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2505.02391","created_at":"2026-07-05T10:58:36.395896+00:00"},{"alias_kind":"arxiv_version","alias_value":"2505.02391v1","created_at":"2026-07-05T10:58:36.395896+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.02391","created_at":"2026-07-05T10:58:36.395896+00:00"},{"alias_kind":"pith_short_12","alias_value":"RY7NZG6CXHDW","created_at":"2026-07-05T10:58:36.395896+00:00"},{"alias_kind":"pith_short_16","alias_value":"RY7NZG6CXHDWHXDQ","created_at":"2026-07-05T10:58:36.395896+00:00"},{"alias_kind":"pith_short_8","alias_value":"RY7NZG6C","created_at":"2026-07-05T10:58:36.395896+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.04560","citing_title":"Rollout-Level Advantage-Prioritized Experience Replay for GRPO","ref_index":72,"is_internal_anchor":false},{"citing_arxiv_id":"2602.12579","citing_title":"VI-CuRL: Stabilizing Verifier-Independent RL Reasoning via Confidence-Guided Variance Reduction","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10827","citing_title":"Your Model Diversity, Not Method, Determines Reasoning Strategy","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07331","citing_title":"Rethinking Importance Sampling in LLM Policy Optimization: A Cumulative Token Perspective","ref_index":11,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/RY7NZG6CXHDWHXDQ2UGXJTA36J","json":"https://pith.science/pith/RY7NZG6CXHDWHXDQ2UGXJTA36J.json","graph_json":"https://pith.science/api/pith-number/RY7NZG6CXHDWHXDQ2UGXJTA36J/graph.json","events_json":"https://pith.science/api/pith-number/RY7NZG6CXHDWHXDQ2UGXJTA36J/events.json","paper":"https://pith.science/paper/RY7NZG6C"},"agent_actions":{"view_html":"https://pith.science/pith/RY7NZG6CXHDWHXDQ2UGXJTA36J","download_json":"https://pith.science/pith/RY7NZG6CXHDWHXDQ2UGXJTA36J.json","view_paper":"https://pith.science/paper/RY7NZG6C","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2505.02391&json=true","fetch_graph":"https://pith.science/api/pith-number/RY7NZG6CXHDWHXDQ2UGXJTA36J/graph.json","fetch_events":"https://pith.science/api/pith-number/RY7NZG6CXHDWHXDQ2UGXJTA36J/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/RY7NZG6CXHDWHXDQ2UGXJTA36J/action/timestamp_anchor","attest_storage":"https://pith.science/pith/RY7NZG6CXHDWHXDQ2UGXJTA36J/action/storage_attestation","attest_author":"https://pith.science/pith/RY7NZG6CXHDWHXDQ2UGXJTA36J/action/author_attestation","sign_citation":"https://pith.science/pith/RY7NZG6CXHDWHXDQ2UGXJTA36J/action/citation_signature","submit_replication":"https://pith.science/pith/RY7NZG6CXHDWHXDQ2UGXJTA36J/action/replication_record"}},"created_at":"2026-07-05T10:58:36.395896+00:00","updated_at":"2026-07-05T10:58:36.395896+00:00"}