{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:6XJTB6SV2QLJUQAGWOBIEEKDZC","short_pith_number":"pith:6XJTB6SV","schema_version":"1.0","canonical_sha256":"f5d330fa55d4169a4006b382821143c887e98800a2a0b66f99a3ad96b4cc907f","source":{"kind":"arxiv","id":"2506.08745","version":1},"attestation_state":"computed","paper":{"title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.AI","authors_text":"Baisheng Lai, Dacheng Tao, Jieping Ye, Kongcheng Zhang, Mingli Song, Qi Yao, Shunyu Liu, Yingjie Wang","submitted_at":"2025-06-10T12:40:39Z","abstract_excerpt":"Recent advances of Reinforcement Learning (RL) have highlighted its potential in complex reasoning tasks, yet effective training often relies on external supervision, which limits the broader applicability. In this work, we propose a novel self-rewarding reinforcement learning framework to enhance Large Language Model (LLM) reasoning by leveraging the consistency of intermediate reasoning states across different reasoning trajectories. Our key insight is that correct responses often exhibit consistent trajectory patterns in terms of model likelihood: their intermediate reasoning states tend to"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2506.08745","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.AI","submitted_at":"2025-06-10T12:40:39Z","cross_cats_sorted":["cs.CL"],"title_canon_sha256":"227090fd0cacc8c55d12f1bac32557e4e21fac1d4f7f02c6e773d082359e94b9","abstract_canon_sha256":"93ee5ad9ef88d09a9cf630e7ebf35d17781e25e542d73316f69e270228d07a1b"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:19:12.585029Z","signature_b64":"jXcdRres7OmDtqwx6brn2lt+M8r0em/5dEqreZUdPjxx0ebomo4MRUhghMin2keSKndXTOtrI+DIDwIHnfynBw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"f5d330fa55d4169a4006b382821143c887e98800a2a0b66f99a3ad96b4cc907f","last_reissued_at":"2026-07-05T11:19:12.584543Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:19:12.584543Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.AI","authors_text":"Baisheng Lai, Dacheng Tao, Jieping Ye, Kongcheng Zhang, Mingli Song, Qi Yao, Shunyu Liu, Yingjie Wang","submitted_at":"2025-06-10T12:40:39Z","abstract_excerpt":"Recent advances of Reinforcement Learning (RL) have highlighted its potential in complex reasoning tasks, yet effective training often relies on external supervision, which limits the broader applicability. In this work, we propose a novel self-rewarding reinforcement learning framework to enhance Large Language Model (LLM) reasoning by leveraging the consistency of intermediate reasoning states across different reasoning trajectories. Our key insight is that correct responses often exhibit consistent trajectory patterns in terms of model likelihood: their intermediate reasoning states tend to"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2506.08745","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2506.08745/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2506.08745","created_at":"2026-07-05T11:19:12.584603+00:00"},{"alias_kind":"arxiv_version","alias_value":"2506.08745v1","created_at":"2026-07-05T11:19:12.584603+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2506.08745","created_at":"2026-07-05T11:19:12.584603+00:00"},{"alias_kind":"pith_short_12","alias_value":"6XJTB6SV2QLJ","created_at":"2026-07-05T11:19:12.584603+00:00"},{"alias_kind":"pith_short_16","alias_value":"6XJTB6SV2QLJUQAG","created_at":"2026-07-05T11:19:12.584603+00:00"},{"alias_kind":"pith_short_8","alias_value":"6XJTB6SV","created_at":"2026-07-05T11:19:12.584603+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":10,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.27369","citing_title":"Reinforcement Learning without Ground-Truth Solutions can Improve LLMs","ref_index":47,"is_internal_anchor":false},{"citing_arxiv_id":"2606.13176","citing_title":"Mental-R1: Aligning LLM Reasoning for Mental Health Assessment","ref_index":61,"is_internal_anchor":false},{"citing_arxiv_id":"2606.04503","citing_title":"Smart Picks in the Dark: Towards Efficient RLVR for Reasoning via Tracing Metacognitive Pivots","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2606.04516","citing_title":"GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01249","citing_title":"Trust Region On-Policy Distillation","ref_index":71,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14358","citing_title":"Uncovering the Representation Geometry of Minimal Cores in Overcomplete Reasoning Traces","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2605.25864","citing_title":"When Self-Belief Misleads: Active Label Acquisition for Reinforcement Learning with Verifiable Rewards","ref_index":49,"is_internal_anchor":false},{"citing_arxiv_id":"2507.21046","citing_title":"A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence","ref_index":180,"is_internal_anchor":false},{"citing_arxiv_id":"2604.07484","citing_title":"ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2604.18493","citing_title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","ref_index":61,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/6XJTB6SV2QLJUQAGWOBIEEKDZC","json":"https://pith.science/pith/6XJTB6SV2QLJUQAGWOBIEEKDZC.json","graph_json":"https://pith.science/api/pith-number/6XJTB6SV2QLJUQAGWOBIEEKDZC/graph.json","events_json":"https://pith.science/api/pith-number/6XJTB6SV2QLJUQAGWOBIEEKDZC/events.json","paper":"https://pith.science/paper/6XJTB6SV"},"agent_actions":{"view_html":"https://pith.science/pith/6XJTB6SV2QLJUQAGWOBIEEKDZC","download_json":"https://pith.science/pith/6XJTB6SV2QLJUQAGWOBIEEKDZC.json","view_paper":"https://pith.science/paper/6XJTB6SV","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2506.08745&json=true","fetch_graph":"https://pith.science/api/pith-number/6XJTB6SV2QLJUQAGWOBIEEKDZC/graph.json","fetch_events":"https://pith.science/api/pith-number/6XJTB6SV2QLJUQAGWOBIEEKDZC/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/6XJTB6SV2QLJUQAGWOBIEEKDZC/action/timestamp_anchor","attest_storage":"https://pith.science/pith/6XJTB6SV2QLJUQAGWOBIEEKDZC/action/storage_attestation","attest_author":"https://pith.science/pith/6XJTB6SV2QLJUQAGWOBIEEKDZC/action/author_attestation","sign_citation":"https://pith.science/pith/6XJTB6SV2QLJUQAGWOBIEEKDZC/action/citation_signature","submit_replication":"https://pith.science/pith/6XJTB6SV2QLJUQAGWOBIEEKDZC/action/replication_record"}},"created_at":"2026-07-05T11:19:12.584603+00:00","updated_at":"2026-07-05T11:19:12.584603+00:00"}