{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:CQ5BEX5V4NLRB3XKK4M2OV47VR","short_pith_number":"pith:CQ5BEX5V","schema_version":"1.0","canonical_sha256":"143a125fb5e35710eeea5719a7579fac4fc8bb2f3b5fd1a799802e50cf42e3dd","source":{"kind":"arxiv","id":"2505.22653","version":1},"attestation_state":"computed","paper":{"title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Ang Lv, Rui Yan, Ruobing Xie, Xingwu Sun, Zhanhui Kang","submitted_at":"2025-05-28T17:59:03Z","abstract_excerpt":"Recent studies on post-training large language models (LLMs) for reasoning through reinforcement learning (RL) typically focus on tasks that can be accurately verified and rewarded, such as solving math problems. In contrast, our research investigates the impact of reward noise, a more practical consideration for real-world scenarios involving the post-training of LLMs using reward models. We found that LLMs demonstrate strong robustness to substantial reward noise. For example, manually flipping 40% of the reward function's outputs in math tasks still allows a Qwen-2.5-7B model to achieve rap"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2505.22653","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","primary_cat":"cs.CL","submitted_at":"2025-05-28T17:59:03Z","cross_cats_sorted":[],"title_canon_sha256":"a38b8656c97931ad1c88b8abf5a587952a0d2f546fa50a71a6e9e5f5f35537de","abstract_canon_sha256":"69b798fffc7b00fd2418675618aa5bd9dbba0e934d2b7347c0572aefb61b7e45"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:11:28.465195Z","signature_b64":"MDOV2QYCBhR2DZJ9CtSN21/NZu4fyNgWNRqhWT70UJjsIPzE7zSXyvLEob74E8y9780+T1TX6AzZlQFH5K3GBQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"143a125fb5e35710eeea5719a7579fac4fc8bb2f3b5fd1a799802e50cf42e3dd","last_reissued_at":"2026-07-05T11:11:28.464675Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:11:28.464675Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Ang Lv, Rui Yan, Ruobing Xie, Xingwu Sun, Zhanhui Kang","submitted_at":"2025-05-28T17:59:03Z","abstract_excerpt":"Recent studies on post-training large language models (LLMs) for reasoning through reinforcement learning (RL) typically focus on tasks that can be accurately verified and rewarded, such as solving math problems. In contrast, our research investigates the impact of reward noise, a more practical consideration for real-world scenarios involving the post-training of LLMs using reward models. We found that LLMs demonstrate strong robustness to substantial reward noise. For example, manually flipping 40% of the reward function's outputs in math tasks still allows a Qwen-2.5-7B model to achieve rap"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2505.22653","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2505.22653/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2505.22653","created_at":"2026-07-05T11:11:28.464751+00:00"},{"alias_kind":"arxiv_version","alias_value":"2505.22653v1","created_at":"2026-07-05T11:11:28.464751+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.22653","created_at":"2026-07-05T11:11:28.464751+00:00"},{"alias_kind":"pith_short_12","alias_value":"CQ5BEX5V4NLR","created_at":"2026-07-05T11:11:28.464751+00:00"},{"alias_kind":"pith_short_16","alias_value":"CQ5BEX5V4NLRB3XK","created_at":"2026-07-05T11:11:28.464751+00:00"},{"alias_kind":"pith_short_8","alias_value":"CQ5BEX5V","created_at":"2026-07-05T11:11:28.464751+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.04516","citing_title":"GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling","ref_index":51,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01249","citing_title":"Trust Region On-Policy Distillation","ref_index":99,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07244","citing_title":"Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models","ref_index":57,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02909","citing_title":"Delay, Plateau, or Collapse: Evaluating the Impact of Systematic Verification Error on RLVR","ref_index":7,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/CQ5BEX5V4NLRB3XKK4M2OV47VR","json":"https://pith.science/pith/CQ5BEX5V4NLRB3XKK4M2OV47VR.json","graph_json":"https://pith.science/api/pith-number/CQ5BEX5V4NLRB3XKK4M2OV47VR/graph.json","events_json":"https://pith.science/api/pith-number/CQ5BEX5V4NLRB3XKK4M2OV47VR/events.json","paper":"https://pith.science/paper/CQ5BEX5V"},"agent_actions":{"view_html":"https://pith.science/pith/CQ5BEX5V4NLRB3XKK4M2OV47VR","download_json":"https://pith.science/pith/CQ5BEX5V4NLRB3XKK4M2OV47VR.json","view_paper":"https://pith.science/paper/CQ5BEX5V","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2505.22653&json=true","fetch_graph":"https://pith.science/api/pith-number/CQ5BEX5V4NLRB3XKK4M2OV47VR/graph.json","fetch_events":"https://pith.science/api/pith-number/CQ5BEX5V4NLRB3XKK4M2OV47VR/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/CQ5BEX5V4NLRB3XKK4M2OV47VR/action/timestamp_anchor","attest_storage":"https://pith.science/pith/CQ5BEX5V4NLRB3XKK4M2OV47VR/action/storage_attestation","attest_author":"https://pith.science/pith/CQ5BEX5V4NLRB3XKK4M2OV47VR/action/author_attestation","sign_citation":"https://pith.science/pith/CQ5BEX5V4NLRB3XKK4M2OV47VR/action/citation_signature","submit_replication":"https://pith.science/pith/CQ5BEX5V4NLRB3XKK4M2OV47VR/action/replication_record"}},"created_at":"2026-07-05T11:11:28.464751+00:00","updated_at":"2026-07-05T11:11:28.464751+00:00"}