{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:VDVSH2EN7CXKA7OXE5GCOW7UIT","short_pith_number":"pith:VDVSH2EN","schema_version":"1.0","canonical_sha256":"a8eb23e88df8aea07dd7274c275bf444c6a6ef2bbb09b5821a76d0ca42a9d05c","source":{"kind":"arxiv","id":"2410.02229","version":2},"attestation_state":"computed","paper":{"title":"CodePMP: Scalable Preference Model Pretraining for Large Language Model Reasoning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.AI","authors_text":"Debing Zhang, Haotian Xu, Huimu Yu, Songlin Hu, Xing Wu","submitted_at":"2024-10-03T05:51:26Z","abstract_excerpt":"Large language models (LLMs) have made significant progress in natural language understanding and generation, driven by scalable pretraining and advanced finetuning. However, enhancing reasoning abilities in LLMs, particularly via reinforcement learning from human feedback (RLHF), remains challenging due to the scarcity of high-quality preference data, which is labor-intensive to annotate and crucial for reward model (RM) finetuning. To alleviate this issue, we introduce CodePMP, a scalable preference model pretraining (PMP) pipeline that utilizes a large corpus of synthesized code-preference "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2410.02229","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.AI","submitted_at":"2024-10-03T05:51:26Z","cross_cats_sorted":["cs.CL"],"title_canon_sha256":"747f9f27988ee0734a08a8eac76b0a5c877babd1bad2d243c60b20a914f03c74","abstract_canon_sha256":"a5911a769916395f3a74ea073e0154b2e0d0a7eab69bd7162981e751c38ccc5d"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:11:35.165582Z","signature_b64":"swafNUjIlF56rldN8W3Gi/ofcIsTx3X0QU+Otg9oi9t3dtbiQbDxWZu1Ojbdxvb9diQ4VtHt/bFFDHO54OoPBg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"a8eb23e88df8aea07dd7274c275bf444c6a6ef2bbb09b5821a76d0ca42a9d05c","last_reissued_at":"2026-07-05T11:11:35.164957Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:11:35.164957Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"CodePMP: Scalable Preference Model Pretraining for Large Language Model Reasoning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.AI","authors_text":"Debing Zhang, Haotian Xu, Huimu Yu, Songlin Hu, Xing Wu","submitted_at":"2024-10-03T05:51:26Z","abstract_excerpt":"Large language models (LLMs) have made significant progress in natural language understanding and generation, driven by scalable pretraining and advanced finetuning. However, enhancing reasoning abilities in LLMs, particularly via reinforcement learning from human feedback (RLHF), remains challenging due to the scarcity of high-quality preference data, which is labor-intensive to annotate and crucial for reward model (RM) finetuning. To alleviate this issue, we introduce CodePMP, a scalable preference model pretraining (PMP) pipeline that utilizes a large corpus of synthesized code-preference "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.02229","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2410.02229/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2410.02229","created_at":"2026-07-05T11:11:35.165012+00:00"},{"alias_kind":"arxiv_version","alias_value":"2410.02229v2","created_at":"2026-07-05T11:11:35.165012+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.02229","created_at":"2026-07-05T11:11:35.165012+00:00"},{"alias_kind":"pith_short_12","alias_value":"VDVSH2EN7CXK","created_at":"2026-07-05T11:11:35.165012+00:00"},{"alias_kind":"pith_short_16","alias_value":"VDVSH2EN7CXKA7OX","created_at":"2026-07-05T11:11:35.165012+00:00"},{"alias_kind":"pith_short_8","alias_value":"VDVSH2EN","created_at":"2026-07-05T11:11:35.165012+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.11052","citing_title":"Attention Amnesia in Hybrid LLMs: When CoT Fine-Tuning Breaks Long-Range Recall, and How to Fix It","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2606.17682","citing_title":"From Trainee to Trainer: LLM-Designed Training Environment for RL with Multi-Agent Reasoning","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2502.17419","citing_title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","ref_index":252,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/VDVSH2EN7CXKA7OXE5GCOW7UIT","json":"https://pith.science/pith/VDVSH2EN7CXKA7OXE5GCOW7UIT.json","graph_json":"https://pith.science/api/pith-number/VDVSH2EN7CXKA7OXE5GCOW7UIT/graph.json","events_json":"https://pith.science/api/pith-number/VDVSH2EN7CXKA7OXE5GCOW7UIT/events.json","paper":"https://pith.science/paper/VDVSH2EN"},"agent_actions":{"view_html":"https://pith.science/pith/VDVSH2EN7CXKA7OXE5GCOW7UIT","download_json":"https://pith.science/pith/VDVSH2EN7CXKA7OXE5GCOW7UIT.json","view_paper":"https://pith.science/paper/VDVSH2EN","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2410.02229&json=true","fetch_graph":"https://pith.science/api/pith-number/VDVSH2EN7CXKA7OXE5GCOW7UIT/graph.json","fetch_events":"https://pith.science/api/pith-number/VDVSH2EN7CXKA7OXE5GCOW7UIT/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/VDVSH2EN7CXKA7OXE5GCOW7UIT/action/timestamp_anchor","attest_storage":"https://pith.science/pith/VDVSH2EN7CXKA7OXE5GCOW7UIT/action/storage_attestation","attest_author":"https://pith.science/pith/VDVSH2EN7CXKA7OXE5GCOW7UIT/action/author_attestation","sign_citation":"https://pith.science/pith/VDVSH2EN7CXKA7OXE5GCOW7UIT/action/citation_signature","submit_replication":"https://pith.science/pith/VDVSH2EN7CXKA7OXE5GCOW7UIT/action/replication_record"}},"created_at":"2026-07-05T11:11:35.165012+00:00","updated_at":"2026-07-05T11:11:35.165012+00:00"}