{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:5AI2D4RVZ2NMOCWSQL2ILGX4Z4","short_pith_number":"pith:5AI2D4RV","schema_version":"1.0","canonical_sha256":"e811a1f235ce9ac70ad282f4859afccf30d3bea2f3f6e976cf199375a54ed792","source":{"kind":"arxiv","id":"2503.06072","version":3},"attestation_state":"computed","paper":{"title":"A Survey on Post-training of Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Caiming Xiong, Dingjie Song, Fuyang Wei, Guiyao Tie, Hechang Chen, Heng Ji, Jianfeng Gao, Jiangyue Yan, Jiliang Tang, Lichao Sun, Lifang He, Neil Zhenqiang Gong, Pan Zhou, Philip S. Yu, Qingsong Wen, Rong Zhou, Tianming Liu, Wen Yin, Yao Su, Yifeng Xie, Yihan Cao, Yurou Dai, Yu Zhang, Zeli Zhao, Zhejian Yang, Zhenhan Dai","submitted_at":"2025-03-08T05:41:42Z","abstract_excerpt":"The emergence of Large Language Models (LLMs) has fundamentally transformed natural language processing, making them indispensable across domains ranging from conversational systems to scientific exploration. However, their pre-trained architectures often reveal limitations in specialized contexts, including restricted reasoning capacities, ethical uncertainties, and suboptimal domain-specific performance. These challenges necessitate advanced post-training language models (PoLMs) to address these shortcomings, such as OpenAI-o1/o3 and DeepSeek-R1 (collectively known as Large Reasoning Models,"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2503.06072","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2025-03-08T05:41:42Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"abe55b2d0ffc1e0c551d8f3bd66510937009dd50d2e1865b029dfbec7570b547","abstract_canon_sha256":"9ae6e689b40cfb80c601f55957a2e52c6ac980b5bfc782c954da78c0a846b445"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:46:40.713917Z","signature_b64":"x2sTHiY5jtIGSVSs2qcT0uurSvvQQot25Sai1NCxwhxEyMDMdXnPrJNGBCeBeKEcsDxYk6CVd5hiMRR7vqtYCw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"e811a1f235ce9ac70ad282f4859afccf30d3bea2f3f6e976cf199375a54ed792","last_reissued_at":"2026-07-05T11:46:40.713414Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:46:40.713414Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"A Survey on Post-training of Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Caiming Xiong, Dingjie Song, Fuyang Wei, Guiyao Tie, Hechang Chen, Heng Ji, Jianfeng Gao, Jiangyue Yan, Jiliang Tang, Lichao Sun, Lifang He, Neil Zhenqiang Gong, Pan Zhou, Philip S. Yu, Qingsong Wen, Rong Zhou, Tianming Liu, Wen Yin, Yao Su, Yifeng Xie, Yihan Cao, Yurou Dai, Yu Zhang, Zeli Zhao, Zhejian Yang, Zhenhan Dai","submitted_at":"2025-03-08T05:41:42Z","abstract_excerpt":"The emergence of Large Language Models (LLMs) has fundamentally transformed natural language processing, making them indispensable across domains ranging from conversational systems to scientific exploration. However, their pre-trained architectures often reveal limitations in specialized contexts, including restricted reasoning capacities, ethical uncertainties, and suboptimal domain-specific performance. These challenges necessitate advanced post-training language models (PoLMs) to address these shortcomings, such as OpenAI-o1/o3 and DeepSeek-R1 (collectively known as Large Reasoning Models,"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2503.06072","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2503.06072/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2503.06072","created_at":"2026-07-05T11:46:40.713479+00:00"},{"alias_kind":"arxiv_version","alias_value":"2503.06072v3","created_at":"2026-07-05T11:46:40.713479+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2503.06072","created_at":"2026-07-05T11:46:40.713479+00:00"},{"alias_kind":"pith_short_12","alias_value":"5AI2D4RVZ2NM","created_at":"2026-07-05T11:46:40.713479+00:00"},{"alias_kind":"pith_short_16","alias_value":"5AI2D4RVZ2NMOCWS","created_at":"2026-07-05T11:46:40.713479+00:00"},{"alias_kind":"pith_short_8","alias_value":"5AI2D4RV","created_at":"2026-07-05T11:46:40.713479+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":20,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.06004","citing_title":"Large Language Models Have Unreliable Understanding of Software Engineering Terminology","ref_index":37,"is_internal_anchor":true},{"citing_arxiv_id":"2606.24428","citing_title":"Escaping the Self-Confirmation Trap: An Execute-Distill-Verify Paradigm for Agentic Experience Learning","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2606.27136","citing_title":"Joint Learning of Experiential Rules and Policies for Large Language Model Agents","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2606.19744","citing_title":"Beyond Uniform Forgetting: A Study of Sequential Direct Preference Optimization Across Preference Settings","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2606.02313","citing_title":"Towards Precise Intent-Aligned VLA Aerial Navigation via Expert-Guided GRPO","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2605.25326","citing_title":"Perceive-then-Plan: Layout-as-Policy for Monocular 3D Scene Layout Estimation","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2603.06610","citing_title":"CapTrack: Multifaceted Evaluation of Forgetting in LLM Post-Training","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2603.06610","citing_title":"CapTrack: Multifaceted Evaluation of Forgetting in LLM Post-Training","ref_index":47,"is_internal_anchor":false},{"citing_arxiv_id":"2604.27859","citing_title":"Rethinking Agentic Reinforcement Learning In Large Language Models","ref_index":86,"is_internal_anchor":false},{"citing_arxiv_id":"2507.21545","citing_title":"UniDomain: Pretraining a Unified PDDL Domain from Real-World Demonstrations for Generalizable Robot Task Planning","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2507.19090","citing_title":"Debating Truth: Debate-driven Claim Verification with Multiple Large Language Model Agents","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11011","citing_title":"LoopUS: Recasting Pretrained LLMs into Looped Latent Refinement Models","ref_index":73,"is_internal_anchor":false},{"citing_arxiv_id":"2604.27859","citing_title":"Rethinking Agentic Reinforcement Learning In Large Language Models","ref_index":86,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08378","citing_title":"Reinforcement Learning for Scalable and Trustworthy Intelligent Systems","ref_index":198,"is_internal_anchor":false},{"citing_arxiv_id":"2604.27859","citing_title":"Rethinking Agentic Reinforcement Learning In Large Language Models","ref_index":86,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07105","citing_title":"Theoretical Limits of Language Model Alignment","ref_index":47,"is_internal_anchor":false},{"citing_arxiv_id":"2604.07941","citing_title":"Large Language Model Post-Training: A Unified View of Off-Policy and On-Policy Learning","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2604.05091","citing_title":"MegaTrain: Full Precision Training of 100B+ Parameter Large Language Models on a Single GPU","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2604.15306","citing_title":"Generalization in LLM Problem Solving: The Case of the Shortest Path","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17384","citing_title":"Towards a Data-Parameter Correspondence for LLMs: A Preliminary Discussion","ref_index":2,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/5AI2D4RVZ2NMOCWSQL2ILGX4Z4","json":"https://pith.science/pith/5AI2D4RVZ2NMOCWSQL2ILGX4Z4.json","graph_json":"https://pith.science/api/pith-number/5AI2D4RVZ2NMOCWSQL2ILGX4Z4/graph.json","events_json":"https://pith.science/api/pith-number/5AI2D4RVZ2NMOCWSQL2ILGX4Z4/events.json","paper":"https://pith.science/paper/5AI2D4RV"},"agent_actions":{"view_html":"https://pith.science/pith/5AI2D4RVZ2NMOCWSQL2ILGX4Z4","download_json":"https://pith.science/pith/5AI2D4RVZ2NMOCWSQL2ILGX4Z4.json","view_paper":"https://pith.science/paper/5AI2D4RV","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2503.06072&json=true","fetch_graph":"https://pith.science/api/pith-number/5AI2D4RVZ2NMOCWSQL2ILGX4Z4/graph.json","fetch_events":"https://pith.science/api/pith-number/5AI2D4RVZ2NMOCWSQL2ILGX4Z4/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/5AI2D4RVZ2NMOCWSQL2ILGX4Z4/action/timestamp_anchor","attest_storage":"https://pith.science/pith/5AI2D4RVZ2NMOCWSQL2ILGX4Z4/action/storage_attestation","attest_author":"https://pith.science/pith/5AI2D4RVZ2NMOCWSQL2ILGX4Z4/action/author_attestation","sign_citation":"https://pith.science/pith/5AI2D4RVZ2NMOCWSQL2ILGX4Z4/action/citation_signature","submit_replication":"https://pith.science/pith/5AI2D4RVZ2NMOCWSQL2ILGX4Z4/action/replication_record"}},"created_at":"2026-07-05T11:46:40.713479+00:00","updated_at":"2026-07-05T11:46:40.713479+00:00"}