{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:AN4GMTFGLOOP475BYHQED2RNMS","short_pith_number":"pith:AN4GMTFG","schema_version":"1.0","canonical_sha256":"0378664ca65b9cfe7fa1c1e041ea2d64a858224c4c1770c296799dc4518cc64c","source":{"kind":"arxiv","id":"2411.04905","version":3},"attestation_state":"computed","paper":{"title":"OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.PL"],"primary_cat":"cs.CL","authors_text":"Chenchen Zhang, Ge Zhang, Jiaheng Liu, Jiaran Hao, Jie Fu, J.K. Liu, J. Yang, Linzheng Chai, Liuyihan Song, Qian Liu, Ruifeng Yuan, Siming Huang, Tianhao Cheng, Wei Chu, Yang Xu, Yinghui Xu, Yuan Qi, Zhaoxiang Zhang, Zili Wang","submitted_at":"2024-11-07T17:47:25Z","abstract_excerpt":"Large language models (LLMs) for code have become indispensable in various domains, including code generation, reasoning tasks and agent systems. While open-access code LLMs are increasingly approaching the performance levels of proprietary models, high-quality code LLMs suitable for rigorous scientific investigation, particularly those with reproducible data processing pipelines and transparent training protocols, remain limited. The scarcity is due to various challenges, including resource constraints, ethical considerations, and the competitive advantages of keeping models advanced. To addr"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2411.04905","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2024-11-07T17:47:25Z","cross_cats_sorted":["cs.PL"],"title_canon_sha256":"77c6414a87ab5eac104e06c46711ce5c62289aa88e15835bdd87ed5fe01af74f","abstract_canon_sha256":"f20d35e6cf9e261d38f3097874b82e96420ab9b311320e7dc3bf2e31bb3678fb"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:35:40.583457Z","signature_b64":"h7wW0i/ZtEsjCXI6pM3OrApYJcg8513glPS0bkq+2GOaXDvBtKXUsbKBApu4K8rg9L0igOFVwcKRiwDzrdDsCg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"0378664ca65b9cfe7fa1c1e041ea2d64a858224c4c1770c296799dc4518cc64c","last_reissued_at":"2026-07-05T10:35:40.582924Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:35:40.582924Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.PL"],"primary_cat":"cs.CL","authors_text":"Chenchen Zhang, Ge Zhang, Jiaheng Liu, Jiaran Hao, Jie Fu, J.K. Liu, J. Yang, Linzheng Chai, Liuyihan Song, Qian Liu, Ruifeng Yuan, Siming Huang, Tianhao Cheng, Wei Chu, Yang Xu, Yinghui Xu, Yuan Qi, Zhaoxiang Zhang, Zili Wang","submitted_at":"2024-11-07T17:47:25Z","abstract_excerpt":"Large language models (LLMs) for code have become indispensable in various domains, including code generation, reasoning tasks and agent systems. While open-access code LLMs are increasingly approaching the performance levels of proprietary models, high-quality code LLMs suitable for rigorous scientific investigation, particularly those with reproducible data processing pipelines and transparent training protocols, remain limited. The scarcity is due to various challenges, including resource constraints, ethical considerations, and the competitive advantages of keeping models advanced. To addr"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2411.04905","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2411.04905/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2411.04905","created_at":"2026-07-05T10:35:40.582984+00:00"},{"alias_kind":"arxiv_version","alias_value":"2411.04905v3","created_at":"2026-07-05T10:35:40.582984+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2411.04905","created_at":"2026-07-05T10:35:40.582984+00:00"},{"alias_kind":"pith_short_12","alias_value":"AN4GMTFGLOOP","created_at":"2026-07-05T10:35:40.582984+00:00"},{"alias_kind":"pith_short_16","alias_value":"AN4GMTFGLOOP475B","created_at":"2026-07-05T10:35:40.582984+00:00"},{"alias_kind":"pith_short_8","alias_value":"AN4GMTFG","created_at":"2026-07-05T10:35:40.582984+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":14,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.07748","citing_title":"Selective Left-Shift: Turning Test-Time Compute and Difficulty-based Curation into Training Data for Low-Resource Code Generation","ref_index":11,"is_internal_anchor":true},{"citing_arxiv_id":"2606.22211","citing_title":"Open AI in the Wild: Adoption and Adaptation of Open Models on r/LocalLLaMA","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2606.08444","citing_title":"When LLMs Invent Rust Crates: An Empirical Study of Hallucination Patterns and Mitigation","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2606.28438","citing_title":"When AI Reviews Its Own Code: Recursive Self-Training Collapse in Code LLMs","ref_index":48,"is_internal_anchor":false},{"citing_arxiv_id":"2507.01679","citing_title":"Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17497","citing_title":"Self-Supervised On-Policy Distillation for Reasoning Language Models","ref_index":96,"is_internal_anchor":false},{"citing_arxiv_id":"2509.14635","citing_title":"SWE-QA: Can Language Models Answer Repository-level Code Questions?","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2512.20856","citing_title":"NVIDIA Nemotron 3: Efficient and Open Intelligence","ref_index":177,"is_internal_anchor":false},{"citing_arxiv_id":"2504.01943","citing_title":"OpenCodeReasoning: Advancing Data Distillation for Competitive Coding","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2604.00239","citing_title":"A Taxonomy of Programming Languages for Code Generation","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2605.04894","citing_title":"SynConfRoute: Syntax-Aware Routing for Efficient Code Completion with Small CodeLLMs","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2508.15487","citing_title":"Dream 7B: Diffusion Large Language Models","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2507.20534","citing_title":"Kimi K2: Open Agentic Intelligence","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2604.20079","citing_title":"On the Quantization Robustness of Diffusion Language Models in Coding Benchmarks","ref_index":13,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/AN4GMTFGLOOP475BYHQED2RNMS","json":"https://pith.science/pith/AN4GMTFGLOOP475BYHQED2RNMS.json","graph_json":"https://pith.science/api/pith-number/AN4GMTFGLOOP475BYHQED2RNMS/graph.json","events_json":"https://pith.science/api/pith-number/AN4GMTFGLOOP475BYHQED2RNMS/events.json","paper":"https://pith.science/paper/AN4GMTFG"},"agent_actions":{"view_html":"https://pith.science/pith/AN4GMTFGLOOP475BYHQED2RNMS","download_json":"https://pith.science/pith/AN4GMTFGLOOP475BYHQED2RNMS.json","view_paper":"https://pith.science/paper/AN4GMTFG","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2411.04905&json=true","fetch_graph":"https://pith.science/api/pith-number/AN4GMTFGLOOP475BYHQED2RNMS/graph.json","fetch_events":"https://pith.science/api/pith-number/AN4GMTFGLOOP475BYHQED2RNMS/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/AN4GMTFGLOOP475BYHQED2RNMS/action/timestamp_anchor","attest_storage":"https://pith.science/pith/AN4GMTFGLOOP475BYHQED2RNMS/action/storage_attestation","attest_author":"https://pith.science/pith/AN4GMTFGLOOP475BYHQED2RNMS/action/author_attestation","sign_citation":"https://pith.science/pith/AN4GMTFGLOOP475BYHQED2RNMS/action/citation_signature","submit_replication":"https://pith.science/pith/AN4GMTFGLOOP475BYHQED2RNMS/action/replication_record"}},"created_at":"2026-07-05T10:35:40.582984+00:00","updated_at":"2026-07-05T10:35:40.582984+00:00"}