{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:ZK5KF34HDP7HU7EC26UVIKZ4ZH","short_pith_number":"pith:ZK5KF34H","schema_version":"1.0","canonical_sha256":"cabaa2ef871bfe7a7c82d7a9542b3cc9fe4049082b9218aa30b57809b6b1aba2","source":{"kind":"arxiv","id":"2503.02951","version":2},"attestation_state":"computed","paper":{"title":"KodCode: A Diverse, Challenging, and Verifiable Synthetic Dataset for Coding","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.LG","authors_text":"Mingyuan Zhou, Radha Poovendran, Yang Liu, Yueqin Yin, Zhangchen Xu","submitted_at":"2025-03-04T19:17:36Z","abstract_excerpt":"We introduce KodCode, a synthetic dataset that addresses the persistent challenge of acquiring high-quality, verifiable training data across diverse difficulties and domains for training Large Language Models for coding. Existing code-focused resources typically fail to ensure either the breadth of coverage (e.g., spanning simple coding tasks to advanced algorithmic problems) or verifiable correctness (e.g., unit tests). In contrast, KodCode comprises question-solution-test triplets that are systematically validated via a self-verification procedure. Our pipeline begins by synthesizing a broad"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2503.02951","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","primary_cat":"cs.LG","submitted_at":"2025-03-04T19:17:36Z","cross_cats_sorted":["cs.AI","cs.CL"],"title_canon_sha256":"7e4c4e10278dd106d48fd156ca420d76fc3d9630f1215a839c9afa819d958108","abstract_canon_sha256":"cbe46b4d288d3feae3bb2c0bb0fe16ca4e33eb9901f4b2aabddba9d377466194"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:35:54.029474Z","signature_b64":"8S0s86F/rcp3vVlBeQHrzUnrpdFbVxrIxH/7EhksB5WgrTO0F2qGlYgQdNeUHSrYV8MEFvpRdgbwuw+0KtabBw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"cabaa2ef871bfe7a7c82d7a9542b3cc9fe4049082b9218aa30b57809b6b1aba2","last_reissued_at":"2026-07-05T11:35:54.028928Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:35:54.028928Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"KodCode: A Diverse, Challenging, and Verifiable Synthetic Dataset for Coding","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.LG","authors_text":"Mingyuan Zhou, Radha Poovendran, Yang Liu, Yueqin Yin, Zhangchen Xu","submitted_at":"2025-03-04T19:17:36Z","abstract_excerpt":"We introduce KodCode, a synthetic dataset that addresses the persistent challenge of acquiring high-quality, verifiable training data across diverse difficulties and domains for training Large Language Models for coding. Existing code-focused resources typically fail to ensure either the breadth of coverage (e.g., spanning simple coding tasks to advanced algorithmic problems) or verifiable correctness (e.g., unit tests). In contrast, KodCode comprises question-solution-test triplets that are systematically validated via a self-verification procedure. Our pipeline begins by synthesizing a broad"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2503.02951","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2503.02951/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2503.02951","created_at":"2026-07-05T11:35:54.028983+00:00"},{"alias_kind":"arxiv_version","alias_value":"2503.02951v2","created_at":"2026-07-05T11:35:54.028983+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2503.02951","created_at":"2026-07-05T11:35:54.028983+00:00"},{"alias_kind":"pith_short_12","alias_value":"ZK5KF34HDP7H","created_at":"2026-07-05T11:35:54.028983+00:00"},{"alias_kind":"pith_short_16","alias_value":"ZK5KF34HDP7HU7EC","created_at":"2026-07-05T11:35:54.028983+00:00"},{"alias_kind":"pith_short_8","alias_value":"ZK5KF34H","created_at":"2026-07-05T11:35:54.028983+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":15,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.07748","citing_title":"Selective Left-Shift: Turning Test-Time Compute and Difficulty-based Curation into Training Data for Low-Resource Code Generation","ref_index":33,"is_internal_anchor":true},{"citing_arxiv_id":"2606.18487","citing_title":"SFT Overtraining Predicts Rank Inversion via Entropy Collapse Under RLVR","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07006","citing_title":"RASFT: Rollout-Adaptive Supervised Fine-Tuning for Reasoning","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07711","citing_title":"SimCT: Recovering Lost Supervision for Cross-Tokenizer On-Policy Distillation","ref_index":54,"is_internal_anchor":false},{"citing_arxiv_id":"2507.01679","citing_title":"Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2605.16342","citing_title":"DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models","ref_index":58,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18597","citing_title":"Latent Action Reparameterization for Efficient Agent Inference","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2511.07833","citing_title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2504.01943","citing_title":"OpenCodeReasoning: Advancing Data Distillation for Competitive Coding","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08472","citing_title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","ref_index":57,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09304","citing_title":"Generating Complex Code Analyzers from Natural Language Questions","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08905","citing_title":"Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07711","citing_title":"SimCT: Recovering Lost Supervision for Cross-Tokenizer On-Policy Distillation","ref_index":53,"is_internal_anchor":false},{"citing_arxiv_id":"2604.07864","citing_title":"ZeroCoder: Can LLMs Improve Code Generation Without Ground-Truth Supervision?","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2507.20534","citing_title":"Kimi K2: Open Agentic Intelligence","ref_index":88,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/ZK5KF34HDP7HU7EC26UVIKZ4ZH","json":"https://pith.science/pith/ZK5KF34HDP7HU7EC26UVIKZ4ZH.json","graph_json":"https://pith.science/api/pith-number/ZK5KF34HDP7HU7EC26UVIKZ4ZH/graph.json","events_json":"https://pith.science/api/pith-number/ZK5KF34HDP7HU7EC26UVIKZ4ZH/events.json","paper":"https://pith.science/paper/ZK5KF34H"},"agent_actions":{"view_html":"https://pith.science/pith/ZK5KF34HDP7HU7EC26UVIKZ4ZH","download_json":"https://pith.science/pith/ZK5KF34HDP7HU7EC26UVIKZ4ZH.json","view_paper":"https://pith.science/paper/ZK5KF34H","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2503.02951&json=true","fetch_graph":"https://pith.science/api/pith-number/ZK5KF34HDP7HU7EC26UVIKZ4ZH/graph.json","fetch_events":"https://pith.science/api/pith-number/ZK5KF34HDP7HU7EC26UVIKZ4ZH/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/ZK5KF34HDP7HU7EC26UVIKZ4ZH/action/timestamp_anchor","attest_storage":"https://pith.science/pith/ZK5KF34HDP7HU7EC26UVIKZ4ZH/action/storage_attestation","attest_author":"https://pith.science/pith/ZK5KF34HDP7HU7EC26UVIKZ4ZH/action/author_attestation","sign_citation":"https://pith.science/pith/ZK5KF34HDP7HU7EC26UVIKZ4ZH/action/citation_signature","submit_replication":"https://pith.science/pith/ZK5KF34HDP7HU7EC26UVIKZ4ZH/action/replication_record"}},"created_at":"2026-07-05T11:35:54.028983+00:00","updated_at":"2026-07-05T11:35:54.028983+00:00"}