{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:SOCYVDPU56UXP6P426CO5C3F4Q","short_pith_number":"pith:SOCYVDPU","schema_version":"1.0","canonical_sha256":"93858a8df4efa977f9fcd784ee8b65e405190a7b2254e284b79c269735f92586","source":{"kind":"arxiv","id":"2403.16952","version":2},"attestation_state":"computed","paper":{"title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CL","authors_text":"Jiasheng Ye, Jun Zhan, Peiju Liu, Tianxiang Sun, Xipeng Qiu, Yunhua Zhou","submitted_at":"2024-03-25T17:14:00Z","abstract_excerpt":"Pretraining data of large language models composes multiple domains (e.g., web texts, academic papers, codes), whose mixture proportions crucially impact the competence of outcome models. While existing endeavors rely on heuristics or qualitative strategies to tune the proportions, we discover the quantitative predictability of model performance regarding the mixture proportions in function forms, which we refer to as the data mixing laws. Fitting such functions on sample mixtures unveils model performance on unseen mixtures before actual runs, thus guiding the selection of an ideal data mixtu"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2403.16952","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.CL","submitted_at":"2024-03-25T17:14:00Z","cross_cats_sorted":["cs.AI","cs.LG"],"title_canon_sha256":"b2c2d9e03dda579ff004073863c9757d0f2d664dac275d8bb3fa5c5d089787ba","abstract_canon_sha256":"c110feaa3099cf061cfef7efb381756bbe5b7006de764b764a3017eadb88b8c9"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:35:32.078776Z","signature_b64":"GBiO/wLjWZse+U5tyZeqi3ZlKDZ20PNfnLo/xstzmqZ5lW4CPGL8t7ZtI8KNXEIJiTFLPoiAdKaCMhZBautEAg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"93858a8df4efa977f9fcd784ee8b65e405190a7b2254e284b79c269735f92586","last_reissued_at":"2026-07-05T10:35:32.077756Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:35:32.077756Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CL","authors_text":"Jiasheng Ye, Jun Zhan, Peiju Liu, Tianxiang Sun, Xipeng Qiu, Yunhua Zhou","submitted_at":"2024-03-25T17:14:00Z","abstract_excerpt":"Pretraining data of large language models composes multiple domains (e.g., web texts, academic papers, codes), whose mixture proportions crucially impact the competence of outcome models. While existing endeavors rely on heuristics or qualitative strategies to tune the proportions, we discover the quantitative predictability of model performance regarding the mixture proportions in function forms, which we refer to as the data mixing laws. Fitting such functions on sample mixtures unveils model performance on unseen mixtures before actual runs, thus guiding the selection of an ideal data mixtu"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2403.16952","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2403.16952/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2403.16952","created_at":"2026-07-05T10:35:32.077891+00:00"},{"alias_kind":"arxiv_version","alias_value":"2403.16952v2","created_at":"2026-07-05T10:35:32.077891+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2403.16952","created_at":"2026-07-05T10:35:32.077891+00:00"},{"alias_kind":"pith_short_12","alias_value":"SOCYVDPU56UX","created_at":"2026-07-05T10:35:32.077891+00:00"},{"alias_kind":"pith_short_16","alias_value":"SOCYVDPU56UXP6P4","created_at":"2026-07-05T10:35:32.077891+00:00"},{"alias_kind":"pith_short_8","alias_value":"SOCYVDPU","created_at":"2026-07-05T10:35:32.077891+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":13,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.24133","citing_title":"Holistic Data Scheduler for LLM Pre-training via Multi-Objective Reinforcement Learning","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2607.02266","citing_title":"HERMES: A Multi-Granularity Labeling Substrate for Pre-training Data Mixtures","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2606.05029","citing_title":"Validity Threats for Foundation Model Research","ref_index":107,"is_internal_anchor":false},{"citing_arxiv_id":"2606.28471","citing_title":"Data and Evaluation Closed-Loop for Model Capability Enhancement","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2605.31164","citing_title":"D$^3$: Dynamic Directional Graph-Constrained Data Scheduling for LLM Training","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2504.09844","citing_title":"MegaScale-Data: Scaling Dataloader for Multisource Large Foundation Model Training","ref_index":75,"is_internal_anchor":false},{"citing_arxiv_id":"2507.15640","citing_title":"Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-training","ref_index":47,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12715","citing_title":"Scaling Laws for Mixture Pretraining Under Data Constraints","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2605.13225","citing_title":"Mix, Don't Tune: Bilingual Pre-Training Outperforms Hyperparameter Search in Data-Constrained Settings","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2404.06395","citing_title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","ref_index":48,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19341","citing_title":"Evaluation-driven Scaling for Scientific Discovery","ref_index":165,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07546","citing_title":"On the Invariance and Generality of Neural Scaling Laws","ref_index":51,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06859","citing_title":"Knowledge Transfer Scaling Laws for 3D Medical Imaging","ref_index":45,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/SOCYVDPU56UXP6P426CO5C3F4Q","json":"https://pith.science/pith/SOCYVDPU56UXP6P426CO5C3F4Q.json","graph_json":"https://pith.science/api/pith-number/SOCYVDPU56UXP6P426CO5C3F4Q/graph.json","events_json":"https://pith.science/api/pith-number/SOCYVDPU56UXP6P426CO5C3F4Q/events.json","paper":"https://pith.science/paper/SOCYVDPU"},"agent_actions":{"view_html":"https://pith.science/pith/SOCYVDPU56UXP6P426CO5C3F4Q","download_json":"https://pith.science/pith/SOCYVDPU56UXP6P426CO5C3F4Q.json","view_paper":"https://pith.science/paper/SOCYVDPU","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2403.16952&json=true","fetch_graph":"https://pith.science/api/pith-number/SOCYVDPU56UXP6P426CO5C3F4Q/graph.json","fetch_events":"https://pith.science/api/pith-number/SOCYVDPU56UXP6P426CO5C3F4Q/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/SOCYVDPU56UXP6P426CO5C3F4Q/action/timestamp_anchor","attest_storage":"https://pith.science/pith/SOCYVDPU56UXP6P426CO5C3F4Q/action/storage_attestation","attest_author":"https://pith.science/pith/SOCYVDPU56UXP6P426CO5C3F4Q/action/author_attestation","sign_citation":"https://pith.science/pith/SOCYVDPU56UXP6P426CO5C3F4Q/action/citation_signature","submit_replication":"https://pith.science/pith/SOCYVDPU56UXP6P426CO5C3F4Q/action/replication_record"}},"created_at":"2026-07-05T10:35:32.077891+00:00","updated_at":"2026-07-05T10:35:32.077891+00:00"}