{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:OMZTFOFHISQEW53TGZCYFA3H5S","short_pith_number":"pith:OMZTFOFH","schema_version":"1.0","canonical_sha256":"733332b8a744a04b77733645828367ec861a7b74932babf5bb9c37afbb6b7b42","source":{"kind":"arxiv","id":"2312.01700","version":3},"attestation_state":"computed","paper":{"title":"Data Management For Training Large Language Models: A Survey","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Baojun Wang, Fei Mi, Lifeng Shang, Qi Zhu, Qun Liu, Wanjun Zhong, Xin Jiang, Yufei Wang, Zige Wang","submitted_at":"2023-12-04T07:42:16Z","abstract_excerpt":"Data plays a fundamental role in training Large Language Models (LLMs). Efficient data management, particularly in formulating a well-suited training dataset, is significant for enhancing model performance and improving training efficiency during pretraining and supervised fine-tuning stages. Despite the considerable importance of data management, the underlying mechanism of current prominent practices are still unknown. Consequently, the exploration of data management has attracted more and more attention among the research community. This survey aims to provide a comprehensive overview of cu"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2312.01700","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2023-12-04T07:42:16Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"caeaaa21746464d63dcad82f99609ed065c00d063ac2abfae8d2c5a37350375b","abstract_canon_sha256":"d28326e937b37a6f6f04f0d8bc951dc0e4c9934753952fab23b67e5db26f854c"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:51:12.302935Z","signature_b64":"uFmrBAgvKd6eZpl/PE+ZobUobYEy0Q3b+uw4lX2E+xNKpH4gzDHReNAEy7+7e2WDgtBi2HuAqR141/RXZiDJDA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"733332b8a744a04b77733645828367ec861a7b74932babf5bb9c37afbb6b7b42","last_reissued_at":"2026-07-05T08:51:12.302463Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:51:12.302463Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Data Management For Training Large Language Models: A Survey","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Baojun Wang, Fei Mi, Lifeng Shang, Qi Zhu, Qun Liu, Wanjun Zhong, Xin Jiang, Yufei Wang, Zige Wang","submitted_at":"2023-12-04T07:42:16Z","abstract_excerpt":"Data plays a fundamental role in training Large Language Models (LLMs). Efficient data management, particularly in formulating a well-suited training dataset, is significant for enhancing model performance and improving training efficiency during pretraining and supervised fine-tuning stages. Despite the considerable importance of data management, the underlying mechanism of current prominent practices are still unknown. Consequently, the exploration of data management has attracted more and more attention among the research community. This survey aims to provide a comprehensive overview of cu"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2312.01700","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2312.01700/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2312.01700","created_at":"2026-07-05T08:51:12.302517+00:00"},{"alias_kind":"arxiv_version","alias_value":"2312.01700v3","created_at":"2026-07-05T08:51:12.302517+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2312.01700","created_at":"2026-07-05T08:51:12.302517+00:00"},{"alias_kind":"pith_short_12","alias_value":"OMZTFOFHISQE","created_at":"2026-07-05T08:51:12.302517+00:00"},{"alias_kind":"pith_short_16","alias_value":"OMZTFOFHISQEW53T","created_at":"2026-07-05T08:51:12.302517+00:00"},{"alias_kind":"pith_short_8","alias_value":"OMZTFOFH","created_at":"2026-07-05T08:51:12.302517+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.05267","citing_title":"Bridging Generation and Training: A Systematic Review of Quality Issues in LLMs for Code","ref_index":133,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/OMZTFOFHISQEW53TGZCYFA3H5S","json":"https://pith.science/pith/OMZTFOFHISQEW53TGZCYFA3H5S.json","graph_json":"https://pith.science/api/pith-number/OMZTFOFHISQEW53TGZCYFA3H5S/graph.json","events_json":"https://pith.science/api/pith-number/OMZTFOFHISQEW53TGZCYFA3H5S/events.json","paper":"https://pith.science/paper/OMZTFOFH"},"agent_actions":{"view_html":"https://pith.science/pith/OMZTFOFHISQEW53TGZCYFA3H5S","download_json":"https://pith.science/pith/OMZTFOFHISQEW53TGZCYFA3H5S.json","view_paper":"https://pith.science/paper/OMZTFOFH","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2312.01700&json=true","fetch_graph":"https://pith.science/api/pith-number/OMZTFOFHISQEW53TGZCYFA3H5S/graph.json","fetch_events":"https://pith.science/api/pith-number/OMZTFOFHISQEW53TGZCYFA3H5S/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/OMZTFOFHISQEW53TGZCYFA3H5S/action/timestamp_anchor","attest_storage":"https://pith.science/pith/OMZTFOFHISQEW53TGZCYFA3H5S/action/storage_attestation","attest_author":"https://pith.science/pith/OMZTFOFHISQEW53TGZCYFA3H5S/action/author_attestation","sign_citation":"https://pith.science/pith/OMZTFOFHISQEW53TGZCYFA3H5S/action/citation_signature","submit_replication":"https://pith.science/pith/OMZTFOFHISQEW53TGZCYFA3H5S/action/replication_record"}},"created_at":"2026-07-05T08:51:12.302517+00:00","updated_at":"2026-07-05T08:51:12.302517+00:00"}