{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:ZITBFQGGT752GCV6ZTOSYO6ZHR","short_pith_number":"pith:ZITBFQGG","schema_version":"1.0","canonical_sha256":"ca2612c0c69ffba30abeccdd2c3bd93c61e4e45ed910b7ecc5840ff9bbac8987","source":{"kind":"arxiv","id":"2309.04662","version":1},"attestation_state":"computed","paper":{"title":"MADLAD-400: A Multilingual And Document-Level Large Audited Dataset","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Aditya Kusupati, Ankur Bapna, Biao Zhang, Christopher A. Choquette-Choo, Derrick Xin, Isaac Caswell, Katherine Lee, Orhan Firat, Romi Stella, Sneha Kudugunta, Xavier Garcia","submitted_at":"2023-09-09T02:34:01Z","abstract_excerpt":"We introduce MADLAD-400, a manually audited, general domain 3T token monolingual dataset based on CommonCrawl, spanning 419 languages. We discuss the limitations revealed by self-auditing MADLAD-400, and the role data auditing had in the dataset creation process. We then train and release a 10.7B-parameter multilingual machine translation model on 250 billion tokens covering over 450 languages using publicly available data, and find that it is competitive with models that are significantly larger, and report the results on different domains. In addition, we train a 8B-parameter language model,"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2309.04662","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2023-09-09T02:34:01Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"b9e6115bbbdd2659dd8b2451296c3ba0a50179e203a55056b845680b29e8865c","abstract_canon_sha256":"156b8dcb0c08951654d1ff370cce2e9156a1dba95c9c392448062928022b6834"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T06:49:07.133924Z","signature_b64":"Vk5KCCo7RaiHhYNBAb+5CAEQTV1MvBEN4CbrICVS6J+KYabvAJiBFmO10yacJyYmhzi3EKLPmuHfLRH1V2qzAA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"ca2612c0c69ffba30abeccdd2c3bd93c61e4e45ed910b7ecc5840ff9bbac8987","last_reissued_at":"2026-07-05T06:49:07.133458Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T06:49:07.133458Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"MADLAD-400: A Multilingual And Document-Level Large Audited Dataset","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CL","authors_text":"Aditya Kusupati, Ankur Bapna, Biao Zhang, Christopher A. Choquette-Choo, Derrick Xin, Isaac Caswell, Katherine Lee, Orhan Firat, Romi Stella, Sneha Kudugunta, Xavier Garcia","submitted_at":"2023-09-09T02:34:01Z","abstract_excerpt":"We introduce MADLAD-400, a manually audited, general domain 3T token monolingual dataset based on CommonCrawl, spanning 419 languages. We discuss the limitations revealed by self-auditing MADLAD-400, and the role data auditing had in the dataset creation process. We then train and release a 10.7B-parameter multilingual machine translation model on 250 billion tokens covering over 450 languages using publicly available data, and find that it is competitive with models that are significantly larger, and report the results on different domains. In addition, we train a 8B-parameter language model,"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2309.04662","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2309.04662/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2309.04662","created_at":"2026-07-05T06:49:07.133521+00:00"},{"alias_kind":"arxiv_version","alias_value":"2309.04662v1","created_at":"2026-07-05T06:49:07.133521+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2309.04662","created_at":"2026-07-05T06:49:07.133521+00:00"},{"alias_kind":"pith_short_12","alias_value":"ZITBFQGGT752","created_at":"2026-07-05T06:49:07.133521+00:00"},{"alias_kind":"pith_short_16","alias_value":"ZITBFQGGT752GCV6","created_at":"2026-07-05T06:49:07.133521+00:00"},{"alias_kind":"pith_short_8","alias_value":"ZITBFQGG","created_at":"2026-07-05T06:49:07.133521+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":5,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2411.05527","citing_title":"How Good is Your Wikipedia? Auditing Data Quality for Low-resource and Multilingual NLP","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2507.06261","citing_title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2311.17035","citing_title":"Scalable Extraction of Training Data from (Production) Language Models","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2403.08295","citing_title":"Gemma: Open Models Based on Gemini Research and Technology","ref_index":62,"is_internal_anchor":false},{"citing_arxiv_id":"2408.00118","citing_title":"Gemma 2: Improving Open Language Models at a Practical Size","ref_index":65,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/ZITBFQGGT752GCV6ZTOSYO6ZHR","json":"https://pith.science/pith/ZITBFQGGT752GCV6ZTOSYO6ZHR.json","graph_json":"https://pith.science/api/pith-number/ZITBFQGGT752GCV6ZTOSYO6ZHR/graph.json","events_json":"https://pith.science/api/pith-number/ZITBFQGGT752GCV6ZTOSYO6ZHR/events.json","paper":"https://pith.science/paper/ZITBFQGG"},"agent_actions":{"view_html":"https://pith.science/pith/ZITBFQGGT752GCV6ZTOSYO6ZHR","download_json":"https://pith.science/pith/ZITBFQGGT752GCV6ZTOSYO6ZHR.json","view_paper":"https://pith.science/paper/ZITBFQGG","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2309.04662&json=true","fetch_graph":"https://pith.science/api/pith-number/ZITBFQGGT752GCV6ZTOSYO6ZHR/graph.json","fetch_events":"https://pith.science/api/pith-number/ZITBFQGGT752GCV6ZTOSYO6ZHR/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/ZITBFQGGT752GCV6ZTOSYO6ZHR/action/timestamp_anchor","attest_storage":"https://pith.science/pith/ZITBFQGGT752GCV6ZTOSYO6ZHR/action/storage_attestation","attest_author":"https://pith.science/pith/ZITBFQGGT752GCV6ZTOSYO6ZHR/action/author_attestation","sign_citation":"https://pith.science/pith/ZITBFQGGT752GCV6ZTOSYO6ZHR/action/citation_signature","submit_replication":"https://pith.science/pith/ZITBFQGGT752GCV6ZTOSYO6ZHR/action/replication_record"}},"created_at":"2026-07-05T06:49:07.133521+00:00","updated_at":"2026-07-05T06:49:07.133521+00:00"}