{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:EVAP7EY7YXTHBYDMN6I5GJNC5E","short_pith_number":"pith:EVAP7EY7","schema_version":"1.0","canonical_sha256":"2540ff931fc5e670e06c6f91d325a2e92cfec92c5795a294406d00bcde718c02","source":{"kind":"arxiv","id":"2303.03915","version":1},"attestation_state":"computed","paper":{"title":"The BigScience ROOTS Corpus: A 1.6TB Composite Multilingual Dataset","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Aaron Gokaslan, Aitor Soroa, Albert Villanova del Moral, Angelina McMillan-Major, Anna Rogers, Chenghao Mou, Christopher Akiki, Daniel van Strien, David Adelani, Eduardo Gonz\\'alez Ponferrada, Francesco De Toni, Gerard Dupont, Giada Pistilli, Hieu Tran, Hugo Lauren\\c{c}on, Huu Nguyen, Ian Yu, Itziar Gonzalez-Dios, Javier de la Rosa, Jenny Chim, Jian Zhu, J\\\"org Frohberg, Khalid Almubarak, Kyle Lo, Leandro Von Werra, Leon Weber, Long Phan, Loubna Ben Allal, Lucile Saulnier, Manan Dey, Manuel Mu\\~noz, Maraim Masoud, Margaret Mitchell, Mario \\v{S}a\\v{s}ko, Minh Chien Vu, Olivier Nguyen, Paulo Villegas, Pedro Ortiz Suarez, Pierre Colombo, Quentin Lhoest, Sasha Alexandra Luccioni, Sebastian Nagel, Shamik Bose, Shayne Longpre, Somaieh Nikpoor, Stella Biderman, Suhas Pai, Suzana Ilic, Teven Le Scao, Thomas Wang, Tristan Thrush, Violette Lepercq, Yacine Jernite, Zaid Alyafeai","submitted_at":"2023-03-07T14:25:44Z","abstract_excerpt":"As language models grow ever larger, the need for large-scale high-quality text datasets has never been more pressing, especially in multilingual settings. The BigScience workshop, a 1-year international and multidisciplinary initiative, was formed with the goal of researching and training large language models as a values-driven undertaking, putting issues of ethics, harm, and governance in the foreground. This paper documents the data creation and curation efforts undertaken by BigScience to assemble the Responsible Open-science Open-collaboration Text Sources (ROOTS) corpus, a 1.6TB dataset"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2303.03915","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2023-03-07T14:25:44Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"23aea398a40e225833787439dc1e42fe47783afbb5ff101a3a1bf3b7746c4318","abstract_canon_sha256":"0c3227308e12f3345fb5f1a5683f90c3dba5fe173b626dc12d61e0757aced8ef"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T05:49:00.905065Z","signature_b64":"0tSyXo9Pw+bveYZpMhYppHpska+H9QL8iU+sE5QeobGAUthGdI/356T3VI1JhZxmnvHkmeE136Km2rbw8l0TBA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"2540ff931fc5e670e06c6f91d325a2e92cfec92c5795a294406d00bcde718c02","last_reissued_at":"2026-07-05T05:49:00.904574Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T05:49:00.904574Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"The BigScience ROOTS Corpus: A 1.6TB Composite Multilingual Dataset","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Aaron Gokaslan, Aitor Soroa, Albert Villanova del Moral, Angelina McMillan-Major, Anna Rogers, Chenghao Mou, Christopher Akiki, Daniel van Strien, David Adelani, Eduardo Gonz\\'alez Ponferrada, Francesco De Toni, Gerard Dupont, Giada Pistilli, Hieu Tran, Hugo Lauren\\c{c}on, Huu Nguyen, Ian Yu, Itziar Gonzalez-Dios, Javier de la Rosa, Jenny Chim, Jian Zhu, J\\\"org Frohberg, Khalid Almubarak, Kyle Lo, Leandro Von Werra, Leon Weber, Long Phan, Loubna Ben Allal, Lucile Saulnier, Manan Dey, Manuel Mu\\~noz, Maraim Masoud, Margaret Mitchell, Mario \\v{S}a\\v{s}ko, Minh Chien Vu, Olivier Nguyen, Paulo Villegas, Pedro Ortiz Suarez, Pierre Colombo, Quentin Lhoest, Sasha Alexandra Luccioni, Sebastian Nagel, Shamik Bose, Shayne Longpre, Somaieh Nikpoor, Stella Biderman, Suhas Pai, Suzana Ilic, Teven Le Scao, Thomas Wang, Tristan Thrush, Violette Lepercq, Yacine Jernite, Zaid Alyafeai","submitted_at":"2023-03-07T14:25:44Z","abstract_excerpt":"As language models grow ever larger, the need for large-scale high-quality text datasets has never been more pressing, especially in multilingual settings. The BigScience workshop, a 1-year international and multidisciplinary initiative, was formed with the goal of researching and training large language models as a values-driven undertaking, putting issues of ethics, harm, and governance in the foreground. This paper documents the data creation and curation efforts undertaken by BigScience to assemble the Responsible Open-science Open-collaboration Text Sources (ROOTS) corpus, a 1.6TB dataset"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2303.03915","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2303.03915/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2303.03915","created_at":"2026-07-05T05:49:00.904632+00:00"},{"alias_kind":"arxiv_version","alias_value":"2303.03915v1","created_at":"2026-07-05T05:49:00.904632+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2303.03915","created_at":"2026-07-05T05:49:00.904632+00:00"},{"alias_kind":"pith_short_12","alias_value":"EVAP7EY7YXTH","created_at":"2026-07-05T05:49:00.904632+00:00"},{"alias_kind":"pith_short_16","alias_value":"EVAP7EY7YXTHBYDM","created_at":"2026-07-05T05:49:00.904632+00:00"},{"alias_kind":"pith_short_8","alias_value":"EVAP7EY7","created_at":"2026-07-05T05:49:00.904632+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2509.05291","citing_title":"Crosscoding Through Time: Tracking Emergence & Consolidation Of Linguistic Representations Throughout LLM Pretraining","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2509.17314","citing_title":"Clotho: Measuring Task-Specific Pre-Generation Test Adequacy for LLM Inputs","ref_index":25,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/EVAP7EY7YXTHBYDMN6I5GJNC5E","json":"https://pith.science/pith/EVAP7EY7YXTHBYDMN6I5GJNC5E.json","graph_json":"https://pith.science/api/pith-number/EVAP7EY7YXTHBYDMN6I5GJNC5E/graph.json","events_json":"https://pith.science/api/pith-number/EVAP7EY7YXTHBYDMN6I5GJNC5E/events.json","paper":"https://pith.science/paper/EVAP7EY7"},"agent_actions":{"view_html":"https://pith.science/pith/EVAP7EY7YXTHBYDMN6I5GJNC5E","download_json":"https://pith.science/pith/EVAP7EY7YXTHBYDMN6I5GJNC5E.json","view_paper":"https://pith.science/paper/EVAP7EY7","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2303.03915&json=true","fetch_graph":"https://pith.science/api/pith-number/EVAP7EY7YXTHBYDMN6I5GJNC5E/graph.json","fetch_events":"https://pith.science/api/pith-number/EVAP7EY7YXTHBYDMN6I5GJNC5E/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/EVAP7EY7YXTHBYDMN6I5GJNC5E/action/timestamp_anchor","attest_storage":"https://pith.science/pith/EVAP7EY7YXTHBYDMN6I5GJNC5E/action/storage_attestation","attest_author":"https://pith.science/pith/EVAP7EY7YXTHBYDMN6I5GJNC5E/action/author_attestation","sign_citation":"https://pith.science/pith/EVAP7EY7YXTHBYDMN6I5GJNC5E/action/citation_signature","submit_replication":"https://pith.science/pith/EVAP7EY7YXTHBYDMN6I5GJNC5E/action/replication_record"}},"created_at":"2026-07-05T05:49:00.904632+00:00","updated_at":"2026-07-05T05:49:00.904632+00:00"}