{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2022:5T53UCRZTHQQW3KU2TRTFV3QIF","short_pith_number":"pith:5T53UCRZ","schema_version":"1.0","canonical_sha256":"ecfbba0a3999e10b6d54d4e332d770417840860e48a49caef082c8ba88ada1f7","source":{"kind":"arxiv","id":"2201.07311","version":1},"attestation_state":"computed","paper":{"title":"Datasheet for the Pile","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Kieran Bicheno, Leo Gao, Stella Biderman","submitted_at":"2022-01-13T23:45:24Z","abstract_excerpt":"This datasheet describes the Pile, a 825 GiB dataset of human-authored text compiled by EleutherAI for use in large-scale language modeling. The Pile is comprised of 22 different text sources, ranging from original scrapes done for this project, to text data made available by the data owners, to third-party scrapes available online."},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2201.07311","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2022-01-13T23:45:24Z","cross_cats_sorted":[],"title_canon_sha256":"a78b72d81614991cd5c6f968717a1d13eeb528524ab1c4c4fd63fb2e763f7de1","abstract_canon_sha256":"336e74dc5d6a9e2f36f05d18eec1c15dcaef99bb78eb14e94005cff4f84e2090"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T03:49:45.292027Z","signature_b64":"pjmaKvY68bIn9xje/g4KQuKpMNajeB7Xd5qkOesMN/MVf4NhGnp8lQP929/gLn2Y8uzcCoebLD5QMfc3a2A0Dg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"ecfbba0a3999e10b6d54d4e332d770417840860e48a49caef082c8ba88ada1f7","last_reissued_at":"2026-07-05T03:49:45.291514Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T03:49:45.291514Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Datasheet for the Pile","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Kieran Bicheno, Leo Gao, Stella Biderman","submitted_at":"2022-01-13T23:45:24Z","abstract_excerpt":"This datasheet describes the Pile, a 825 GiB dataset of human-authored text compiled by EleutherAI for use in large-scale language modeling. The Pile is comprised of 22 different text sources, ranging from original scrapes done for this project, to text data made available by the data owners, to third-party scrapes available online."},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2201.07311","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2201.07311/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2201.07311","created_at":"2026-07-05T03:49:45.291579+00:00"},{"alias_kind":"arxiv_version","alias_value":"2201.07311v1","created_at":"2026-07-05T03:49:45.291579+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2201.07311","created_at":"2026-07-05T03:49:45.291579+00:00"},{"alias_kind":"pith_short_12","alias_value":"5T53UCRZTHQQ","created_at":"2026-07-05T03:49:45.291579+00:00"},{"alias_kind":"pith_short_16","alias_value":"5T53UCRZTHQQW3KU","created_at":"2026-07-05T03:49:45.291579+00:00"},{"alias_kind":"pith_short_8","alias_value":"5T53UCRZ","created_at":"2026-07-05T03:49:45.291579+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":11,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.18587","citing_title":"Dual Dimensionality for Local and Global Attention","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2204.06745","citing_title":"GPT-NeoX-20B: An Open-Source Autoregressive Language Model","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20105","citing_title":"Optimal Representation Size: High-Dimensional Analysis of Pretraining and Linear Probing","ref_index":80,"is_internal_anchor":false},{"citing_arxiv_id":"2310.10631","citing_title":"Llemma: An Open Language Model For Mathematics","ref_index":127,"is_internal_anchor":false},{"citing_arxiv_id":"2304.01373","citing_title":"Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling","ref_index":130,"is_internal_anchor":false},{"citing_arxiv_id":"2404.06395","citing_title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2303.08112","citing_title":"Eliciting Latent Predictions from Transformers with the Tuned Lens","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2211.05100","citing_title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","ref_index":204,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06901","citing_title":"Reflections and New Directions for Human-Centered Large Language Models","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2605.04952","citing_title":"Adaptive Inverted-Index Routing for Granular Mixtures-of-Experts","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2605.04116","citing_title":"Membership Inference Attacks for Retrieval Based In-Context Learning for Document Question Answering","ref_index":4,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/5T53UCRZTHQQW3KU2TRTFV3QIF","json":"https://pith.science/pith/5T53UCRZTHQQW3KU2TRTFV3QIF.json","graph_json":"https://pith.science/api/pith-number/5T53UCRZTHQQW3KU2TRTFV3QIF/graph.json","events_json":"https://pith.science/api/pith-number/5T53UCRZTHQQW3KU2TRTFV3QIF/events.json","paper":"https://pith.science/paper/5T53UCRZ"},"agent_actions":{"view_html":"https://pith.science/pith/5T53UCRZTHQQW3KU2TRTFV3QIF","download_json":"https://pith.science/pith/5T53UCRZTHQQW3KU2TRTFV3QIF.json","view_paper":"https://pith.science/paper/5T53UCRZ","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2201.07311&json=true","fetch_graph":"https://pith.science/api/pith-number/5T53UCRZTHQQW3KU2TRTFV3QIF/graph.json","fetch_events":"https://pith.science/api/pith-number/5T53UCRZTHQQW3KU2TRTFV3QIF/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/5T53UCRZTHQQW3KU2TRTFV3QIF/action/timestamp_anchor","attest_storage":"https://pith.science/pith/5T53UCRZTHQQW3KU2TRTFV3QIF/action/storage_attestation","attest_author":"https://pith.science/pith/5T53UCRZTHQQW3KU2TRTFV3QIF/action/author_attestation","sign_citation":"https://pith.science/pith/5T53UCRZTHQQW3KU2TRTFV3QIF/action/citation_signature","submit_replication":"https://pith.science/pith/5T53UCRZTHQQW3KU2TRTFV3QIF/action/replication_record"}},"created_at":"2026-07-05T03:49:45.291579+00:00","updated_at":"2026-07-05T03:49:45.291579+00:00"}