{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:HJ3FTMLXBKURVUM67ANOPN2TAM","short_pith_number":"pith:HJ3FTMLX","schema_version":"1.0","canonical_sha256":"3a7659b1770aa91ad19ef81ae7b7530304b0bb01c69eb4a720200974d99c696d","source":{"kind":"arxiv","id":"2502.10341","version":3},"attestation_state":"computed","paper":{"title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Alexander Wettig, Danqi Chen, Hannaneh Hajishirzi, Kyle Lo, Luca Soldaini, Sewon Min","submitted_at":"2025-02-14T18:02:37Z","abstract_excerpt":"Modern language models are trained on large, unstructured datasets consisting of trillions of tokens and obtained by crawling the web. The unstructured nature makes it difficult to reason about their contents and develop systematic approaches to data curation. In this paper, we unpack monolithic web corpora by developing taxonomies of their contents and organizing them into domains. We introduce WebOrganizer, a framework for organizing web pages in terms of both their topic and format. Using these two complementary notions of domains, we automatically annotate pre-training data by distilling a"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.10341","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2025-02-14T18:02:37Z","cross_cats_sorted":[],"title_canon_sha256":"533488a7fa660799330d43c0567433080552c5ac1e446fa895a484405995cf3e","abstract_canon_sha256":"bea927436e0d8c216ea8e39c5b6355fd3ffb5966bd8b7054bbadab542590b015"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:38:04.611373Z","signature_b64":"0bAADfrTKvGihSg5WFetwsSAf5TAPJ1zPjpIaSn3vy4t88agO3ygEjQ9i9TeaaHKVGx1yEtV8Kb+fZXyPolJDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"3a7659b1770aa91ad19ef81ae7b7530304b0bb01c69eb4a720200974d99c696d","last_reissued_at":"2026-07-05T11:38:04.610822Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:38:04.610822Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Alexander Wettig, Danqi Chen, Hannaneh Hajishirzi, Kyle Lo, Luca Soldaini, Sewon Min","submitted_at":"2025-02-14T18:02:37Z","abstract_excerpt":"Modern language models are trained on large, unstructured datasets consisting of trillions of tokens and obtained by crawling the web. The unstructured nature makes it difficult to reason about their contents and develop systematic approaches to data curation. In this paper, we unpack monolithic web corpora by developing taxonomies of their contents and organizing them into domains. We introduce WebOrganizer, a framework for organizing web pages in terms of both their topic and format. Using these two complementary notions of domains, we automatically annotate pre-training data by distilling a"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.10341","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.10341/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.10341","created_at":"2026-07-05T11:38:04.610891+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.10341v3","created_at":"2026-07-05T11:38:04.610891+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.10341","created_at":"2026-07-05T11:38:04.610891+00:00"},{"alias_kind":"pith_short_12","alias_value":"HJ3FTMLXBKUR","created_at":"2026-07-05T11:38:04.610891+00:00"},{"alias_kind":"pith_short_16","alias_value":"HJ3FTMLXBKURVUM6","created_at":"2026-07-05T11:38:04.610891+00:00"},{"alias_kind":"pith_short_8","alias_value":"HJ3FTMLX","created_at":"2026-07-05T11:38:04.610891+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":9,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.26277","citing_title":"From Clicks to Intent: Cross-Platform Session Embeddings with LLM-Distilled Taxonomy for Financial Services Recommendations","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2607.02266","citing_title":"HERMES: A Multi-Granularity Labeling Substrate for Pre-training Data Mixtures","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2606.06892","citing_title":"GRASP: Geometry-aware Residual Alignment for Scalable Pretraining Data Attribution","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2606.11499","citing_title":"Hubs or Fringes: Pretraining Data Selection via Web Graph Centrality","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2507.15640","citing_title":"Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-training","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2406.11794","citing_title":"DataComp-LM: In search of the next generation of training sets for language models","ref_index":196,"is_internal_anchor":false},{"citing_arxiv_id":"2511.21613","citing_title":"Beyond URLs: Metadata Diversity and Position for Efficient LLM Pretraining","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2506.11763","citing_title":"DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2602.10995","citing_title":"A Human-Centric Framework for Data Attribution in Large Language Models","ref_index":188,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/HJ3FTMLXBKURVUM67ANOPN2TAM","json":"https://pith.science/pith/HJ3FTMLXBKURVUM67ANOPN2TAM.json","graph_json":"https://pith.science/api/pith-number/HJ3FTMLXBKURVUM67ANOPN2TAM/graph.json","events_json":"https://pith.science/api/pith-number/HJ3FTMLXBKURVUM67ANOPN2TAM/events.json","paper":"https://pith.science/paper/HJ3FTMLX"},"agent_actions":{"view_html":"https://pith.science/pith/HJ3FTMLXBKURVUM67ANOPN2TAM","download_json":"https://pith.science/pith/HJ3FTMLXBKURVUM67ANOPN2TAM.json","view_paper":"https://pith.science/paper/HJ3FTMLX","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.10341&json=true","fetch_graph":"https://pith.science/api/pith-number/HJ3FTMLXBKURVUM67ANOPN2TAM/graph.json","fetch_events":"https://pith.science/api/pith-number/HJ3FTMLXBKURVUM67ANOPN2TAM/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/HJ3FTMLXBKURVUM67ANOPN2TAM/action/timestamp_anchor","attest_storage":"https://pith.science/pith/HJ3FTMLXBKURVUM67ANOPN2TAM/action/storage_attestation","attest_author":"https://pith.science/pith/HJ3FTMLXBKURVUM67ANOPN2TAM/action/author_attestation","sign_citation":"https://pith.science/pith/HJ3FTMLXBKURVUM67ANOPN2TAM/action/citation_signature","submit_replication":"https://pith.science/pith/HJ3FTMLXBKURVUM67ANOPN2TAM/action/replication_record"}},"created_at":"2026-07-05T11:38:04.610891+00:00","updated_at":"2026-07-05T11:38:04.610891+00:00"}