{"as_of":"2026-08-08T11:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c58d00cf3361fb3993ba68e40abc2e37e2d21a1dd1ee713682f098a0fbd79604","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T18:33:11.518358Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:29:45.470376Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"cited_work":{"arxiv_id":"2502.10341","doi":"10.48550/arxiv.2502.10341","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10341","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2502.10341 (2025)","venue":"ArXiv.org","work_id":"abfd649b-44bc-4704-8969-8aa7cf4cfb37","year":2025},"citing_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"reference_index":196,"source":"pdf_text","source_observed_at":"2026-05-17T22:58:16.523267Z"},"links":{"cited_paper":"/paper/2502.10341","citing_paper":"/paper/2406.11794"},"observation_digest":"sha256:25d724fc229a98605461ac0542dd30b2a17b84f7279a81f3831228d228cb7434","observation_id":"bf7042ef-0fd7-476e-9ec1-0d95314fb403","resolution":{"observed_at":"2026-05-17T22:58:17.308676Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10341","snapshot_observed_at":"2026-08-07T10:29:45.470376Z","title":"Organize the web: Constructing domains enhances pre-training data curation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05209","last_updated":"2025-06-05T16:21:30Z","snapshot_observed_at":"2026-08-07T10:43:51.895295Z","submitted_at":"2025-06-05T16:21:30Z","title":"The Common Pile v0.1: An 8TB Dataset of Public Domain and Openly Licensed Text","version":1},"reference_index":188,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:45.470376Z"},"links":{"cited_paper":"/paper/2502.10341","citing_paper":"/paper/2506.05209"},"observation_digest":"sha256:e74d3deb1ebc6bfb0262504120202a85eeb3b4578edb51e3cdc86b1841c00a92","observation_id":"2b9e93a4-1d47-4b23-a0c8-89052097706c","resolution":{"observed_at":"2026-08-07T10:29:45.470376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10341","snapshot_observed_at":"2026-08-07T04:34:41.169418Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10272","last_updated":"2025-06-12T01:29:07Z","snapshot_observed_at":"2026-08-07T04:50:23.641965Z","submitted_at":"2025-06-12T01:29:07Z","title":"Collective Bargaining in the Information Economy Can Address AI-Driven Power Concentration","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T04:34:41.169418Z"},"links":{"cited_paper":"/paper/2502.10341","citing_paper":"/paper/2506.10272"},"observation_digest":"sha256:3c7ae198121f8c0f043ec15f03546366a53ca5c983c25e7e5dc83aea3299bb7b","observation_id":"1ca51a6e-e0ad-492e-b203-75d00528ab47","resolution":{"observed_at":"2026-08-07T04:34:41.169418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"cited_work":{"arxiv_id":"2502.10341","doi":"10.48550/arxiv.2502.10341","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10341","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2502.10341 (2025)","venue":"ArXiv.org","work_id":"abfd649b-44bc-4704-8969-8aa7cf4cfb37","year":2025},"citing_paper":{"arxiv_id":"2506.11763","last_updated":"2025-06-13T13:17:32Z","snapshot_observed_at":"2026-08-07T14:15:18.269910Z","submitted_at":"2025-06-13T13:17:32Z","title":"DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T08:07:39.384613Z"},"links":{"cited_paper":"/paper/2502.10341","citing_paper":"/paper/2506.11763"},"observation_digest":"sha256:b7a27cda544fd5872e124491a66f61a9dbf3ad3c0ada0242782fd04d805844ec","observation_id":"ed42f985-8935-4ca1-b762-082de0ad6ec0","resolution":{"observed_at":"2026-05-16T08:07:39.521970Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10341","snapshot_observed_at":"2026-08-07T00:51:54.960315Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12571","last_updated":"2025-06-14T16:56:00Z","snapshot_observed_at":"2026-08-07T00:43:22.731034Z","submitted_at":"2025-06-14T16:56:00Z","title":"DoTA-RAG: Dynamic of Thought Aggregation RAG","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:51:54.960315Z"},"links":{"cited_paper":"/paper/2502.10341","citing_paper":"/paper/2506.12571"},"observation_digest":"sha256:21ad7bc7816ff682afdaec386cc85282f1cde75da1fbb5f32dfac07fec469caf","observation_id":"eeb0f46f-0610-4c4e-8230-211426663747","resolution":{"observed_at":"2026-08-07T00:51:54.960315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10341","snapshot_observed_at":"2026-08-07T00:24:47.820795Z","title":"Organize the web: Constructing domains enhances pre-training data curation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14111","last_updated":"2025-06-19T19:02:41Z","snapshot_observed_at":"2026-08-07T00:16:03.841117Z","submitted_at":"2025-06-17T02:03:36Z","title":"Essential-Web v1.0: 24T tokens of organized web data","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T00:24:47.820795Z"},"links":{"cited_paper":"/paper/2502.10341","citing_paper":"/paper/2506.14111"},"observation_digest":"sha256:19d4304c7b71ec8b06b578f457d77ad897f2a37af46fe0cade8d1519d1cffd3c","observation_id":"cf8fc6f8-8a3c-484f-8854-57fe1a5ae6f2","resolution":{"observed_at":"2026-08-07T00:24:47.820795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10341","snapshot_observed_at":"2026-08-06T22:54:52.567233Z","title":"Organize the web: Constructing domains enhances pre-training data curation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20331","last_updated":"2025-06-25T11:30:25Z","snapshot_observed_at":"2026-08-06T22:48:51.996382Z","submitted_at":"2025-06-25T11:30:25Z","title":"Biomed-Enriched: A Biomedical Dataset Enriched with LLMs for Pretraining and Extracting Rare and Hidden Content","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T22:54:52.567233Z"},"links":{"cited_paper":"/paper/2502.10341","citing_paper":"/paper/2506.20331"},"observation_digest":"sha256:b8a2a4b4dc78d5b744d6376b00bdb471e8eed599ef4c6ee3e9c90362e03a0686","observation_id":"54b28227-abef-4277-ad59-344a68261de0","resolution":{"observed_at":"2026-08-06T22:54:52.567233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10341","snapshot_observed_at":"2026-08-06T16:53:15.274343Z","title":"Organize the web: Constructing domains enhances pre-training data curation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12466","last_updated":"2025-07-16T17:59:45Z","snapshot_observed_at":"2026-08-07T10:43:47.278118Z","submitted_at":"2025-07-16T17:59:45Z","title":"Language Models Improve When Pretraining Data Matches Target Tasks","version":1},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-08-06T16:53:15.274343Z"},"links":{"cited_paper":"/paper/2502.10341","citing_paper":"/paper/2507.12466"},"observation_digest":"sha256:16da7ee5a419124539f68a8fd45ab3ce0949670f59c206003eb6c301eab8afe8","observation_id":"5ac3dd65-a5a9-49a1-955c-790fc4f3ba1e","resolution":{"observed_at":"2026-08-06T16:53:15.274343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"cited_work":{"arxiv_id":"2502.10341","doi":"10.48550/arxiv.2502.10341","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10341","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2502.10341 (2025)","venue":"ArXiv.org","work_id":"abfd649b-44bc-4704-8969-8aa7cf4cfb37","year":2025},"citing_paper":{"arxiv_id":"2507.15640","last_updated":"2026-04-12T09:28:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-21T14:01:54Z","title":"Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-training","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-19T03:36:50.366757Z"},"links":{"cited_paper":"/paper/2502.10341","citing_paper":"/paper/2507.15640"},"observation_digest":"sha256:8380f7feffd8da7d895fecfe7495df69824a989756e6fecd53a33f90d4f331e3","observation_id":"029de565-8692-436c-b5ae-74ea460722e9","resolution":{"observed_at":"2026-05-19T03:37:01.021457Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10341","snapshot_observed_at":"2026-08-05T14:49:35.955400Z","title":"Organize the web: Constructing domains enhances pre-training data curation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-07T08:43:46.033186Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.955400Z"},"links":{"cited_paper":"/paper/2502.10341","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:18bae8b87704eb509bd623d8a34c2179cf31ccdc71379a16429ccbe8c9e27720","observation_id":"500cc621-014d-4ca1-914c-b7e5bd093270","resolution":{"observed_at":"2026-08-05T14:49:35.955400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"cited_work":{"arxiv_id":"2502.10341","doi":"10.48550/arxiv.2502.10341","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10341","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2502.10341 (2025)","venue":"ArXiv.org","work_id":"abfd649b-44bc-4704-8969-8aa7cf4cfb37","year":2025},"citing_paper":{"arxiv_id":"2511.21613","last_updated":"2026-04-19T02:59:16Z","snapshot_observed_at":"2026-08-06T11:38:39.962564Z","submitted_at":"2025-11-26T17:36:31Z","title":"Beyond URLs: Metadata Diversity and Position for Efficient LLM Pretraining","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T04:46:33.641714Z"},"links":{"cited_paper":"/paper/2502.10341","citing_paper":"/paper/2511.21613"},"observation_digest":"sha256:63e52c3b47ee41b4090384ffad5e09ec279da0ba7e222b79daf27b8c0dae8c88","observation_id":"52bffd43-616c-477a-9c8a-28fa50baae4f","resolution":{"observed_at":"2026-05-17T04:49:02.999060Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"cited_work":{"arxiv_id":"2502.10341","doi":"10.48550/arxiv.2502.10341","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10341","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2502.10341 (2025)","venue":"ArXiv.org","work_id":"abfd649b-44bc-4704-8969-8aa7cf4cfb37","year":2025},"citing_paper":{"arxiv_id":"2602.10995","last_updated":"2026-05-08T16:44:25Z","snapshot_observed_at":"2026-07-06T22:45:29.609382Z","submitted_at":"2026-02-11T16:20:50Z","title":"A Human-Centric Framework for Data Attribution in Large Language Models","version":2},"reference_index":188,"source":"pdf_text","source_observed_at":"2026-05-16T02:33:56.023070Z"},"links":{"cited_paper":"/paper/2502.10341","citing_paper":"/paper/2602.10995"},"observation_digest":"sha256:26ab066d508c931f97925a6d88d68cb2c122a278757dc7aacbb9b0fd2be45a0f","observation_id":"d84218ab-946c-49ee-b1a9-122598bd839a","resolution":{"observed_at":"2026-05-16T02:37:10.636128Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10341","snapshot_observed_at":"2026-08-02T21:05:26.349187Z","title":"Organize the web: Constructing domains en- hances pre-training data curation.ArXiv, abs/2502.10341,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.21492","last_updated":"2026-07-18T04:56:29Z","snapshot_observed_at":"2026-08-04T06:06:14.689327Z","submitted_at":"2026-02-25T01:54:50Z","title":"GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T21:05:26.349187Z"},"links":{"cited_paper":"/paper/2502.10341","citing_paper":"/paper/2602.21492"},"observation_digest":"sha256:1954e4c7faf13c42c64cd7883d351641daca2454229e0a9e6a36f9fbb151a641","observation_id":"2d43acf9-4d53-4f4f-bf7a-2ba183cec965","resolution":{"observed_at":"2026-08-02T21:05:26.349187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"cited_work":{"arxiv_id":"2502.10341","doi":"10.48550/arxiv.2502.10341","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10341","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2502.10341 (2025)","venue":"ArXiv.org","work_id":"abfd649b-44bc-4704-8969-8aa7cf4cfb37","year":2025},"citing_paper":{"arxiv_id":"2606.06892","last_updated":"2026-06-05T04:17:50Z","snapshot_observed_at":"2026-08-08T08:24:41.596708Z","submitted_at":"2026-06-05T04:17:50Z","title":"GRASP: Geometry-aware Residual Alignment for Scalable Pretraining Data Attribution","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-27T22:21:02.356653Z"},"links":{"cited_paper":"/paper/2502.10341","citing_paper":"/paper/2606.06892"},"observation_digest":"sha256:85ad56da2c2c1206845448520f4e329042cf6eb4f6e4e35a9109a2f6c1553f83","observation_id":"7cb6311e-3d3c-41ae-aa2b-c37f29c1d962","resolution":{"observed_at":"2026-06-27T22:21:20.777729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"cited_work":{"arxiv_id":"2502.10341","doi":"10.48550/arxiv.2502.10341","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10341","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2502.10341 (2025)","venue":"ArXiv.org","work_id":"abfd649b-44bc-4704-8969-8aa7cf4cfb37","year":2025},"citing_paper":{"arxiv_id":"2606.11499","last_updated":"2026-06-09T22:44:47Z","snapshot_observed_at":"2026-08-02T07:51:26.921796Z","submitted_at":"2026-06-09T22:44:47Z","title":"Hubs or Fringes: Pretraining Data Selection via Web Graph Centrality","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-27T12:57:26.458109Z"},"links":{"cited_paper":"/paper/2502.10341","citing_paper":"/paper/2606.11499"},"observation_digest":"sha256:a0e3290df2d973dcc64582711b21ac9fb9b6ac3753e60357405805e7f451148d","observation_id":"243077b1-bf01-409c-87fc-a6784298ff78","resolution":{"observed_at":"2026-06-27T13:10:56.643064Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"cited_work":{"arxiv_id":"2502.10341","doi":"10.48550/arxiv.2502.10341","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10341","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2502.10341 (2025)","venue":"ArXiv.org","work_id":"abfd649b-44bc-4704-8969-8aa7cf4cfb37","year":2025},"citing_paper":{"arxiv_id":"2606.26277","last_updated":"2026-06-24T18:18:56Z","snapshot_observed_at":"2026-08-02T19:41:03.114465Z","submitted_at":"2026-06-24T18:18:56Z","title":"From Clicks to Intent: Cross-Platform Session Embeddings with LLM-Distilled Taxonomy for Financial Services Recommendations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T01:01:02.964715Z"},"links":{"cited_paper":"/paper/2502.10341","citing_paper":"/paper/2606.26277"},"observation_digest":"sha256:78899348adef408eac576ab6f9eef3897f0746728e95d89a28eed49da4339ac0","observation_id":"5146c13a-49bf-47b6-9467-eb24ea9a120c","resolution":{"observed_at":"2026-07-04T16:09:56.384675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"cited_work":{"arxiv_id":"2502.10341","doi":"10.48550/arxiv.2502.10341","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10341","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2502.10341 (2025)","venue":"ArXiv.org","work_id":"abfd649b-44bc-4704-8969-8aa7cf4cfb37","year":2025},"citing_paper":{"arxiv_id":"2607.02266","last_updated":"2026-07-02T14:51:42Z","snapshot_observed_at":"2026-08-01T16:10:16.151976Z","submitted_at":"2026-07-02T14:51:42Z","title":"HERMES: A Multi-Granularity Labeling Substrate for Pre-training Data Mixtures","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-03T16:44:41.720388Z"},"links":{"cited_paper":"/paper/2502.10341","citing_paper":"/paper/2607.02266"},"observation_digest":"sha256:56996dcb8b2ceaaed3a4fc7f459074b160b57e90a7e55dcd507866fa49f10da2","observation_id":"bdf338e8-883d-4aad-b758-748e3ae2c74d","resolution":{"observed_at":"2026-07-03T16:48:39.461784Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10341","snapshot_observed_at":"2026-08-02T09:40:07.292725Z","title":"Organize the web: Constructing domains enhances pre-training data curation.arXiv preprint arXiv:2502.10341, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22662","last_updated":"2026-06-29T03:25:36Z","snapshot_observed_at":"2026-08-02T09:40:00.460587Z","submitted_at":"2026-06-29T03:25:36Z","title":"CuraWeb: Joint Optimization of Quality, Redundancy, and Diversity for Web-Scale Pretraining Data","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T09:40:07.292725Z"},"links":{"cited_paper":"/paper/2502.10341","citing_paper":"/paper/2607.22662"},"observation_digest":"sha256:0483733631afc83c2b24698bac600738c9099db7f669c4c5df47b0371c666a94","observation_id":"ba99a462-f5a6-4a53-b5fd-90fa5969be65","resolution":{"observed_at":"2026-08-02T09:40:07.292725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.10341/citation-record","integrity":"/paper/2502.10341/integrity","json":"/paper/2502.10341/citation-record.json","paper":"/paper/2502.10341"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T18:33:11.429395Z","title":"Christopher Clark, Kenton Lee, Ming-Wei Chang, Tom Kwiatkowski, Michael Collins, and Kristina Toutanova","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T18:33:11.429395Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2502.10341"},"observation_digest":"sha256:deaa639d167c0f64aa0840b0bfd55d26557681ac126754a846a37eea6b91b38e","observation_id":"57476628-556d-4960-a970-fa0098748a58","resolution":{"observed_at":"2026-08-07T18:33:11.429395Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-08-08T06:58:44.493777Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-07T18:33:11.481504Z","title":"Team OLMo, Pete Walsh, Luca Soldaini, Dirk Groen- eveld, Kyle Lo, Shane Arora, Akshita Bhagia, Yuling Gu, Shengyi Huang, Matt Jordan, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T18:33:11.481504Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2502.10341"},"observation_digest":"sha256:41aee95808c47b2ea88882de152b38b37f0fa99ea8eef98eebf59c374ad078d0","observation_id":"350c1a09-be16-4467-af4e-e8a49f9a5a77","resolution":{"observed_at":"2026-08-07T18:33:11.481504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.06724","last_updated":"2015-06-22T19:26:56Z","snapshot_observed_at":"2026-08-06T16:37:38.107677Z","submitted_at":"2015-06-22T19:26:56Z","title":"Aligning Books and Movies: Towards Story-like Visual Explanations by Watching Movies and Reading Books","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.06724","snapshot_observed_at":"2026-08-07T18:33:11.518358Z","title":"About Page","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T18:33:11.518358Z"},"links":{"cited_paper":"/paper/1506.06724","citing_paper":"/paper/2502.10341"},"observation_digest":"sha256:1d31bd000277274fa95a1fd164cec7b69069da1991b60c1878fb128a21e47f6b","observation_id":"ddd150e3-8dc2-4f2c-9983-ebf4277edb86","resolution":{"observed_at":"2026-08-07T18:33:11.518358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-07T18:33:11.488766Z","title":"naacl-long.164/","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"reference_index":164,"source":"pdf_text","source_observed_at":"2026-08-07T18:33:11.488766Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2502.10341"},"observation_digest":"sha256:b24d669013200802e2512f5d7497973c5b20e9811bfee742c7a559e639aedd38","observation_id":"40548412-74b5-430f-9e26-b8ff651ef36d","resolution":{"observed_at":"2026-08-07T18:33:11.488766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06408","last_updated":"2024-06-20T18:21:49Z","snapshot_observed_at":"2026-07-06T17:14:41.030939Z","submitted_at":"2024-01-12T07:10:10Z","title":"AboutMe: Using Self-Descriptions in Webpages to Document the Effects of English Pretraining Data Filters","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06408","snapshot_observed_at":"2026-08-07T18:33:11.466884Z","title":"naacl-long.179/","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"reference_index":179,"source":"pdf_text","source_observed_at":"2026-08-07T18:33:11.466884Z"},"links":{"cited_paper":"/paper/2401.06408","citing_paper":"/paper/2502.10341"},"observation_digest":"sha256:5b850f5883aeaac1fdc61ef6d57003dc9e2c150ab73eb58693aecee638001db8","observation_id":"4e066cac-8b79-4282-bf34-8fda2146aeb4","resolution":{"observed_at":"2026-08-07T18:33:11.466884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T18:33:11.434440Z","title":"emnlp-main.183/","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"reference_index":183,"source":"pdf_text","source_observed_at":"2026-08-07T18:33:11.434440Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.10341"},"observation_digest":"sha256:71a9e7c58a361e943f19f8cfa2eee2cb7d85976000b9be522939dc972affc965","observation_id":"c458ff57-344b-4bda-af96-38de86d1f51a","resolution":{"observed_at":"2026-08-07T18:33:11.434440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T04:13:14.044604Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T18:33:11.408309Z","title":"naacl-main.373/","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"reference_index":373,"source":"pdf_text","source_observed_at":"2026-08-07T18:33:11.408309Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2502.10341"},"observation_digest":"sha256:204b05c2c7599e0f4f68d03a07e09fb7a1f2594026c8c83d74e8ec6a53c19be7","observation_id":"b1c1a7d1-4b66-462b-8c94-18c0338dc37a","resolution":{"observed_at":"2026-08-07T18:33:11.408309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11794","snapshot_observed_at":"2026-08-07T18:33:11.460200Z","title":"acl-long.577","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"reference_index":577,"source":"pdf_text","source_observed_at":"2026-08-07T18:33:11.460200Z"},"links":{"cited_paper":"/paper/2406.11794","citing_paper":"/paper/2502.10341"},"observation_digest":"sha256:2e5c53dbcc1837eb553fb272a8091cc95eee4a20b37b6a98d3a0cabd21247628","observation_id":"efe2871c-3760-4b49-8563-a4a65c08676a","resolution":{"observed_at":"2026-08-07T18:33:11.460200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-08-07T18:33:11.510347Z","title":"emnlp-main.657/","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"reference_index":657,"source":"pdf_text","source_observed_at":"2026-08-07T18:33:11.510347Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2502.10341"},"observation_digest":"sha256:2952f12eb707b54fc6ede170dbc0af5ecf4f5ace1ca31fa743c3e2891b9d4fc9","observation_id":"bccb8b40-7571-460c-a0f2-cfd7d46edc43","resolution":{"observed_at":"2026-08-07T18:33:11.510347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:33:11.475720Z","title":"acl-long.757/","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"reference_index":757,"source":"pdf_text","source_observed_at":"2026-08-07T18:33:11.475720Z"},"links":{"citing_paper":"/paper/2502.10341"},"observation_digest":"sha256:9a2d6935b0c76647128bdb61b7538f2dc96e358f802b3c5664553c628c9a3641","observation_id":"9e4de4d0-966c-42ec-bc6f-4dc49ebed24f","resolution":{"observed_at":"2026-08-07T18:33:11.475720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:33:11.495151Z","title":"acl-long.840","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"reference_index":840,"source":"pdf_text","source_observed_at":"2026-08-07T18:33:11.495151Z"},"links":{"citing_paper":"/paper/2502.10341"},"observation_digest":"sha256:20efcde73f2fcfa50e706e775f49b1ffc8fadf7e039a63f1adb93e2f642eeb2e","observation_id":"7705e261-d2b6-4ad5-853d-de890462f77e","resolution":{"observed_at":"2026-08-07T18:33:11.495151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:33:12.287463Z","title":"cc/paper_files/paper/2017/file/ 6449f44a102fde848669bdd9eb6b76fa-Paper","venue":null,"work_id":"a72978cf-3e52-4568-a3bf-f2f584ccf7c9","year":2017},"citing_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T18:33:11.444523Z"},"links":{"citing_paper":"/paper/2502.10341"},"observation_digest":"sha256:a328aa47e86fc3c03bed01ddc84572de0fa702f2b2da86737dfd43143e844887","observation_id":"646b4827-2827-46cc-9686-7afd981065b9","resolution":{"observed_at":"2026-08-07T18:33:12.318618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:33:11.449953Z","title":"URL https:// aclanthology.org/Q19-1026/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T18:33:11.449953Z"},"links":{"citing_paper":"/paper/2502.10341"},"observation_digest":"sha256:b5638f6e60216b789b5c7c41547b202957b8445c6474e7b88f441a3335add4d5","observation_id":"02fee5e3-baa4-4c40-92e2-4b1cb5dcd8cd","resolution":{"observed_at":"2026-08-07T18:33:11.449953Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:33:11.401007Z","title":"cc/paper_files/paper/2020/file/ 1457c0d6bfcb4967418bfb8ac142f64a-Paper","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T18:33:11.401007Z"},"links":{"citing_paper":"/paper/2502.10341"},"observation_digest":"sha256:6f1606d993266384e47bad834f9cd771cac486e977a3da959093560d157cf5c7","observation_id":"d726c013-4abe-43f3-8154-1b681ae80423","resolution":{"observed_at":"2026-08-07T18:33:11.401007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05735","last_updated":"2025-04-21T03:50:23Z","snapshot_observed_at":"2026-07-06T19:47:34.320753Z","submitted_at":"2024-11-08T17:50:24Z","title":"Aioli: A Unified Optimization Framework for Language Model Data Mixing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05735","snapshot_observed_at":"2026-08-07T18:33:11.418220Z","title":"Mayee F Chen, Michael Y Hu, Nicholas Lourie, Kyunghyun Cho, and Christopher R ´e","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T18:33:11.418220Z"},"links":{"cited_paper":"/paper/2411.05735","citing_paper":"/paper/2502.10341"},"observation_digest":"sha256:0f84da81bbd1483b8420ab8fea43f7eb5abf38179dc4d11dcc50b40f2505832b","observation_id":"d340a5f6-606a-466f-8f80-8cb13afd8611","resolution":{"observed_at":"2026-08-07T18:33:11.418220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-07T18:33:11.439854Z","title":"Logan Engstrom, Axel Feldmann, and Aleksander Madry","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T18:33:11.439854Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2502.10341"},"observation_digest":"sha256:4c73f397faaef14bdfaf5900bd87dcc61049d88258647c77c71281f5d1c548c6","observation_id":"076bc090-612c-44cc-b2e4-af4914633ba5","resolution":{"observed_at":"2026-08-07T18:33:11.439854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:33:11.384059Z","title":"Viraat Aryabumi, Yixuan Su, Raymond Ma, Adrien Morisot, Ivan Zhang, Acyr Locatelli, Marzieh Fadaee, Ahmet ¨Ust¨un, and Sara Hooker","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T18:33:11.384059Z"},"links":{"citing_paper":"/paper/2502.10341"},"observation_digest":"sha256:d9e1d28c14f6dd52eb9696acfd25e6ba261e7a59e4244f2e36c67b7b75d7a10c","observation_id":"acd2400f-bc05-40c6-a669-d486643331c1","resolution":{"observed_at":"2026-08-07T18:33:11.384059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:33:11.503888Z","title":"Jiachen T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation","version":3},"reference_index":8856,"source":"pdf_text","source_observed_at":"2026-08-07T18:33:11.503888Z"},"links":{"citing_paper":"/paper/2502.10341"},"observation_digest":"sha256:ee20df75972c92aa2264bcb2615e2118e6b9c1041c69f4dccc756aeda4d2feba","observation_id":"c146308f-f995-41e4-9b5b-2399c90d482a","resolution":{"observed_at":"2026-08-07T18:33:11.503888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.10341","last_updated":"2025-07-16T07:09:29Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T18:25:04.873435Z","submitted_at":"2025-02-14T18:02:37Z","title":"Organize the Web: Constructing Domains Enhances Pre-Training Data Curation"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 18 inbound Pith citation observations for arXiv:2502.10341."}