{"as_of":"2026-08-08T03:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4e9fb4a1e4e3862189eec7568d60d4e7cd9a9abc53bce65e6b9835e027715671","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T13:24:16.848373Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-25T06:12:37.854507Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T06:15:23.717436Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.00866","last_updated":"2026-06-24T09:23:10Z","snapshot_observed_at":"2026-08-07T02:52:46.945895Z","submitted_at":"2025-10-01T13:15:15Z","title":"Removing Noise, not Finding Gold: Quality Filtering for Large-Scale Pretraining","version":4},"cited_work":{"arxiv_id":"2510.00866","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.00866","snapshot_observed_at":"2026-06-24T01:14:22.399339Z","title":"Lucia Specia, Frédéric Blain, Marina Fomicheva, Chrysoula Zerva, Zhenhao Li, Vishrav Chaudhary, and André F","venue":null,"work_id":"15d55aa3-076e-41c4-ba8a-c09ddf8f2aac","year":null},"citing_paper":{"arxiv_id":"2605.23721","last_updated":"2026-05-21T08:59:11Z","snapshot_observed_at":"2026-08-02T03:03:59.081595Z","submitted_at":"2026-05-21T08:59:11Z","title":"Is a Document Educational or Just Wikipedia-Style? -- Pitfalls of Classifier-Based Quality Filtering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-25T06:12:37.854507Z"},"links":{"cited_paper":"/paper/2510.00866","citing_paper":"/paper/2605.23721"},"observation_digest":"sha256:e3f67e20697b36d7b03a820b6b3322071efe2b67d253ac71472f8ee00790bf75","observation_id":"19ae4bf0-f888-4d1c-a90d-f551d0120a32","resolution":{"observed_at":"2026-06-24T01:14:22.399339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2510.00866/citation-record","integrity":"/paper/2510.00866/integrity","json":"/paper/2510.00866/citation-record.json","paper":"/paper/2510.00866"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.16827","last_updated":"2024-08-02T17:59:31Z","snapshot_observed_at":"2026-08-03T03:15:21.035418Z","submitted_at":"2024-02-26T18:54:35Z","title":"A Survey on Data Selection for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16827","snapshot_observed_at":"2026-08-04T13:24:14.114391Z","title":"A survey on data selection for language models.arXiv preprint arXiv:2402.16827,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00866","last_updated":"2026-06-24T09:23:10Z","snapshot_observed_at":"2026-08-07T02:52:46.945895Z","submitted_at":"2025-10-01T13:15:15Z","title":"Removing Noise, not Finding Gold: Quality Filtering for Large-Scale Pretraining","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T13:24:14.114391Z"},"links":{"cited_paper":"/paper/2402.16827","citing_paper":"/paper/2510.00866"},"observation_digest":"sha256:6aad8d2961ffd3e8caef725f994b7274039e4a8a707085ba2a1e62fbbeb9eb61","observation_id":"132456d3-85e9-4405-ab8d-f5edfa56e199","resolution":{"observed_at":"2026-08-04T13:24:14.114391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:24:16.765132Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.00866","last_updated":"2026-06-24T09:23:10Z","snapshot_observed_at":"2026-08-07T02:52:46.945895Z","submitted_at":"2025-10-01T13:15:15Z","title":"Removing Noise, not Finding Gold: Quality Filtering for Large-Scale Pretraining","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T13:24:16.765132Z"},"links":{"citing_paper":"/paper/2510.00866"},"observation_digest":"sha256:72075ef8f90f3a490b633c8a68288ddd6db90f0a1ba2105dde87995b19ea8f00","observation_id":"5aa34b9d-a3a7-471e-98f3-d4ccc83a7a2e","resolution":{"observed_at":"2026-08-04T13:24:16.765132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.03651","last_updated":"2016-12-12T12:51:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-12-12T12:51:03Z","title":"FastText.zip: Compressing text classification models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.03651","snapshot_observed_at":"2026-08-04T13:24:15.097332Z","title":"Fasttext","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00866","last_updated":"2026-06-24T09:23:10Z","snapshot_observed_at":"2026-08-07T02:52:46.945895Z","submitted_at":"2025-10-01T13:15:15Z","title":"Removing Noise, not Finding Gold: Quality Filtering for Large-Scale Pretraining","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T13:24:15.097332Z"},"links":{"cited_paper":"/paper/1612.03651","citing_paper":"/paper/2510.00866"},"observation_digest":"sha256:457e2e34c659cd0671c4b519a2785dfeaf7832aba3cf7456457ad371c071c2a4","observation_id":"e873b667-efa3-4f07-8a8d-a2c6da1c2163","resolution":{"observed_at":"2026-08-04T13:24:15.097332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:24:15.294758Z","title":"Smith, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.00866","last_updated":"2026-06-24T09:23:10Z","snapshot_observed_at":"2026-08-07T02:52:46.945895Z","submitted_at":"2025-10-01T13:15:15Z","title":"Removing Noise, not Finding Gold: Quality Filtering for Large-Scale Pretraining","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T13:24:15.294758Z"},"links":{"citing_paper":"/paper/2510.00866"},"observation_digest":"sha256:64fcc3e83409d2a032cb4e6a8486d91ea6a195272535ddd2d43cdd91b0131faa","observation_id":"d03ef3e1-bbea-455b-bd8c-c8227eb799cc","resolution":{"observed_at":"2026-08-04T13:24:15.294758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:24:16.644460Z","title":"We show in Figure 12 the result of such experiments, averaged across 3 runs","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.00866","last_updated":"2026-06-24T09:23:10Z","snapshot_observed_at":"2026-08-07T02:52:46.945895Z","submitted_at":"2025-10-01T13:15:15Z","title":"Removing Noise, not Finding Gold: Quality Filtering for Large-Scale Pretraining","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T13:24:16.644460Z"},"links":{"citing_paper":"/paper/2510.00866"},"observation_digest":"sha256:6dfa5bfcf1a2973f8b4cf234a21f665aeffbc53daf89e3259db21699dc1bb9f7","observation_id":"2b6baefb-99bc-41d4-a233-445ea04bbc62","resolution":{"observed_at":"2026-08-04T13:24:16.644460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:24:15.423969Z","title":"A pretrainer’s guide to training data: Measuring the effects of data age, domain coverage, quality, & toxicity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.00866","last_updated":"2026-06-24T09:23:10Z","snapshot_observed_at":"2026-08-07T02:52:46.945895Z","submitted_at":"2025-10-01T13:15:15Z","title":"Removing Noise, not Finding Gold: Quality Filtering for Large-Scale Pretraining","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T13:24:15.423969Z"},"links":{"citing_paper":"/paper/2510.00866"},"observation_digest":"sha256:41836f9ed2f33c06c80a1e2de07e5089ad17c8e8e2fec369df9c270ee9a1ec83","observation_id":"45c7981b-2cbe-443f-b2ef-11f119f87ab2","resolution":{"observed_at":"2026-08-04T13:24:15.423969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05374","last_updated":"2024-05-08T19:05:18Z","snapshot_observed_at":"2026-07-06T18:11:48.858911Z","submitted_at":"2024-05-08T19:05:18Z","title":"Arctic-Embed: Scalable, Efficient, and Accurate Text Embedding Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05374","snapshot_observed_at":"2026-08-04T13:24:15.511639Z","title":"Arctic-embed: Scalable, efficient, and accurate text embedding models.arXiv preprint arXiv:2405.05374,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00866","last_updated":"2026-06-24T09:23:10Z","snapshot_observed_at":"2026-08-07T02:52:46.945895Z","submitted_at":"2025-10-01T13:15:15Z","title":"Removing Noise, not Finding Gold: Quality Filtering for Large-Scale Pretraining","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T13:24:15.511639Z"},"links":{"cited_paper":"/paper/2405.05374","citing_paper":"/paper/2510.00866"},"observation_digest":"sha256:b635010c4e8d4ee7bec357d479d1bf486bd180131df0af9e4d2fd930bf1478e0","observation_id":"c67621af-dfe5-45fb-938b-2407d5a6dbaf","resolution":{"observed_at":"2026-08-04T13:24:15.511639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12466","last_updated":"2025-07-16T17:59:45Z","snapshot_observed_at":"2026-08-07T10:43:47.278118Z","submitted_at":"2025-07-16T17:59:45Z","title":"Language Models Improve When Pretraining Data Matches Target Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12466","snapshot_observed_at":"2026-08-04T13:24:15.661029Z","title":"Language models improve when pretraining data matches target tasks.arXiv preprint arXiv:2507.12466,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00866","last_updated":"2026-06-24T09:23:10Z","snapshot_observed_at":"2026-08-07T02:52:46.945895Z","submitted_at":"2025-10-01T13:15:15Z","title":"Removing Noise, not Finding Gold: Quality Filtering for Large-Scale Pretraining","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T13:24:15.661029Z"},"links":{"cited_paper":"/paper/2507.12466","citing_paper":"/paper/2510.00866"},"observation_digest":"sha256:48360303ba20b6f04685a30fee0a26953e81961fb55b45391047912d3bb56c7b","observation_id":"c469e8c4-8146-4eac-b3bb-a10c2979fd45","resolution":{"observed_at":"2026-08-04T13:24:15.661029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:24:15.833846Z","title":"Scaling laws for optimal data mixtures.arXiv preprint arXiv:2507.09404,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00866","last_updated":"2026-06-24T09:23:10Z","snapshot_observed_at":"2026-08-07T02:52:46.945895Z","submitted_at":"2025-10-01T13:15:15Z","title":"Removing Noise, not Finding Gold: Quality Filtering for Large-Scale Pretraining","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T13:24:15.833846Z"},"links":{"citing_paper":"/paper/2510.00866"},"observation_digest":"sha256:f541bca12796169153d1df2b3a415fcdf504282432a8c82621d807e4e185707c","observation_id":"112cd137-9539-461b-a0ea-ebfd127493e6","resolution":{"observed_at":"2026-08-04T13:24:15.833846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-04T13:24:15.918187Z","title":"co/datasets/teknium/OpenHermes-2.5","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00866","last_updated":"2026-06-24T09:23:10Z","snapshot_observed_at":"2026-08-07T02:52:46.945895Z","submitted_at":"2025-10-01T13:15:15Z","title":"Removing Noise, not Finding Gold: Quality Filtering for Large-Scale Pretraining","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T13:24:15.918187Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2510.00866"},"observation_digest":"sha256:feb506532acbf230c11cdd786ae16226b671d5e1ef7ac85cd3a11831cb476373","observation_id":"709deb01-6701-4b24-bdb9-b2d617919c4c","resolution":{"observed_at":"2026-08-04T13:24:15.918187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.10959","last_updated":"2020-02-24T23:25:50Z","snapshot_observed_at":"2026-07-06T07:17:20.813296Z","submitted_at":"2018-11-27T13:17:45Z","title":"Dataset Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.10959","snapshot_observed_at":"2026-08-04T13:24:16.003251Z","title":"Dataset distillation.arXiv preprint arXiv:1811.10959,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00866","last_updated":"2026-06-24T09:23:10Z","snapshot_observed_at":"2026-08-07T02:52:46.945895Z","submitted_at":"2025-10-01T13:15:15Z","title":"Removing Noise, not Finding Gold: Quality Filtering for Large-Scale Pretraining","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T13:24:16.003251Z"},"links":{"cited_paper":"/paper/1811.10959","citing_paper":"/paper/2510.00866"},"observation_digest":"sha256:2df5a8bf07cd518f193473adaa3121558e506fa59360d2dcd4203c3226116f28","observation_id":"921ee0b3-5867-4f66-8493-f4513abe37fd","resolution":{"observed_at":"2026-08-04T13:24:16.003251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:24:16.848373Z","title":"This aligns with recent concurrent work from Mizrahi et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.00866","last_updated":"2026-06-24T09:23:10Z","snapshot_observed_at":"2026-08-07T02:52:46.945895Z","submitted_at":"2025-10-01T13:15:15Z","title":"Removing Noise, not Finding Gold: Quality Filtering for Large-Scale Pretraining","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T13:24:16.848373Z"},"links":{"citing_paper":"/paper/2510.00866"},"observation_digest":"sha256:81505eb3a9f70b708348606714f3bff382c58d32f4680abb6a896b315cdd53c5","observation_id":"7be026f3-352a-46e8-9251-8928f11befc5","resolution":{"observed_at":"2026-08-04T13:24:16.848373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:24:16.275381Z","title":"Challenges in detoxifying language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.00866","last_updated":"2026-06-24T09:23:10Z","snapshot_observed_at":"2026-08-07T02:52:46.945895Z","submitted_at":"2025-10-01T13:15:15Z","title":"Removing Noise, not Finding Gold: Quality Filtering for Large-Scale Pretraining","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T13:24:16.275381Z"},"links":{"citing_paper":"/paper/2510.00866"},"observation_digest":"sha256:6c873c039714623178490a017937583b3837b4801324eb1473b768aa11ea131f","observation_id":"b0906d0a-d16e-4ec4-8e4c-d10d13caeb6d","resolution":{"observed_at":"2026-08-04T13:24:16.275381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14194","last_updated":"2025-08-06T15:34:10Z","snapshot_observed_at":"2026-08-07T16:00:57.924743Z","submitted_at":"2025-04-19T06:12:33Z","title":"Meta-rater: A Multi-dimensional Data Selection Method for Pre-training Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14194","snapshot_observed_at":"2026-08-04T13:24:16.399318Z","title":"12 Xinlin Zhuang, Jiahui Peng, Ren Ma, Yinfan Wang, Tianyi Bai, Xingjian Wei, Jiantao Qiu, Chi Zhang, Ying Qian, and Conghui He","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00866","last_updated":"2026-06-24T09:23:10Z","snapshot_observed_at":"2026-08-07T02:52:46.945895Z","submitted_at":"2025-10-01T13:15:15Z","title":"Removing Noise, not Finding Gold: Quality Filtering for Large-Scale Pretraining","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T13:24:16.399318Z"},"links":{"cited_paper":"/paper/2504.14194","citing_paper":"/paper/2510.00866"},"observation_digest":"sha256:67170c35158841635592662d6e7afc770dabefcd5372b6846307dd8709efc0f0","observation_id":"9496160c-eb4d-48cd-9cfc-274fa04b2015","resolution":{"observed_at":"2026-08-04T13:24:16.399318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:24:16.520246Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.00866","last_updated":"2026-06-24T09:23:10Z","snapshot_observed_at":"2026-08-07T02:52:46.945895Z","submitted_at":"2025-10-01T13:15:15Z","title":"Removing Noise, not Finding Gold: Quality Filtering for Large-Scale Pretraining","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T13:24:16.520246Z"},"links":{"citing_paper":"/paper/2510.00866"},"observation_digest":"sha256:9bfc58e1d74e9b0c4ad94ef6021aa2eb7f9c4813b92e8a90eb14038a003361de","observation_id":"1afdabb6-49b3-4dd5-9f2b-d02976ddb773","resolution":{"observed_at":"2026-08-04T13:24:16.520246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:24:14.274285Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2510.00866","last_updated":"2026-06-24T09:23:10Z","snapshot_observed_at":"2026-08-07T02:52:46.945895Z","submitted_at":"2025-10-01T13:15:15Z","title":"Removing Noise, not Finding Gold: Quality Filtering for Large-Scale Pretraining","version":4},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-04T13:24:14.274285Z"},"links":{"citing_paper":"/paper/2510.00866"},"observation_digest":"sha256:957d993c3d52ff5717b59501bca2b7317a6dcfd83d0fb464707f247b388ad80f","observation_id":"abef4e02-24e7-41b9-9b18-f3a8134dab3e","resolution":{"observed_at":"2026-08-04T13:24:14.274285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06416","last_updated":"2024-08-02T21:59:03Z","snapshot_observed_at":"2026-08-06T22:39:32.732778Z","submitted_at":"2024-01-12T07:24:26Z","title":"Mission: Impossible Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06416","snapshot_observed_at":"2026-08-04T13:24:15.278209Z","title":"Mission: Impossible language models.arXiv preprint arXiv:2401.06416,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00866","last_updated":"2026-06-24T09:23:10Z","snapshot_observed_at":"2026-08-07T02:52:46.945895Z","submitted_at":"2025-10-01T13:15:15Z","title":"Removing Noise, not Finding Gold: Quality Filtering for Large-Scale Pretraining","version":4},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-04T13:24:15.278209Z"},"links":{"cited_paper":"/paper/2401.06416","citing_paper":"/paper/2510.00866"},"observation_digest":"sha256:5b4490d5e751d32998651c14bafedead08bd5366e44a91fea68995a4ca0394c2","observation_id":"26dbe4ed-f434-47e7-9f17-8ffccf83c58d","resolution":{"observed_at":"2026-08-04T13:24:15.278209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05427","last_updated":"2025-05-08T17:15:20Z","snapshot_observed_at":"2026-08-07T15:48:42.585684Z","submitted_at":"2025-05-08T17:15:20Z","title":"Ultra-FineWeb: Efficient Data Filtering and Verification for High-Quality LLM Training Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05427","snapshot_observed_at":"2026-08-04T13:24:16.160727Z","title":"Ultra-fineweb: Efficient data filtering and verification for high-quality llm training data.arXiv preprint arXiv:2505.05427,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00866","last_updated":"2026-06-24T09:23:10Z","snapshot_observed_at":"2026-08-07T02:52:46.945895Z","submitted_at":"2025-10-01T13:15:15Z","title":"Removing Noise, not Finding Gold: Quality Filtering for Large-Scale Pretraining","version":4},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-04T13:24:16.160727Z"},"links":{"cited_paper":"/paper/2505.05427","citing_paper":"/paper/2510.00866"},"observation_digest":"sha256:b4e4592e7ca53b23b3bfc62a8d1fdfcdc8d981abe41c033caae81acb2cac2891","observation_id":"3db8573d-6eb0-40f1-b40f-771b4457ad11","resolution":{"observed_at":"2026-08-04T13:24:16.160727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14624","last_updated":"2025-05-24T06:22:30Z","snapshot_observed_at":"2026-08-06T17:26:05.511665Z","submitted_at":"2024-01-26T03:38:23Z","title":"Unearthing Large Scale Domain-Specific Knowledge from Public Corpora","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14624","snapshot_observed_at":"2026-08-04T13:24:14.696044Z","title":"URL https://doi.org/10.18653/v1/p19-1346","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00866","last_updated":"2026-06-24T09:23:10Z","snapshot_observed_at":"2026-08-07T02:52:46.945895Z","submitted_at":"2025-10-01T13:15:15Z","title":"Removing Noise, not Finding Gold: Quality Filtering for Large-Scale Pretraining","version":4},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T13:24:14.696044Z"},"links":{"cited_paper":"/paper/2401.14624","citing_paper":"/paper/2510.00866"},"observation_digest":"sha256:b2b7015d9880c21ac4185ca16c62b5e1a5cc3ad57c9e59a17da68aa05a0ad9a1","observation_id":"2100c74a-0bdc-469c-bb34-7a4b140d3968","resolution":{"observed_at":"2026-08-04T13:24:14.696044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-04T13:24:14.969870Z","title":"Training compute-optimal large language models.arXiv preprint arXiv:2203.15556,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00866","last_updated":"2026-06-24T09:23:10Z","snapshot_observed_at":"2026-08-07T02:52:46.945895Z","submitted_at":"2025-10-01T13:15:15Z","title":"Removing Noise, not Finding Gold: Quality Filtering for Large-Scale Pretraining","version":4},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T13:24:14.969870Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2510.00866"},"observation_digest":"sha256:d5172b3dfe8c25f0883cb2022ede282d0b7f3fff27263473a100346959de2e79","observation_id":"4c14b2b2-1f5f-4504-ade3-1711f2c7577f","resolution":{"observed_at":"2026-08-04T13:24:14.969870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:24:14.595837Z","title":"ELI5: long form question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.00866","last_updated":"2026-06-24T09:23:10Z","snapshot_observed_at":"2026-08-07T02:52:46.945895Z","submitted_at":"2025-10-01T13:15:15Z","title":"Removing Noise, not Finding Gold: Quality Filtering for Large-Scale Pretraining","version":4},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T13:24:14.595837Z"},"links":{"citing_paper":"/paper/2510.00866"},"observation_digest":"sha256:e8ac8b7260061227fe4dba1baf241084e61fd0da20fc31c98115283ffe286f24","observation_id":"6c0ce1d4-043a-4b9a-98fa-32ed34c99681","resolution":{"observed_at":"2026-08-04T13:24:14.595837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-04T13:24:14.412123Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge.arXiv:1803.05457v1,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00866","last_updated":"2026-06-24T09:23:10Z","snapshot_observed_at":"2026-08-07T02:52:46.945895Z","submitted_at":"2025-10-01T13:15:15Z","title":"Removing Noise, not Finding Gold: Quality Filtering for Large-Scale Pretraining","version":4},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T13:24:14.412123Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2510.00866"},"observation_digest":"sha256:3557433d35215a9212a44947887b1d84bbd0378c660952ff21cb01689db6d541","observation_id":"290c9267-7cf4-468f-bf7e-8f1d673c9722","resolution":{"observed_at":"2026-08-04T13:24:14.412123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03735","last_updated":"2025-03-11T00:20:30Z","snapshot_observed_at":"2026-08-01T06:32:48.110512Z","submitted_at":"2024-09-30T20:49:54Z","title":"Task-Adaptive Pretrained Language Models via Clustered-Importance Sampling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03735","snapshot_observed_at":"2026-08-04T13:24:14.800183Z","title":"Task-adaptive pretrained language models via clustered- importance sampling.arXiv preprint arXiv:2410.03735,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00866","last_updated":"2026-06-24T09:23:10Z","snapshot_observed_at":"2026-08-07T02:52:46.945895Z","submitted_at":"2025-10-01T13:15:15Z","title":"Removing Noise, not Finding Gold: Quality Filtering for Large-Scale Pretraining","version":4},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T13:24:14.800183Z"},"links":{"cited_paper":"/paper/2410.03735","citing_paper":"/paper/2510.00866"},"observation_digest":"sha256:f5a084ccf93cd17f9000220fd0a82979e83552d4e47564ca9b416a042a814b7f","observation_id":"c1f66cfd-4456-4ec6-a630-ddb72b9ecda1","resolution":{"observed_at":"2026-08-04T13:24:14.800183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T13:24:15.305088Z","title":"Jeffrey Li, Alex Fang, Georgios Smyrnis, Maor Ivgi, Matt Jordan, Samir Yitzhak Gadre, Hritik Bansal, Etash Guha, Sedrick Scott Keh, Kushal Arora, et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.00866","last_updated":"2026-06-24T09:23:10Z","snapshot_observed_at":"2026-08-07T02:52:46.945895Z","submitted_at":"2025-10-01T13:15:15Z","title":"Removing Noise, not Finding Gold: Quality Filtering for Large-Scale Pretraining","version":4},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T13:24:15.305088Z"},"links":{"citing_paper":"/paper/2510.00866"},"observation_digest":"sha256:e59821674bf8c2a5e7ae2fad085a9cbbadf09d39a8bcbe1bbd6cd45e421bfae5","observation_id":"abfd3374-d66b-4140-9050-a5b30258c00f","resolution":{"observed_at":"2026-08-04T13:24:15.305088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.00866","last_updated":"2026-06-24T09:23:10Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T02:52:46.945895Z","submitted_at":"2025-10-01T13:15:15Z","title":"Removing Noise, not Finding Gold: Quality Filtering for Large-Scale Pretraining"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 1 inbound Pith citation observation for arXiv:2510.00866."}