{"as_of":"2026-08-07T06:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:309abd4980512fb61a28ae80072a7bf90c59d8b213e99b3cec745fb10bd8ab4e","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:59:52.253496Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.22250/citation-record","integrity":"/paper/2507.22250/integrity","json":"/paper/2507.22250/citation-record.json","paper":"/paper/2507.22250"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.11704","last_updated":"2024-08-06T22:37:06Z","snapshot_observed_at":"2026-08-01T16:04:10.873571Z","submitted_at":"2024-06-17T16:25:04Z","title":"Nemotron-4 340B Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11704","snapshot_observed_at":"2026-08-06T11:59:52.143341Z","title":"Nemotron-4 340b technical report.arXiv preprint arXiv:2406.11704,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.143341Z"},"links":{"cited_paper":"/paper/2406.11704","citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:01b618a5b82ed1a05b2120a506471459c2ce026d992bfc1eecc16da79db17f7b","observation_id":"b89c444b-297d-4afe-a89e-d9536ae460d4","resolution":{"observed_at":"2026-08-06T11:59:52.143341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16737","last_updated":"2024-10-07T19:37:10Z","snapshot_observed_at":"2026-08-05T14:38:11.927737Z","submitted_at":"2024-08-29T17:32:35Z","title":"Smaller, Weaker, Yet Better: Training LLM Reasoners via Compute-Optimal Sampling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16737","snapshot_observed_at":"2026-08-06T11:59:52.155662Z","title":"Hritik Bansal, Arian Hosseini, Rishabh Agarwal, Vinh Q Tran, and Mehran Kazemi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.155662Z"},"links":{"cited_paper":"/paper/2408.16737","citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:f9238f8b13a8f928400dd090ebabdf8e29e3da6b0979c34cf063402e1c0d89af","observation_id":"02dbe5b1-a4fd-4c6d-b02c-5a6e981c77c0","resolution":{"observed_at":"2026-08-06T11:59:52.155662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03476","last_updated":"2024-06-05T17:29:15Z","snapshot_observed_at":"2026-07-06T18:26:01.717861Z","submitted_at":"2024-06-05T17:29:15Z","title":"Does your data spark joy? Performance gains from domain upsampling at the end of training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03476","snapshot_observed_at":"2026-08-06T11:59:52.159243Z","title":"Does your data spark joy? performance gains from domain upsampling at the end of training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.159243Z"},"links":{"cited_paper":"/paper/2406.03476","citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:53eb46bfa38a0f8e05ac17f6a7e28714644109fa50532df2288bb0539ccb8fed","observation_id":"7f6c5223-f9ce-42a6-b4ba-59cf61fbcb53","resolution":{"observed_at":"2026-08-06T11:59:52.159243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09530","last_updated":"2024-07-25T03:08:18Z","snapshot_observed_at":"2026-08-04T15:46:28.843449Z","submitted_at":"2023-09-18T07:17:52Z","title":"Adapting Large Language Models to Domains via Reading Comprehension","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.09530","snapshot_observed_at":"2026-08-06T11:59:52.170050Z","title":"Adapting large language models to domains via reading comprehension.arXiv preprint arXiv:2309.09530,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.170050Z"},"links":{"cited_paper":"/paper/2309.09530","citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:6ec6d925b488e6fc11c3f475c23695fdd23e202060f92df6a6bec9d89bc52a96","observation_id":"3a768c44-459e-44ac-b5f3-ef59d77b3083","resolution":{"observed_at":"2026-08-06T11:59:52.170050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T11:59:52.176891Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.176891Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:3b29297d663a44084badb892947f6da8128e85d65752263e1070b9da9b28a97c","observation_id":"5a60c380-0052-4dfe-843a-a1bd50bc5f5b","resolution":{"observed_at":"2026-08-06T11:59:52.176891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17425","last_updated":"2023-11-06T02:47:51Z","snapshot_observed_at":"2026-07-06T16:25:38.571377Z","submitted_at":"2023-09-29T17:37:29Z","title":"Data Filtering Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17425","snapshot_observed_at":"2026-08-06T11:59:52.179703Z","title":"Data filtering networks.arXiv preprint arXiv:2309.17425,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.179703Z"},"links":{"cited_paper":"/paper/2309.17425","citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:5c83b5d034ce873a66678d458dbfcebbed49cb8581ad8b312f4567881f127f18","observation_id":"abc81ed8-9caa-4b79-8a7e-819ee77b1f01","resolution":{"observed_at":"2026-08-06T11:59:52.179703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:59:52.182429Z","title":"Paolo Glorioso, Quentin Anthony, Yury Tokpanov, James Whittington, Jonathan Pilault, Adam Ibrahim, and Beren Millidge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.182429Z"},"links":{"citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:060d3c7737c3aade7a07083380cbaef44337489f1d62ef64b265808da012e2fb","observation_id":"008bf5d2-e8fb-4668-9e55-502b98c6b04e","resolution":{"observed_at":"2026-08-06T11:59:52.182429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07647","last_updated":"2024-04-11T11:10:36Z","snapshot_observed_at":"2026-07-06T17:58:47.786948Z","submitted_at":"2024-04-11T11:10:36Z","title":"Why do small language models underperform? Studying Language Model Saturation via the Softmax Bottleneck","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07647","snapshot_observed_at":"2026-08-06T11:59:52.185886Z","title":"Why do small language models underperform? studying language model saturation via the softmax bottleneck.arXiv preprint arXiv:2404.07647,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.185886Z"},"links":{"cited_paper":"/paper/2404.07647","citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:b48cfce34d3f34fbea4638cfb593acdb5a36198be137a2a27600257f35ca988a","observation_id":"5827bea8-e2f5-4fc0-ac50-f3017293fa59","resolution":{"observed_at":"2026-08-06T11:59:52.185886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T11:59:52.188900Z","title":"Xu Guo and Han Yu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.188900Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:cb0591e96f7ff13ae871766aa65e4f9d1ee4303263765d9eaa2a49ba08f334d1","observation_id":"5fe2ea4d-b368-438d-9c34-eff553e03047","resolution":{"observed_at":"2026-08-06T11:59:52.188900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-06T11:59:52.191496Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.191496Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:4f83078a4cc5f5d9cad222e6d81ca5e36f1bbd320140d6d63297e4425abcb643","observation_id":"e357fd1e-b583-4fc4-b41d-8863f89cdc53","resolution":{"observed_at":"2026-08-06T11:59:52.191496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11820","last_updated":"2024-10-15T17:47:44Z","snapshot_observed_at":"2026-08-04T18:20:45.624958Z","submitted_at":"2024-10-15T17:47:44Z","title":"Adaptive Data Optimization: Dynamic Sample Selection with Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11820","snapshot_observed_at":"2026-08-06T11:59:52.195074Z","title":"Adaptive data optimization: Dynamic sample selection with scaling laws.arXiv preprint arXiv:2410.11820,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.195074Z"},"links":{"cited_paper":"/paper/2410.11820","citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:b2ba42a83ca9f0913c3c87a8fea784c352ec3acb7412d988785ac0ede5cdd00f","observation_id":"8e257326-75b0-4b0e-8204-617beb0d6ee4","resolution":{"observed_at":"2026-08-06T11:59:52.195074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T11:59:52.198222Z","title":"Scaling laws for neural language models.arXiv preprint arXiv:2001.08361,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.198222Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:aa122dbaa9f2bc60413c773845cfe2c99207cf5824b1810335a908a0112c1570","observation_id":"89d5f78d-2df8-44a9-9882-61348e07e846","resolution":{"observed_at":"2026-08-06T11:59:52.198222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14389","last_updated":"2023-05-26T13:46:47Z","snapshot_observed_at":"2026-08-05T00:03:29.142007Z","submitted_at":"2022-09-28T19:28:43Z","title":"Downstream Datasets Make Surprisingly Good Pretraining Corpora","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14389","snapshot_observed_at":"2026-08-06T11:59:52.201021Z","title":"Downstream datasets make surprisingly good pretraining corpora.arXiv preprint arXiv:2209.14389,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.201021Z"},"links":{"cited_paper":"/paper/2209.14389","citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:775f1ba68e975d4d15d8980e4c333a3af94a03d0845910780db2ff4da660442a","observation_id":"5ddd77f2-d528-43cb-b4dc-f5824a7ed1da","resolution":{"observed_at":"2026-08-06T11:59:52.201021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1510.03055","last_updated":"2016-06-10T22:03:28Z","snapshot_observed_at":"2026-07-06T04:32:42.614338Z","submitted_at":"2015-10-11T14:04:57Z","title":"A Diversity-Promoting Objective Function for Neural Conversation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.03055","snapshot_observed_at":"2026-08-06T11:59:52.204776Z","title":"com/ServiceNow/Fast-LLM","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.204776Z"},"links":{"cited_paper":"/paper/1510.03055","citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:408e0d5c0da40c6566c96eee4b7fa307d18ad668552c45115410f48dae950e9a","observation_id":"9a12fec1-1f79-4c10-8444-b4d7206b91b3","resolution":{"observed_at":"2026-08-06T11:59:52.204776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01492","last_updated":"2025-01-23T17:35:43Z","snapshot_observed_at":"2026-07-06T18:39:43.472708Z","submitted_at":"2024-07-01T17:31:03Z","title":"RegMix: Data Mixture as Regression for Language Model Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01492","snapshot_observed_at":"2026-08-06T11:59:52.211197Z","title":"Regmix: Data mixture as regression for language model pre-training.arXiv preprint arXiv:2407.01492, 2024b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.211197Z"},"links":{"cited_paper":"/paper/2407.01492","citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:01f7d7efe1991d3de9cd4c924b73d559db44503a19e32b48af68ef2823c16054","observation_id":"23b9081d-2131-494b-a5fd-80b5a08b5111","resolution":{"observed_at":"2026-08-06T11:59:52.211197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16380","last_updated":"2024-01-29T18:19:08Z","snapshot_observed_at":"2026-07-06T17:21:58.983048Z","submitted_at":"2024-01-29T18:19:08Z","title":"Rephrasing the Web: A Recipe for Compute and Data-Efficient Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16380","snapshot_observed_at":"2026-08-06T11:59:52.215099Z","title":"Pratyush Maini, Skyler Seto, He Bai, David Grangier, Yizhe Zhang, and Navdeep Jaitly","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.215099Z"},"links":{"cited_paper":"/paper/2401.16380","citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:a86f7257fa5b9c69403b6cc7956a2de3dfc563bfb2af1daa23f166ad642121b4","observation_id":"6119b7e9-03cc-420c-8198-ee7929aee534","resolution":{"observed_at":"2026-08-06T11:59:52.215099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02060","last_updated":"2025-03-03T01:25:46Z","snapshot_observed_at":"2026-07-29T16:11:06.082798Z","submitted_at":"2024-09-03T17:08:20Z","title":"OLMoE: Open Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02060","snapshot_observed_at":"2026-08-06T11:59:52.217911Z","title":"Clara Na, Ian Magnusson, Ananya Harsh Jha, Tom Sherborne, Emma Strubell, Jesse Dodge, and Pradeep Dasigi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.217911Z"},"links":{"cited_paper":"/paper/2409.02060","citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:207aebf59d84e7d6fc60dcfc1100d550afc9054a1f4c5fb9da96dee1c7bf6093","observation_id":"44c5a5b8-c283-45be-956f-065425973391","resolution":{"observed_at":"2026-08-06T11:59:52.217911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-07-06T20:15:22.511263Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-06T11:59:52.220699Z","title":"2 olmo 2 furious.arXiv preprint arXiv:2501.00656,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.220699Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:78615af784342928979afedac2e97c8a8dccbd0fdb383ea9e5a5077cd276b7f7","observation_id":"93cb03ac-6bab-406d-b554-468247dd7f54","resolution":{"observed_at":"2026-08-06T11:59:52.220699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06380","last_updated":"2024-10-19T16:51:38Z","snapshot_observed_at":"2026-07-06T18:43:22.614883Z","submitted_at":"2024-07-08T20:47:58Z","title":"Data, Data Everywhere: A Guide for Pretraining Dataset Construction","version":2},"cited_work":{"arxiv_id":"2407.06380","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.06380","snapshot_observed_at":"2026-08-06T11:59:52.329177Z","title":"Data, Data Everywhere: A Guide for Pretraining Dataset Construction","venue":"cs.CL","work_id":"ccdfcc03-3d99-4321-8b4e-8ee7fe0e95e0","year":2024},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.223959Z"},"links":{"cited_paper":"/paper/2407.06380","citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:700ca4327a7a51652bf5eef19802e4bfcc88e9b564ffec43cf92618375308550","observation_id":"0e3c9fc1-d6c2-4106-9c37-4bac7b08cd4a","resolution":{"observed_at":"2026-08-06T11:59:52.334238Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02054","last_updated":"2020-05-13T06:45:15Z","snapshot_observed_at":"2026-07-06T08:27:00.558613Z","submitted_at":"2019-10-04T17:29:39Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.02054","snapshot_observed_at":"2026-08-06T11:59:52.227860Z","title":"Rylan Schaeffer, Brando Miranda, and Sanmi Koyejo","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.227860Z"},"links":{"cited_paper":"/paper/1910.02054","citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:6d9edad9f85380688c33e5e4873269b58253fa1842047bc6dba0774879471fc9","observation_id":"32da7489-51d8-4fe6-8351-1654f7de2af6","resolution":{"observed_at":"2026-08-06T11:59:52.227860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T11:59:52.230921Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.230921Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:8298a9393c785aee060e5073f12d6a494fb3b7fa725aa6f4618214aea32f7d6e","observation_id":"6739f4ac-2bbc-4dc4-ac02-d695dcfdcde5","resolution":{"observed_at":"2026-08-06T11:59:52.230921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00159","last_updated":"2024-06-06T18:46:40Z","snapshot_observed_at":"2026-07-06T17:23:22.706195Z","submitted_at":"2024-01-31T20:29:50Z","title":"Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00159","snapshot_observed_at":"2026-08-06T11:59:52.235178Z","title":"Pe- ters, Abhilasha Ravichander, Kyle Richardson, Zejiang Shen, Emma Strubell, Nishant Subramani, Oyvind Tafjord, Pete Walsh, Luke Zettlemoyer, Noah A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.235178Z"},"links":{"cited_paper":"/paper/2402.00159","citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:e93badca373d5d125e247c59f67403c5edaa35ab51488b77cd27eb9fed129115","observation_id":"2a8aa4d1-3820-4d9f-9b86-27663c35ac52","resolution":{"observed_at":"2026-08-06T11:59:52.235178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T11:59:52.238055Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.238055Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:536123a17d6be5f0a55e9a7ad2f1ff907f3e031e0b995a3fbd9774d77f116e1b","observation_id":"183b2ff1-2632-41bc-b5af-4c1a8308a847","resolution":{"observed_at":"2026-08-06T11:59:52.238055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-08-06T11:59:52.240980Z","title":"Data mixing laws: Optimizing data mixtures by predicting language modeling performance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.240980Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:80f48c51b8151789dd4bf64320e43cf73f11afbd3ce734d2daf88c27978deac1","observation_id":"ef31d0b3-fa9a-46c8-b56c-d30b7e1a2402","resolution":{"observed_at":"2026-08-06T11:59:52.240980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:59:52.750450Z","title":"It is trained with AdamW (Loshchilov & Hutter, 2017), using a sequence length of 8192 tokens and 256 sequences par minibatch, for a total of 2.1M tokens","venue":null,"work_id":"ba14e465-0028-4523-a1e5-7830e3b36a19","year":2017},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.244309Z"},"links":{"citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:d3a1d42845cfc9c1ecf241a0389176df9aef9b4fe26a44b86ef9233ff59f1ae4","observation_id":"5b186594-ea56-4032-b466-0f044ac360ab","resolution":{"observed_at":"2026-08-06T11:59:52.754817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:59:52.740053Z","title":null,"venue":null,"work_id":"b1d19a0d-b8d6-4b26-a278-c08dba15a42f","year":2024},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.247321Z"},"links":{"citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:af7f78b149ecffc1dd3b9e7685b48820b6285c27c36c02d6b48f6b3fdacd56d1","observation_id":"dfef40b5-34fa-4761-8662-c3fc6d9859b2","resolution":{"observed_at":"2026-08-06T11:59:52.743284Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:59:52.728540Z","title":"We also conducted ablations on classifier training, comparing binary classification with regression and exploring up-sampling vs","venue":null,"work_id":"de76eb93-2c00-4876-b99e-91590e423dd9","year":2024},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.250088Z"},"links":{"citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:638554c13b90ea0f8e697f8920d9ced8762e1e8e1e2b84687623dbfa41796439","observation_id":"9451691a-d894-4242-85e4-8faa3b7bf930","resolution":{"observed_at":"2026-08-06T11:59:52.732655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:59:52.718255Z","title":"Question:","venue":null,"work_id":"5dceac5f-dd42-41fc-8de7-d54625e2fba3","year":2015},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.253496Z"},"links":{"citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:866b738285729519cc0ca88d57b47e3d61864fa0219e216af45311af9e524df7","observation_id":"b34aa0aa-8ecf-47b2-a85d-be46e000181d","resolution":{"observed_at":"2026-08-06T11:59:52.721221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:59:52.163085Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":1950,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.163085Z"},"links":{"citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:e5bc9b66d4ea14c3195e49b4de66b546d5ece192144464cdf2772c5973860c63","observation_id":"9dcf3fd6-4d6b-4227-a543-c3c799165923","resolution":{"observed_at":"2026-08-06T11:59:52.163085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08310","last_updated":"2024-08-15T17:59:30Z","snapshot_observed_at":"2026-07-06T19:01:15.196625Z","submitted_at":"2024-08-15T17:59:30Z","title":"ScalingFilter: Assessing Data Quality through Inverse Utilization of Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08310","snapshot_observed_at":"2026-08-06T11:59:52.208204Z","title":"Scaling- filter: Assessing data quality through inverse utilization of scaling laws.arXiv preprint arXiv:2408.08310, 2024b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.208204Z"},"links":{"cited_paper":"/paper/2408.08310","citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:6f7c97e55a06d5cabd240816a78c2e65ece7dd43c3a1ee79e03cb31e19018456","observation_id":"93e6082f-3a78-42ea-b405-969c83a9a2f7","resolution":{"observed_at":"2026-08-06T11:59:52.208204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03083","last_updated":"2024-10-04T02:07:17Z","snapshot_observed_at":"2026-07-06T19:27:25.061335Z","submitted_at":"2024-10-04T02:07:17Z","title":"Scaling Parameter-Constrained Language Models with Quality Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03083","snapshot_observed_at":"2026-08-06T11:59:52.166832Z","title":"Scaling parameter- constrained language models with quality data.arXiv preprint arXiv:2410.03083,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.166832Z"},"links":{"cited_paper":"/paper/2410.03083","citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:3ca7ac0155db9962e867398a40731cfd3bdf7dd0b48e41bb602c96fdf1c69624","observation_id":"f5b23fb9-4805-4d89-8d05-f9945896ddbb","resolution":{"observed_at":"2026-08-06T11:59:52.166832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14491","last_updated":"2024-11-28T06:51:20Z","snapshot_observed_at":"2026-07-06T18:34:24.078145Z","submitted_at":"2024-06-20T16:55:33Z","title":"Instruction Pre-Training: Language Models are Supervised Multitask Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14491","snapshot_observed_at":"2026-08-06T11:59:52.173406Z","title":"Instruction pre-training: Language models are supervised multitask learners.arXiv preprint arXiv:2406.14491,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.173406Z"},"links":{"cited_paper":"/paper/2406.14491","citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:2bf4720b72f329a4cb1d5b8bee65f395682680aed275bcc697b129dc05b0bb41","observation_id":"1750ef90-b37e-47b8-aae6-84a7d3c63dfc","resolution":{"observed_at":"2026-08-06T11:59:52.173406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12881","last_updated":"2025-04-25T03:14:33Z","snapshot_observed_at":"2026-07-06T19:34:51.296918Z","submitted_at":"2024-10-15T18:25:53Z","title":"MIND: Math Informed syNthetic Dialogues for Pretraining LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12881","snapshot_observed_at":"2026-08-06T11:59:52.151511Z","title":"Syeda Nahida Akter, Shrimai Prabhumoye, John Kamalu, Sanjeev Satheesh, Eric Nyberg, Mostofa Patwary, Mohammad Shoeybi, and Bryan Catanzaro","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.151511Z"},"links":{"cited_paper":"/paper/2410.12881","citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:579471e97b9592ec3de9cb9224dea611b00c97f1b6eb62aaa38a83b3949d30e3","observation_id":"13e3b9ac-5f4b-409c-9d2a-c78bebc28867","resolution":{"observed_at":"2026-08-06T11:59:52.151511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04425","last_updated":"2025-03-20T02:52:47Z","snapshot_observed_at":"2026-07-06T19:46:32.573870Z","submitted_at":"2024-11-07T04:38:29Z","title":"DELIFT: Data Efficient Language model Instruction Fine Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04425","snapshot_observed_at":"2026-08-06T11:59:52.147629Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T11:59:52.147629Z"},"links":{"cited_paper":"/paper/2411.04425","citing_paper":"/paper/2507.22250"},"observation_digest":"sha256:3605b722376457d17d75f843f5310bab524e2f36f25a05d4f50530dd60026b71","observation_id":"7cccc167-9e29-4ab5-bfb1-bc9ddb9eec1b","resolution":{"observed_at":"2026-08-06T11:59:52.147629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.22250","last_updated":"2025-07-29T21:56:45Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T11:59:51.689888Z","submitted_at":"2025-07-29T21:56:45Z","title":"Using Scaling Laws for Data Source Utility Estimation in Domain-Specific Pre-Training"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2507.22250."}