{"as_of":"2026-08-22T12:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ee8342a63760a1a080dcbeb3cf5ef29aef7a664e9f70f1600e24646f51dc4304","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T07:01:47.361651Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.24717/citation-record","integrity":"/paper/2607.24717/integrity","json":"/paper/2607.24717/citation-record.json","paper":"/paper/2607.24717"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:43.227380Z","title":"ICLR 2024 Workshop on Mathematical and Empirical Understanding of Foundation Models , year=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:43.227380Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:05d67e6b1faaa7749e72eaedec0884e3e333fd37ba7b6887508867cf0f48f2bc","observation_id":"7063742d-f5c8-4865-8072-7a2c1700aa84","resolution":{"observed_at":"2026-07-31T07:01:43.227380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.11978","last_updated":"2026-05-12T11:33:49Z","snapshot_observed_at":"2026-08-06T06:39:58.243303Z","submitted_at":"2026-05-12T11:33:49Z","title":"On Predicting the Post-training Potential of Pre-trained LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.11978","snapshot_observed_at":"2026-07-31T07:01:43.334745Z","title":"arXiv preprint arXiv:2605.11978 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:43.334745Z"},"links":{"cited_paper":"/paper/2605.11978","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:7f713932fdf73fcc5b4091321af2fe8e7b023f24b04c4c3bfc1a80543d96b97c","observation_id":"630f76ed-d895-4fb0-947b-3679231b8240","resolution":{"observed_at":"2026-07-31T07:01:43.334745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-07-31T07:01:43.454738Z","title":"arXiv preprint arXiv:2502.03387 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:43.454738Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:8189ed494fbc8a2174b808528a37d5e9148dc570edda87b8da5a44b77d6a151b","observation_id":"4779eb43-4ffb-4ea7-9ce6-0a88612eea22","resolution":{"observed_at":"2026-07-31T07:01:43.454738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-22T04:29:21.714775Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-07-31T07:01:43.604779Z","title":"arXiv preprint arXiv:2506.20512 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:43.604779Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:f3fcddc71a49507fd2625b980efc9d4aa751753504dda872774d6bd37aef958f","observation_id":"a4ace8ce-f77b-4adc-84fb-f20c7b127fc1","resolution":{"observed_at":"2026-07-31T07:01:43.604779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-08-13T11:19:55.436754Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11644","snapshot_observed_at":"2026-07-31T07:01:43.737198Z","title":"arXiv preprint arXiv:2306.11644 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:43.737198Z"},"links":{"cited_paper":"/paper/2306.11644","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:0fc04f0db06a73c6586facd7e2157d28fa6001a258e9b6b0ce90ca9fe48697a4","observation_id":"b5784438-b86a-4b09-a193-3b2be2f029e2","resolution":{"observed_at":"2026-07-31T07:01:43.737198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:43.854740Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:43.854740Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:d7119cd4bf8f7f41eb63d0ec6c88cb99e26bf3830b2d429b0beab0f6f607c80a","observation_id":"8a789522-5a65-4b00-a581-6847d7ec6af7","resolution":{"observed_at":"2026-07-31T07:01:43.854740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:43.958478Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:43.958478Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:a6ade6b7793065d7b4e11a36cc8044fcaac685af07705115e81d9be06c92fbd3","observation_id":"fb6bad71-d6c0-44e5-8451-fc2003fb3fe2","resolution":{"observed_at":"2026-07-31T07:01:43.958478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:44.095709Z","title":"Journal of machine learning research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:44.095709Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:0c2690083e2907f3f9fe3ebf9dc2f4e70040d09be86fa44d1c4900712bdd5ed2","observation_id":"44f65781-dbbc-4f39-bd80-10368fe3b096","resolution":{"observed_at":"2026-07-31T07:01:44.095709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-08-09T14:52:01.161814Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-07-31T07:01:44.212028Z","title":"arXiv preprint arXiv:2112.11446 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:44.212028Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:7184cea7915fdb852f24a7123d0aa93c65fdbb4a244cac106390777dfbd4842e","observation_id":"e1a0dbf8-d065-49c9-a6ad-8244e8b6e5d2","resolution":{"observed_at":"2026-07-31T07:01:44.212028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09739","last_updated":"2024-07-17T20:50:11Z","snapshot_observed_at":"2026-08-16T14:18:25.426536Z","submitted_at":"2024-02-15T06:36:07Z","title":"QuRating: Selecting High-Quality Data for Training Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09739","snapshot_observed_at":"2026-07-31T07:01:44.329991Z","title":"arXiv preprint arXiv:2402.09739 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:44.329991Z"},"links":{"cited_paper":"/paper/2402.09739","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:58479cd70a2d30a671a4ba113cd12d6a3be8a202ab395c34c75109687c740774","observation_id":"4b8f4a6c-9809-4b7a-b3b9-2834d9d097df","resolution":{"observed_at":"2026-07-31T07:01:44.329991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19363","last_updated":"2025-04-08T03:21:10Z","snapshot_observed_at":"2026-08-16T12:54:55.256775Z","submitted_at":"2025-02-26T18:01:19Z","title":"DataMan: Data Manager for Pre-training Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19363","snapshot_observed_at":"2026-07-31T07:01:44.467361Z","title":"arXiv preprint arXiv:2502.19363 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:44.467361Z"},"links":{"cited_paper":"/paper/2502.19363","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:84edd8564353e5ff292829a483cc160a150104db322fae08f9e14ac83825c737","observation_id":"f330828e-33a2-4a13-afb0-420415f3b2fb","resolution":{"observed_at":"2026-07-31T07:01:44.467361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:44.567089Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:44.567089Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:121f8177c22bc8c57b181fddb0258f3240cba4a5478aa05d30a42e6a84649878","observation_id":"b6282658-8568-4c56-a1e8-239b5880d0e1","resolution":{"observed_at":"2026-07-31T07:01:44.567089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17115","last_updated":"2025-02-14T16:44:08Z","snapshot_observed_at":"2026-08-19T02:57:02.168884Z","submitted_at":"2024-09-25T17:28:13Z","title":"Programming Every Example: Lifting Pre-training Data Quality Like Experts at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17115","snapshot_observed_at":"2026-07-31T07:01:44.734751Z","title":"arXiv preprint arXiv:2409.17115 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:44.734751Z"},"links":{"cited_paper":"/paper/2409.17115","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:e7ea1f25d225ff6383355276d0fe7485cf044062bf165519fc72366ae712b0a5","observation_id":"ca7f1222-afe8-45c4-9b9a-074c1bc0d12b","resolution":{"observed_at":"2026-07-31T07:01:44.734751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.03253","last_updated":"2025-07-08T18:15:09Z","snapshot_observed_at":"2026-08-19T09:42:38.921686Z","submitted_at":"2025-07-04T02:19:58Z","title":"RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.03253","snapshot_observed_at":"2026-07-31T07:01:44.900291Z","title":"arXiv preprint arXiv:2507.03253 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:44.900291Z"},"links":{"cited_paper":"/paper/2507.03253","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:fb42ac6810e3e70718c6e2b604139c5b53a09b8c2a9067e56463a81a65e63892","observation_id":"4168c4a2-291d-43a3-a6fd-acef3dc18f4c","resolution":{"observed_at":"2026-07-31T07:01:44.900291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:45.003200Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:45.003200Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:41669a0ca43bf9400419c405be5283b8172842d71c731c9a292d3d11b0b6a136","observation_id":"dd7ea6f9-6d29-4753-b3e3-630d2d0c9a76","resolution":{"observed_at":"2026-07-31T07:01:45.003200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:45.093322Z","title":"arXiv preprint arXiv:2506.04689 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:45.093322Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:244b1af72a3bb00f531cbe95a8a745c5e7538f069e333659655282baa63fc349","observation_id":"17ded2e0-308c-48a0-acc9-b8875945b85f","resolution":{"observed_at":"2026-07-31T07:01:45.093322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:45.209641Z","title":"arXiv preprint arXiv:2510.10681 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:45.209641Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:330b9e2c0466a1551ee2af787a97f1b503a9811e6854e8ac681da30c243b4049","observation_id":"18234a37-12aa-485f-95ad-aedf7c825475","resolution":{"observed_at":"2026-07-31T07:01:45.209641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-08-16T14:37:33.548231Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-07-31T07:01:45.363672Z","title":"arXiv preprint arXiv:2507.20534 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:45.363672Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:2656e1784144b6adf2a2899488bdcb148255fffb68135b4a297904fd2e08b51d","observation_id":"e6c96249-557b-4ed9-864e-ba052067a72d","resolution":{"observed_at":"2026-07-31T07:01:45.363672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:45.511360Z","title":"arXiv preprint arXiv:2505.02881 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:45.511360Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:237757a459441e5ec641a9c3f5f20e5afe35ba45e05dcb53c21fe138e2270d88","observation_id":"b5c071f4-5b56-48f7-8bba-5fe32bac98de","resolution":{"observed_at":"2026-07-31T07:01:45.511360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:45.588847Z","title":"arXiv preprint arXiv:2602.07824 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:45.588847Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:e9e24fac89c87b8acf765e4250a74cd7fb8e204664ae96be93523d320d6351c6","observation_id":"bedb66dd-dbe4-4d59-93dd-1036f62232a2","resolution":{"observed_at":"2026-07-31T07:01:45.588847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-31T07:01:45.721994Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:45.721994Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:ba1c1cd8886b02971348b45d6248c2b44a81fdc94300a5879143f0f349c362a5","observation_id":"255a0f43-b781-44d0-b116-9536097aa2a3","resolution":{"observed_at":"2026-07-31T07:01:45.721994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-07-31T07:01:45.773443Z","title":"arXiv preprint arXiv:2602.15763 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:45.773443Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:5a8b15274f3c3743cac65b88e6d7a152263ab6c1d4305600fb07e1579b16de7f","observation_id":"3cf575d3-37e3-4763-b23b-35b2d7199c6d","resolution":{"observed_at":"2026-07-31T07:01:45.773443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:45.778047Z","title":"arXiv preprint arXiv:2603.14420 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:45.778047Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:d86f6abe5992271c3dd8607d47c051a9fdeb18b1d4c02bd61bd2cfb610562d5f","observation_id":"55a53b96-510a-4370-8fab-9b2de3e1b154","resolution":{"observed_at":"2026-07-31T07:01:45.778047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:45.782350Z","title":"ACM Transactions on Information Systems , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:45.782350Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:feeaa59f518225b4242e6647636dd3746375f19cca2d6818008d3800c231d628","observation_id":"faf50abd-7844-42f4-a011-41420b962563","resolution":{"observed_at":"2026-07-31T07:01:45.782350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13977","last_updated":"2026-07-30T11:53:22Z","snapshot_observed_at":"2026-08-13T16:40:26.620615Z","submitted_at":"2026-04-15T15:24:59Z","title":"How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13977","snapshot_observed_at":"2026-07-31T07:01:45.787747Z","title":"arXiv preprint arXiv:2604.13977 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:45.787747Z"},"links":{"cited_paper":"/paper/2604.13977","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:814968114351d8c5a33f0b1ec72f4c21623705e9d1e905510ba5c1231845ff4c","observation_id":"b6e24112-4dd5-4c61-bb1a-abd92d99e6d9","resolution":{"observed_at":"2026-07-31T07:01:45.787747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:45.792084Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:45.792084Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:b4cf79724b870f754424e1a405b703528cca17c2c349f872b61e2ca989c5b141","observation_id":"e2a63dc0-f869-4ccb-9edc-cc87c89f1fb1","resolution":{"observed_at":"2026-07-31T07:01:45.792084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:45.796593Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:45.796593Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:d22b06c7da56eefb359d5dc24e218c7214ed4df40458152d628d46a0a59d90eb","observation_id":"d6937648-3357-4b98-8016-3e9a0d2ecc15","resolution":{"observed_at":"2026-07-31T07:01:45.796593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02807","last_updated":"2025-04-03T17:52:07Z","snapshot_observed_at":"2026-08-20T15:28:36.558489Z","submitted_at":"2025-04-03T17:52:07Z","title":"MegaMath: Pushing the Limits of Open Math Corpora","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02807","snapshot_observed_at":"2026-07-31T07:01:45.800728Z","title":"arXiv preprint arXiv:2504.02807 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:45.800728Z"},"links":{"cited_paper":"/paper/2504.02807","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:812834e6edfd98247f5fbe7dc8b78a25d9dc353f62d31de8ac4d1922ed2e7cce","observation_id":"1d01093d-1049-4caf-8613-982f95d96780","resolution":{"observed_at":"2026-07-31T07:01:45.800728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10975","last_updated":"2025-08-19T17:56:36Z","snapshot_observed_at":"2026-08-21T16:48:21.257297Z","submitted_at":"2025-08-14T17:55:47Z","title":"BeyondWeb: Lessons from Scaling Synthetic Data for Trillion-scale Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10975","snapshot_observed_at":"2026-07-31T07:01:45.805431Z","title":"arXiv preprint arXiv:2508.10975 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:45.805431Z"},"links":{"cited_paper":"/paper/2508.10975","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:23fb48bd32602cc82819c08967dc5c53b95429727520e4607020db898b6bb9c0","observation_id":"04a89781-b13e-4781-bf90-88f658abbf78","resolution":{"observed_at":"2026-07-31T07:01:45.805431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12926","last_updated":"2024-01-23T17:22:00Z","snapshot_observed_at":"2026-08-16T14:25:07.499144Z","submitted_at":"2024-01-23T17:22:00Z","title":"DsDm: Model-Aware Dataset Selection with Datamodels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12926","snapshot_observed_at":"2026-07-31T07:01:45.810159Z","title":"arXiv preprint arXiv:2401.12926 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:45.810159Z"},"links":{"cited_paper":"/paper/2401.12926","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:02cf597aef2d31c897cd3d6f03641d9b0baad9b93c517f8630bddc05da077d53","observation_id":"e3753590-e1a4-4193-9728-0977d9561cc1","resolution":{"observed_at":"2026-07-31T07:01:45.810159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:45.815676Z","title":"Proceedings of the twelfth language resources and evaluation conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:45.815676Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:56fbce5b30b0f7fb5c47313e1bee66e0bbd8b8af39ce1533e47c88d85c1500b4","observation_id":"d9580609-b01b-4a1d-a10f-cc42bc9d7797","resolution":{"observed_at":"2026-07-31T07:01:45.815676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01116","last_updated":"2023-06-01T20:03:56Z","snapshot_observed_at":"2026-08-20T04:37:17.931952Z","submitted_at":"2023-06-01T20:03:56Z","title":"The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01116","snapshot_observed_at":"2026-07-31T07:01:45.820637Z","title":"arXiv preprint arXiv:2306.01116 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:45.820637Z"},"links":{"cited_paper":"/paper/2306.01116","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:a874f970c29a4ccd84d9973ad5ecaef5bea6c09505a3acbd2e59f135dd93fc14","observation_id":"6a97a3ba-59b7-4be2-9262-334db016280c","resolution":{"observed_at":"2026-07-31T07:01:45.820637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:45.826197Z","title":"Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:45.826197Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:d8e4fefcd869070b54605293ba2fe95bf6ce9e353025d56b38e58ecc1a3a7713","observation_id":"cf41dba3-b21d-4ff1-bd61-32f9770f4ab4","resolution":{"observed_at":"2026-07-31T07:01:45.826197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-08-06T15:07:40.203199Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-31T07:01:45.831154Z","title":"arXiv preprint arXiv:2303.09540 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:45.831154Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:cb51b5912b0db76c001ad4f8d2276af6393ba52f145de5d76cc1aec1d0d025f3","observation_id":"42e4ad28-8321-4542-88aa-779814434f49","resolution":{"observed_at":"2026-07-31T07:01:45.831154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:45.835746Z","title":"Proceedings of the 15th conference of the European chapter of the association for computational linguistics: volume 2, short papers , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:45.835746Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:29c56abfd43c218e2c17f45308b9796db03cfa714e23e05d021aab773a8137e2","observation_id":"5e281ea0-d959-4203-ad9d-56ee7a59c2ee","resolution":{"observed_at":"2026-07-31T07:01:45.835746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.19407","last_updated":"2026-05-19T06:02:36Z","snapshot_observed_at":"2026-08-20T08:15:50.191001Z","submitted_at":"2026-05-19T06:02:36Z","title":"A Bitter Lesson for Data Filtering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.19407","snapshot_observed_at":"2026-07-31T07:01:45.841340Z","title":"arXiv preprint arXiv:2605.19407 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:45.841340Z"},"links":{"cited_paper":"/paper/2605.19407","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:7ce6600959e7a0b4060548ca1ef0ea68933bda5c5e46105d82d86a1554e7d637","observation_id":"2017e9f1-80a5-4174-8fb3-467ce716cd7f","resolution":{"observed_at":"2026-07-31T07:01:45.841340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:45.946940Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:45.946940Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:755aa41d236e5ca7cadf07a4c434585dbd66b897adc6031139249be2f060067a","observation_id":"0749a1b6-ed78-4499-9fc9-826aa395be68","resolution":{"observed_at":"2026-07-31T07:01:45.946940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04235","last_updated":"2025-05-19T11:52:17Z","snapshot_observed_at":"2026-08-20T05:26:03.378193Z","submitted_at":"2025-02-06T17:19:55Z","title":"Reformulation for Pretraining Data Augmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04235","snapshot_observed_at":"2026-07-31T07:01:46.065468Z","title":"arXiv preprint arXiv:2502.04235 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:46.065468Z"},"links":{"cited_paper":"/paper/2502.04235","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:1f5b202b544044c4e2def8ed1c49b00346a80a4872b747458285b391dfce263f","observation_id":"cee61b35-b966-48ce-a00b-8cdcdb6b322a","resolution":{"observed_at":"2026-07-31T07:01:46.065468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07431","last_updated":"2024-10-03T13:07:25Z","snapshot_observed_at":"2026-08-21T11:56:48.149295Z","submitted_at":"2024-09-11T17:21:59Z","title":"Synthetic continued pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07431","snapshot_observed_at":"2026-07-31T07:01:46.183350Z","title":"arXiv preprint arXiv:2409.07431 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:46.183350Z"},"links":{"cited_paper":"/paper/2409.07431","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:cfacfafe7adc4daf3b7838a261cdc65535a1226cf28e4c7f121b40327859799a","observation_id":"4d5c0e2b-e3d1-4da8-b6e9-bdce109d8fb1","resolution":{"observed_at":"2026-07-31T07:01:46.183350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:46.251623Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:46.251623Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:e69281a5e5c9a5919065a3d2eb7b1fdc3b1fee8a02e5f4a248632fc2fad1c9d1","observation_id":"bb52c361-6182-4dfa-bc54-1fa8fd1c7e0b","resolution":{"observed_at":"2026-07-31T07:01:46.251623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01413","last_updated":"2024-04-29T23:13:42Z","snapshot_observed_at":"2026-08-16T14:04:32.950182Z","submitted_at":"2024-04-01T18:31:24Z","title":"Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01413","snapshot_observed_at":"2026-07-31T07:01:46.430428Z","title":"arXiv preprint arXiv:2404.01413 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:46.430428Z"},"links":{"cited_paper":"/paper/2404.01413","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:9e15255d0042e36b7f6caf0579997f73f160f341b3bbc733364140b3b06bdbe7","observation_id":"196c4c5a-858f-4aa4-90c4-50597cef5517","resolution":{"observed_at":"2026-07-31T07:01:46.430428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07503","last_updated":"2024-08-10T20:46:47Z","snapshot_observed_at":"2026-08-21T18:36:24.315368Z","submitted_at":"2024-04-11T06:34:17Z","title":"Best Practices and Lessons Learned on Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07503","snapshot_observed_at":"2026-07-31T07:01:46.557635Z","title":"arXiv preprint arXiv:2404.07503 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:46.557635Z"},"links":{"cited_paper":"/paper/2404.07503","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:dbbf8f82579405d6c291d0a58c6b71cfad222d7d862a419c81180bd74c7f47af","observation_id":"d82f85f4-9f00-4a59-90ce-80f0f285d8d9","resolution":{"observed_at":"2026-07-31T07:01:46.557635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:46.671197Z","title":"2025 , month =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:46.671197Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:b61219ff7fd3d2e3eda660e0aa141b52076c6301838066f1b016a37cf786c003","observation_id":"de71b7fb-4031-41fb-a0bf-3400ee7feb3c","resolution":{"observed_at":"2026-07-31T07:01:46.671197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:46.809976Z","title":"Qwen2.5: A Party of Foundation Models , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:46.809976Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:00b4329c101c0432b7c400aae285e58fd3e1b2117c5baad13c7378921d0266e1","observation_id":"62d86bf9-866c-4c0b-bbb8-dcbc39f35e4e","resolution":{"observed_at":"2026-07-31T07:01:46.809976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-31T07:01:46.927170Z","title":"arXiv preprint arXiv:1803.05457 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:46.927170Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:a994ccc281fa470dc1389a24f535dbf6854942c94e8770cc5a719cb969124660","observation_id":"07253d26-cde5-4f09-8bf6-4ccf43095511","resolution":{"observed_at":"2026-07-31T07:01:46.927170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-07-31T07:01:47.047227Z","title":"arXiv preprint arXiv:2009.03300 , year=","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:47.047227Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:a6855122b9468902d3e0866c91798824cc12e34edb58da4335f169dde566dccc","observation_id":"0903cba7-1218-4642-9ac3-a6fe62d79491","resolution":{"observed_at":"2026-07-31T07:01:47.047227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:47.140201Z","title":"Proceedings of the 57th annual meeting of the association for computational linguistics , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:47.140201Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:e99c4598a006f673e60569e1b8c208f8e3ae6f3bdd8e405e6589d234797fe8e7","observation_id":"5bca4ce1-fa39-4b32-9fd1-029bd7a67b9d","resolution":{"observed_at":"2026-07-31T07:01:47.140201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:47.164739Z","title":"Proceedings of the 2017 conference on empirical methods in natural language processing , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:47.164739Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:38fb44546bb5fb7e0fc11c80e29be7d0fc1a941bcfd1d9747942ee94d351c040","observation_id":"d4d625f3-de70-4bee-a799-7a8cee55e6e7","resolution":{"observed_at":"2026-07-31T07:01:47.164739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:47.174143Z","title":"Communications of the ACM , volume=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:47.174143Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:8074ed02ab1176a90d07b5f2fab06b75a85ac5241d4442901e107922e58efe65","observation_id":"ccf68a23-67a0-4109-ac6f-33091f9684a7","resolution":{"observed_at":"2026-07-31T07:01:47.174143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:47.204745Z","title":"Proceedings of the 2018 conference on empirical methods in natural language processing , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:47.204745Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:a2ed59d7dc0d90a891d830abff2c3c924174fb773fa194c70d0eb710fcb2015a","observation_id":"85083182-5324-49e3-876d-afb55d67cbfb","resolution":{"observed_at":"2026-07-31T07:01:47.204745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:47.261187Z","title":"Proceedings of the AAAI conference on artificial intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:47.261187Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:d12c47facb26d49d85e089103c611bff99ad4a7e3756fdd779b45394cee614f5","observation_id":"22b7a4a0-04c3-4787-9e56-04b7d0b73c1a","resolution":{"observed_at":"2026-07-31T07:01:47.261187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:47.267167Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:47.267167Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:b6f00584e25fb02b506e191260306a590af03411556ea076fcfed68c8865eead","observation_id":"117e9bf3-395a-482e-bb54-9e295b9c2a54","resolution":{"observed_at":"2026-07-31T07:01:47.267167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:47.284531Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:47.284531Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:d5f9dc88184a2197468c666175c185a4441a6290bbefcfaf7bc036125c74126b","observation_id":"670b700f-ea33-47a3-8729-1b0f23e18ccd","resolution":{"observed_at":"2026-07-31T07:01:47.284531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:47.289123Z","title":"Proceedings of the 3rd Workshop on Noisy User-generated Text , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:47.289123Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:83e7319fb1b4f5cb7a8ff79cfda64c84847a502c7357cc09c8536a982688fe21","observation_id":"e3e2b2ba-dea4-40e1-88bd-ee0ea20a7de1","resolution":{"observed_at":"2026-07-31T07:01:47.289123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:47.310516Z","title":"doi:10.5281/zenodo.12608602 , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:47.310516Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:b115fd16cf7625c763c929144d4d47bcf86783e40e3fd40951cf2158fcce8a94","observation_id":"c3306e52-c329-4b23-b88a-135505ca9ab0","resolution":{"observed_at":"2026-07-31T07:01:47.310516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-07-31T07:01:47.315290Z","title":"arXiv preprint arXiv:1909.08053 , year=","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:47.315290Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:c788c46ad4a251e5f799ec3391ab3d3ebc7d15f777433776bea12692709b10c5","observation_id":"6b2dc4d2-f8e2-4830-b052-d57a29b98300","resolution":{"observed_at":"2026-07-31T07:01:47.315290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:47.320256Z","title":"IEEE Transactions on Audio, Speech and Language Processing , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:47.320256Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:6e29a11234642f1eb1adc3d526077abdad87a19598e4ae553d895391a317603f","observation_id":"8c0e7992-ca76-4527-b192-86f72679dd77","resolution":{"observed_at":"2026-07-31T07:01:47.320256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-31T07:01:47.330659Z","title":"arXiv preprint arXiv:2110.14168 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:47.330659Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:eca79bb60e395f9b69cb5eec3075737b57325ce252bb3aa62ea0b56d8489efe4","observation_id":"48039671-8ea3-4d96-b117-662940d2f1b3","resolution":{"observed_at":"2026-07-31T07:01:47.330659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-08-21T04:25:41.592030Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-07-31T07:01:47.335370Z","title":"arXiv preprint arXiv:2103.03874 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:47.335370Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:b1201b40a1206de9e69e12464dcfbcb63b0f1b308bf78d5e7dadd0e7bc51eade","observation_id":"de2df475-1668-4cb7-9d67-21969e6eaeaa","resolution":{"observed_at":"2026-07-31T07:01:47.335370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:47.339830Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:47.339830Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:76fb2799312b695e8df680adb097d27fece5866c7059dcce8618b5057f40001a","observation_id":"a0ef692a-135d-452f-a08a-0dbf56024a89","resolution":{"observed_at":"2026-07-31T07:01:47.339830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-21T17:04:32.090035Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-07-31T07:01:47.344071Z","title":"arXiv preprint arXiv:2311.12022 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:47.344071Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:1212d37817d961df3d728fcf0bacb277d732e7462a0a4abcfe65f40705dd28d4","observation_id":"37aa6d2a-baab-4990-9c0a-70ce9ba7b090","resolution":{"observed_at":"2026-07-31T07:01:47.344071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:47.348680Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:47.348680Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:18e1f9f3a4ee1840cf24944de662e6b314730385266a66ba985c85d19ffa7ab9","observation_id":"0d7c2881-e612-4a91-989e-d076e7ae6252","resolution":{"observed_at":"2026-07-31T07:01:47.348680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10635","last_updated":"2024-06-28T08:24:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-20T07:01:57Z","title":"SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10635","snapshot_observed_at":"2026-07-31T07:01:47.352650Z","title":"arXiv preprint arXiv:2307.10635 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:47.352650Z"},"links":{"cited_paper":"/paper/2307.10635","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:f30b0d577139759dd2723897b0bd8267a1cd0625a5d43b3eb8ff2b27e0c83bb8","observation_id":"8871fd0c-994f-4498-a8ee-052cb5f474a4","resolution":{"observed_at":"2026-07-31T07:01:47.352650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:01:47.357054Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:47.357054Z"},"links":{"citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:7380b4a39ec25008e6ad7c61a3e4c85d8a7383be3a77c292e6e317658ca8a03d","observation_id":"8b81afe7-1eed-40ff-ad12-a250b1834e3b","resolution":{"observed_at":"2026-07-31T07:01:47.357054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-07-31T07:01:47.361651Z","title":"arXiv preprint arXiv:2001.08361 , year=","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:47.361651Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:71509768bff07d1e80257dfcb22d96a9e3b97881e724fb5498c86b113e7b1ba8","observation_id":"3b84c7ac-d6c2-40c4-97b6-b98572751f00","resolution":{"observed_at":"2026-07-31T07:01:47.361651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-21T07:12:03.277545Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":65,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2607.24717."}