{"as_of":"2026-08-22T18:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9a159d7bd3119fa753eea2f79ca8e0b9b76e716b81405ff14ac1a62b09594059","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T07:24:27.255815Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T03:01:55.410116Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.11052","snapshot_observed_at":"2026-08-01T03:01:55.410116Z","title":"arXiv preprint arXiv:2607.11052 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25271","last_updated":"2026-07-28T04:18:49Z","snapshot_observed_at":"2026-08-13T02:12:02.677620Z","submitted_at":"2026-07-28T04:18:49Z","title":"Bridging Compute- and Data-Optimal Pretraining","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T03:01:55.410116Z"},"links":{"cited_paper":"/paper/2607.11052","citing_paper":"/paper/2607.25271"},"observation_digest":"sha256:167d313b0aff14c8400d9275d8c171c7e38c8842842fe20e5f67608846e7f0f6","observation_id":"a5cc47bd-3e73-41ef-a316-6d10c1a192d5","resolution":{"observed_at":"2026-08-01T03:01:55.410116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.11052/citation-record","integrity":"/paper/2607.11052/integrity","json":"/paper/2607.11052/citation-record.json","paper":"/paper/2607.11052"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.10914","last_updated":"2024-08-20T14:58:13Z","snapshot_observed_at":"2026-08-16T13:25:10.790461Z","submitted_at":"2024-08-20T14:58:13Z","title":"To Code, or Not To Code? Exploring Impact of Code in Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10914","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"To code, or not to code? exploring impact of code in pre-training.arXiv preprint arXiv:2408.10914,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/2408.10914","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:6a7ba1b4b083d7f6d3617cf5dd09d36437987d090bd108274a459ef96119b77b","observation_id":"3e048f62-6b6f-4400-8b2b-d3e2ad5bbfd5","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Program synthesis with large language models.arXiv preprint arXiv:2108.07732,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:07e0bc209671c1d72b6828bbda4918982096630db7e92a1034b3e80eb0a4af6c","observation_id":"428fe963-08f2-409f-be88-ae350776eb01","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10631","last_updated":"2024-03-15T19:14:39Z","snapshot_observed_at":"2026-08-16T13:51:18.629241Z","submitted_at":"2023-10-16T17:54:07Z","title":"Llemma: An Open Language Model For Mathematics","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10631","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Llemma: An open language model for mathematics.arXiv preprint arXiv:2310.10631,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/2310.10631","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:9bbe685a333144249c7496e113098d91a6ecad9fd72bd8fa56c2ea03e70994c5","observation_id":"7ec57828-cf92-4bd4-abe0-f3f2c6515671","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"If you use this software, please cite it using these metadata","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:001bc7d09f36cab261dd9b3d56c2d074441f12104645980f410602cd5312f6b1","observation_id":"2f7f26dd-1441-478a-a4bf-c3ca51b34cf6","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-20T20:50:23.483838Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Evalu- ating large language models trained on code.arXiv preprint arXiv:2107.03374,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:72f9cb69d11d7c1a43b942636f44eaa24a193bfded9483f94409ce868ee276c9","observation_id":"ac82df56-db89-45b6-bb1e-0f5136fdde42","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05735","last_updated":"2025-04-21T03:50:23Z","snapshot_observed_at":"2026-08-20T14:41:33.557208Z","submitted_at":"2024-11-08T17:50:24Z","title":"Aioli: A Unified Optimization Framework for Language Model Data Mixing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05735","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Aioli: A unified optimization framework for language model data mixing.arXiv preprint arXiv:2411.05735, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/2411.05735","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:ecf216f5a137f52b5dcf9e46b7b713600dfe597f81eff86bbda90c10d2fe4e5f","observation_id":"a7d168f5-0b4d-45ec-af45-536721d007aa","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge.arXiv preprint arXiv:1803.05457,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:622b3dff0682c250ede0d31ba20851597239fd60e195f0c873cb4cbeeaad1653","observation_id":"df7f5100-f438-4c5b-b4d9-1e37d02a076a","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:f62477a1d8edf0a512bc75b7074c285cb1e9fea3d46dd83460942589bda0111f","observation_id":"72393667-e240-4e25-8e7e-ad8f20e54c82","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Albert Ge, Tzu-Heng Huang, John Cooper, Avi Trost, Ziyi Chu, Satya Sai Srinath Namburi GNVV , Ziyang Cai, Kendall Park, Nicholas Roberts, and Frederic Sala","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:317cbf0ce4364e95c0fada5094dca520e76cfff9bdc8d88d5f34357f0ae2b36c","observation_id":"5fb9d776-39d0-466a-a260-cb4db8ecd4cd","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00838","last_updated":"2024-06-07T21:59:52Z","snapshot_observed_at":"2026-08-17T12:46:02.488423Z","submitted_at":"2024-02-01T18:28:55Z","title":"OLMo: Accelerating the Science of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00838","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Dirk Groeneveld, Iz Beltagy, Pete Walsh, Akshita Bhagia, Rodney Kinney, Oyvind Tafjord, Ananya Harsh Jha, Hamish Ivison, Ian Magnusson, Yizhong Wang, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/2402.00838","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:66aff0267a2b331484fc8ea21b60017c378a446c46c9c3dcca5b36ddf13ef663","observation_id":"69022546-8f2a-4f5a-8473-cbf110890a79","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03296","last_updated":"2023-08-07T04:47:42Z","snapshot_observed_at":"2026-08-19T20:23:36.050723Z","submitted_at":"2023-08-07T04:47:42Z","title":"Studying Large Language Model Generalization with Influence Functions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03296","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Studying large language model generalization with influence functions.arXiv preprint arXiv:2308.03296,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/2308.03296","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:e899a06816c4ba4a6cc20e9790b0da0c5e260c1971cb3b56b06b7cdc44ef8f4f","observation_id":"10773f3d-cb38-4893-a2ec-fd3f7d4faa33","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17467","last_updated":"2024-10-07T05:16:25Z","snapshot_observed_at":"2026-08-20T14:39:07.131437Z","submitted_at":"2024-07-24T17:59:02Z","title":"CMR Scaling Law: Predicting Critical Mixture Ratios for Continual Pre-training of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17467","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Cmr scaling law: Predicting critical mixture ratios for continual pre-training of language models.arXiv preprint arXiv:2407.17467,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/2407.17467","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:51fa383f5ff6e7eb2873fa911ba5fa438c22d32ff9a478f90df9b5ee76573c6e","observation_id":"7f661269-97a9-4300-bc45-5dc84106996d","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-21T02:12:10.329412Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Training compute-optimal large language models.arXiv preprint arXiv:2203.15556,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:a5cd6431df09670a280210e28dd466f5b68ca4f4737213f06a9b486b5f3d3092","observation_id":"b628019e-1abb-469f-b888-20a20b81e28d","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00622","last_updated":"2022-02-01T18:15:24Z","snapshot_observed_at":"2026-08-20T14:38:32.002379Z","submitted_at":"2022-02-01T18:15:24Z","title":"Datamodels: Predicting Predictions from Training Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00622","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Datamodels: Predicting predictions from training data.arXiv preprint arXiv:2202.00622,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/2202.00622","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:c71979734f60b756b425f88741a7d6d3e5639c667456a5cc2bb667209132dd6e","observation_id":"2455584f-c702-4866-9c58-3f581e4b710c","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10378","last_updated":"2025-06-12T06:07:42Z","snapshot_observed_at":"2026-08-18T04:49:59.894029Z","submitted_at":"2025-06-12T06:07:42Z","title":"Discovering Hierarchical Latent Capabilities of Language Models via Causal Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10378","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Discovering hierarchical latent capabilities of language models via causal representation learning.arXiv preprint arXiv:2506.10378,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/2506.10378","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:c33b94f893c482df286d12082c251708e48f782047b7fe4c1b2da4ddaee0b262","observation_id":"b300a453-5410-4831-a99e-864932b4d533","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Autoscale: Scale-aware data mixing for pre-training llms.arXiv preprint arXiv:2407.20177,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:9ff0b58819d67a0d2c7e4c41815e4baf71da7cd0abe586296abd5338a8a423fc","observation_id":"a9fe6796-2f46-4d7d-bf0a-a422a40deb11","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Scaling laws for neural language models.arXiv preprint arXiv:2001.08361,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:e07a16a55a637add225df0d700c7409deae34c06719ab026da576e5aee1ed96f","observation_id":"f4e43290-447e-4dec-8ad7-d0b5bbc023a8","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21068","last_updated":"2024-05-31T17:56:33Z","snapshot_observed_at":"2026-08-20T14:40:05.066812Z","submitted_at":"2024-05-31T17:56:33Z","title":"Code Pretraining Improves Entity Tracking Abilities of Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21068","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Code pretraining improves entity tracking abilities of language models.arXiv preprint arXiv:2405.21068,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/2405.21068","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:b7149438c4276f39073092c88b2ff5f79e7f0df48cefd81d4a75b1c5ced88ee6","observation_id":"6bda2c34-7f17-4ab6-b47e-bf2a9e9db7f2","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Race: Large-scale reading comprehension dataset from examinations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:191559ebe9f35950c8b67b5cd54840c34d7b02c363ef06e84a1b32a56fe33944","observation_id":"ebaae459-999d-4f75-b41f-1dde9c7eb7b3","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15035","last_updated":"2024-10-19T08:39:21Z","snapshot_observed_at":"2026-08-16T13:07:49.678425Z","submitted_at":"2024-10-19T08:39:21Z","title":"Improving General Text Embedding Model: Tackling Task Conflict and Data Imbalance through Model Merging","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15035","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Datacomp-lm: In search of the next generation of training sets for language models.Advances in Neural Information 11 Processing Systems, 37:14200–14282, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/2410.15035","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:01ca87abcfc4151d95359ebe92863c6c8c2fdbec2d76345886551f82d3454134","observation_id":"9600c224-e067-494a-a2a2-0fa31776251b","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16787","last_updated":"2023-11-04T19:10:06Z","snapshot_observed_at":"2026-08-20T14:38:40.365071Z","submitted_at":"2023-10-25T17:20:26Z","title":"The Data Provenance Initiative: A Large Scale Audit of Dataset Licensing & Attribution in AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16787","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"The data provenance initiative: A large scale audit of dataset licensing & attribution in ai.arXiv preprint arXiv:2310.16787,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/2310.16787","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:357a1b67b85c7575b6c6ac8873baf1545e91ddebb1f8fde74ee3c34cad35476e","observation_id":"10d740cf-1327-4572-b8a4-416925bd5f28","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Atlas: Adaptive transfer scaling laws for multilingual pretraining, finetuning, and decoding the curse of multilinguality","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:4224ede34fc3ad8194a98046bb49fd80046c40670b350db1671c5df25cbec023","observation_id":"225ebb96-f56d-410e-b7d4-483a1512518b","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08196","last_updated":"2024-10-10T17:58:40Z","snapshot_observed_at":"2026-08-20T14:39:06.224776Z","submitted_at":"2024-10-10T17:58:40Z","title":"MathCoder2: Better Math Reasoning from Continued Pretraining on Model-translated Mathematical Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08196","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Mathcoder2: Better math reasoning from continued pretraining on model-translated mathematical code.arXiv preprint arXiv:2410.08196,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/2410.08196","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:21daf6de53de29a4201179828f9b5e1b24ec59e346edf52f1548673d95a374a7","observation_id":"bd68876a-91f2-42b0-9a72-6571733cb257","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16298","last_updated":"2023-09-30T07:01:13Z","snapshot_observed_at":"2026-08-16T14:56:54.756023Z","submitted_at":"2023-09-28T09:50:27Z","title":"At Which Training Stage Does Code Data Help LLMs Reasoning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16298","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"At which training stage does code data help llms reasoning?arXiv preprint arXiv:2309.16298,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/2309.16298","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:13e35614825b201ff1194408834159829847568f97ada1c7796a0a4b4184f09d","observation_id":"40dce8b8-4584-4927-a47b-20a7226de19c","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11393","last_updated":"2025-07-13T20:17:49Z","snapshot_observed_at":"2026-08-20T14:40:58.229589Z","submitted_at":"2025-04-15T17:02:15Z","title":"DataDecide: How to Predict Best Pretraining Data with Small Experiments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11393","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Datadecide: How to predict best pretraining data with small experiments.arXiv preprint arXiv:2504.11393,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/2504.11393","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:2e6b18c899c46b62b0583d5d3ff7d22a76d4e68b2df46208f3d24fda7dd6ed1e","observation_id":"fc358018-e038-4a34-b346-0d2b169b2c71","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-08-17T01:46:43.513643Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Pointer sentinel mixture models.arXiv preprint arXiv:1609.07843,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:3c3c9671f89a0034dd578190320deb4ae4f4cae98722ee41d0a03ee3adb8a21c","observation_id":"d1d482d3-098e-4ce8-aa9e-726c8ce3f8aa","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06031","last_updated":"2016-06-20T09:37:17Z","snapshot_observed_at":"2026-08-17T07:59:38.221655Z","submitted_at":"2016-06-20T09:37:17Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06031","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"The lambada dataset: Word prediction requiring a broad discourse context.arXiv preprint arXiv:1606.06031,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/1606.06031","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:8638e214b96e812ee4a552df37e18574c827349f8fcbeacaa4e81aae4772edfa","observation_id":"75eea7b3-f3cc-4251-a6d1-1522d8fd37c7","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Pretraining scaling laws for generative evaluations of language models.arXiv preprint arXiv:2509.24012,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:fdc5c979835807c6302d462925698f2940c529842fb99fdca5d657fffdd8429b","observation_id":"87c0bd1f-c5e2-4356-a93e-abda1b9195f3","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Scaling laws for optimal data mixtures.arXiv preprint arXiv:2507.09404,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:3cfc2c3ff47528eb864c78197fb2ff19dfaaace521150a2a234c93c680739c43","observation_id":"0427db88-d620-4198-b9fa-623dc26e5b87","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00159","last_updated":"2024-06-06T18:46:40Z","snapshot_observed_at":"2026-08-18T13:13:10.222946Z","submitted_at":"2024-01-31T20:29:50Z","title":"Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00159","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Dolma: An open corpus of three trillion tokens for language model pretraining research.arXiv preprint 12 arXiv:2402.00159,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/2402.00159","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:7159a75a4b64d0fc1f4aa48362fe85103409d176686e60421865e4056e6fad05","observation_id":"e09b73e6-1c45-4bd7-bd1c-cac990ab38e4","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-08-17T13:58:40.683829Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Tristan Thrush, Christopher Potts, and Tatsunori Hashimoto","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:a91b68e691a4d1168df4dc2a4cdf2c56756750e0fa9287e6247974d489a00cd5","observation_id":"27281d89-c4a0-4cac-afb3-ef7deff2bbac","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Mergemix: Optimizing mid-training data mixtures via learnable model merging.arXiv preprint arXiv:2601.17858,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:346c100939ec3db54a85b89620629a2091573956bdd203a272ef999b37fa3266","observation_id":"ccf320b1-e36a-4d24-8b59-57c4a030aafe","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-08-16T14:06:35.643964Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Data mixing laws: Optimizing data mixtures by predicting language modeling performance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:a90f1b60bfaa9a167d3461cd7b12f0dcd5b032679794186c2c869c925d260a07","observation_id":"72a3f635-59e7-4db1-9179-1a7d6df13ef4","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02229","last_updated":"2025-05-29T13:40:26Z","snapshot_observed_at":"2026-08-18T07:57:58.445081Z","submitted_at":"2024-10-03T05:51:26Z","title":"CodePMP: Scalable Preference Model Pretraining for Large Language Model Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02229","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Codepmp: Scal- able preference model pretraining for large language model reasoning.arXiv preprint arXiv:2410.02229,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/2410.02229","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:59b3249c3ca7f5bf391950b8bdea3004b023b90d19b26834077cf28a1edd52a5","observation_id":"c910617d-f8c4-4959-8220-3b79d42a598f","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14709","last_updated":"2025-06-20T04:30:04Z","snapshot_observed_at":"2026-08-20T14:41:35.684717Z","submitted_at":"2025-02-20T16:34:46Z","title":"Group-Level Data Selection for Efficient Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14709","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Group- level data selection for efficient pretraining.arXiv preprint arXiv:2502.14709,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/2502.14709","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:1c04fd9c020c853ad2511f495e7ce583eaf7fb27be1a37457379be4d33808c6e","observation_id":"eacf1bf9-76e9-4370-ae30-206522d7ba0c","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-15T09:37:44.321271Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Hellaswag: Can a machine really finish your sentence?arXiv preprint arXiv:1905.07830,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:9dc82f261597a5c5cdd55fca7aa54132f8a0ab1f4bf25d1000de09b12e0f0510","observation_id":"ebc5249f-5e79-4491-beb0-3be3eadae291","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09181","last_updated":"2024-06-27T02:45:41Z","snapshot_observed_at":"2026-08-16T14:26:48.124418Z","submitted_at":"2024-01-17T12:44:17Z","title":"Beyond Anti-Forgetting: Multimodal Continual Instruction Tuning with Positive Forward Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09181","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Beyond anti- forgetting: Multimodal continual instruction tuning with positive forward transfer.arXiv preprint arXiv:2401.09181,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/2401.09181","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:b16fe15fa1215ee9a87cb0324e123148ccae5f7efa49159721267a859454b2f6","observation_id":"09afd6ee-be56-4718-911b-8020a59191da","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Instruction-following evaluation for large language models.arXiv preprint arXiv:2311.07911,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:87e4bd87453a259d0f565dec0c5f7d1aa7c90afe39653edc382da5227a7d7c9a","observation_id":"84d9bbad-4b30-42b1-a759-f9712ecb5536","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Here we give the per-group scales and checkpoint counts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:7f93600926a931670d31b7c2461c5ee633f89acbd052d116660efad4edab8aa1","observation_id":"8e00d0b0-bbc1-46e5-b756-51130a338cec","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Six domains (Books, Code, Encyclopedia, Legal, Science, Web) match DPI source domains","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:f8c2c1deea70e9ed6d837fb930cf0a392e5fcd115372d5ee3dbc0c2875d3f34d","observation_id":"85eda1e9-b798-4ef3-84ee-c73a3402c431","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:c465af747001404b0518331cf800172517ab2fea1babea267cacef60a99bc598","observation_id":"1f794378-a334-4fa0-8267-950a52638ad9","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"All evaluations use the lm-evaluation-harness (Gao et al., 2024)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:d1e9a2f83beeef783d5be76215d40e2cf0eef49544afb675fcd24852f9758165","observation_id":"1dcd3c89-0d75-4d1d-8e66-5397484e6485","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:c06a280937ff3823f386222f13801964b494c84d12e4c2a80ad6737c68c35984","observation_id":"7e842dde-9294-4be7-aee2-5b61e33b2933","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Appendix G.1 derives the objective used to choose the validation mixtures, and Appendix G.2 provides more details for this experiment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:d6b10f610940a6c292a449b2437dbdd4d75e72b7006026f4151c805bae0a3c32","observation_id":"c1de4917-0cd4-4105-b243-28b655743ba7","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"The 30M model uses dmodel = 256, 8 heads, and 8 layers, while the 150M model uses dmodel = 640, 10 heads, and 12 layers","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:3a388965ae3a76e440589a91deee24403543f7a3a6053b98cd3752d8fb71157f","observation_id":"87da0339-88d5-4c34-844f-9740604a4d92","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T13:35:47.434677Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2607.11052."}