{"as_of":"2026-08-09T01:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b42c1b79e4dc85b9e3e712b9ee0c5bc737e8208d0b0d03431c5099007c696ee1","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":21,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:09:33.532810Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.02406","last_updated":"2023-12-09T00:27:18Z","snapshot_observed_at":"2026-08-08T13:59:51.289748Z","submitted_at":"2023-12-05T00:42:35Z","title":"Efficient Online Data Mixing For Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":"2312.02406","doi":"10.48550/arxiv.2312.02406","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02406","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient online data mixing for language model pre-training","venue":"arXiv (Cornell University)","work_id":"f038029e-5113-4f29-9db3-7e5d6144e95f","year":2023},"citing_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T22:58:16.523267Z"},"links":{"cited_paper":"/paper/2312.02406","citing_paper":"/paper/2406.11794"},"observation_digest":"sha256:9f29fc832830d7e5a531f09d80aee62daa7158e976520c7ae0bdaac3bc51e3a0","observation_id":"0bead57a-b683-4937-8140-0549c6ce35a4","resolution":{"observed_at":"2026-05-17T22:58:16.837009Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02406","last_updated":"2023-12-09T00:27:18Z","snapshot_observed_at":"2026-08-08T13:59:51.289748Z","submitted_at":"2023-12-05T00:42:35Z","title":"Efficient Online Data Mixing For Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":"2312.02406","doi":"10.48550/arxiv.2312.02406","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02406","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient online data mixing for language model pre-training","venue":"arXiv (Cornell University)","work_id":"f038029e-5113-4f29-9db3-7e5d6144e95f","year":2023},"citing_paper":{"arxiv_id":"2502.00270","last_updated":"2026-05-13T20:43:28Z","snapshot_observed_at":"2026-08-03T15:35:37.964180Z","submitted_at":"2025-02-01T01:52:32Z","title":"DUET: Optimizing Training Data Mixtures via Feedback from Unseen Evaluation Tasks","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-23T03:58:48.967122Z"},"links":{"cited_paper":"/paper/2312.02406","citing_paper":"/paper/2502.00270"},"observation_digest":"sha256:804d25e81b530c622be163e20e0ac6a4d9c436185f5cf19baad76d7aa8881fc8","observation_id":"4bd057bc-eb32-4353-914d-1e15184bd867","resolution":{"observed_at":"2026-05-23T04:02:30.417636Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02406","last_updated":"2023-12-09T00:27:18Z","snapshot_observed_at":"2026-08-08T13:59:51.289748Z","submitted_at":"2023-12-05T00:42:35Z","title":"Efficient Online Data Mixing For Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02406","snapshot_observed_at":"2026-08-07T15:09:33.532810Z","title":"Efficient online data mixing for language model pre-training.arXiv preprint arXiv:2312.02406, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16066","last_updated":"2025-05-21T22:34:13Z","snapshot_observed_at":"2026-08-07T15:05:27.211434Z","submitted_at":"2025-05-21T22:34:13Z","title":"Merge to Mix: Mixing Datasets via Model Merging","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:33.532810Z"},"links":{"cited_paper":"/paper/2312.02406","citing_paper":"/paper/2505.16066"},"observation_digest":"sha256:c2f96df0d7f39465fc7457211e6074303b71c95393efbfb1cd5de4aad8a73238","observation_id":"de4514b8-5107-4316-909a-45c8d58ea7e1","resolution":{"observed_at":"2026-08-07T15:09:33.532810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02406","last_updated":"2023-12-09T00:27:18Z","snapshot_observed_at":"2026-08-08T13:59:51.289748Z","submitted_at":"2023-12-05T00:42:35Z","title":"Efficient Online Data Mixing For Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02406","snapshot_observed_at":"2026-08-07T14:04:24.571162Z","title":"Efficient online data mixing for language model pre-training, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20380","last_updated":"2025-05-26T17:32:14Z","snapshot_observed_at":"2026-08-08T04:26:12.725477Z","submitted_at":"2025-05-26T17:32:14Z","title":"GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:04:24.571162Z"},"links":{"cited_paper":"/paper/2312.02406","citing_paper":"/paper/2505.20380"},"observation_digest":"sha256:6b745acf0128d3532ab6455d0db676ffea90f6cf86cad966bd1805ebec2a0b06","observation_id":"4f784259-f93c-48de-97e0-b32d974601ba","resolution":{"observed_at":"2026-08-07T14:04:24.571162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02406","last_updated":"2023-12-09T00:27:18Z","snapshot_observed_at":"2026-08-08T13:59:51.289748Z","submitted_at":"2023-12-05T00:42:35Z","title":"Efficient Online Data Mixing For Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02406","snapshot_observed_at":"2026-08-07T13:33:48.487199Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:48.487199Z"},"links":{"cited_paper":"/paper/2312.02406","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:e105d5844e9d1631d86f8387f7db0d8a8867599f155641da47142bb6e9418f1a","observation_id":"62f76901-e1cd-4dd5-b557-a4ee9abbe3a4","resolution":{"observed_at":"2026-08-07T13:33:48.487199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02406","last_updated":"2023-12-09T00:27:18Z","snapshot_observed_at":"2026-08-08T13:59:51.289748Z","submitted_at":"2023-12-05T00:42:35Z","title":"Efficient Online Data Mixing For Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02406","snapshot_observed_at":"2026-08-07T12:19:26.845188Z","title":"Albalak, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-07T12:10:18.330753Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:26.845188Z"},"links":{"cited_paper":"/paper/2312.02406","citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:ad33439768bdd918751fc3be4c7a270c0795401ab670ee46ae6ddfb44ccdfc37","observation_id":"f3e214dd-d14f-4ad1-af5b-4b898e03b140","resolution":{"observed_at":"2026-08-07T12:19:26.845188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02406","last_updated":"2023-12-09T00:27:18Z","snapshot_observed_at":"2026-08-08T13:59:51.289748Z","submitted_at":"2023-12-05T00:42:35Z","title":"Efficient Online Data Mixing For Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02406","snapshot_observed_at":"2026-08-07T12:08:26.935097Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00569","last_updated":"2025-05-31T13:57:10Z","snapshot_observed_at":"2026-08-07T12:00:12.795542Z","submitted_at":"2025-05-31T13:57:10Z","title":"AutoMixAlign: Adaptive Data Mixing for Multi-Task Preference Optimization in LLMs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:08:26.935097Z"},"links":{"cited_paper":"/paper/2312.02406","citing_paper":"/paper/2506.00569"},"observation_digest":"sha256:ffe42a4c056cffeb54e0846b574b6f8ad583ee0cee233ce581dca5e9b15f04bd","observation_id":"44a757b4-b7af-4777-8df1-10dfab028887","resolution":{"observed_at":"2026-08-07T12:08:26.935097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02406","last_updated":"2023-12-09T00:27:18Z","snapshot_observed_at":"2026-08-08T13:59:51.289748Z","submitted_at":"2023-12-05T00:42:35Z","title":"Efficient Online Data Mixing For Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02406","snapshot_observed_at":"2026-08-07T10:29:42.562902Z","title":"Efficient online data mixing for language model pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05209","last_updated":"2025-06-05T16:21:30Z","snapshot_observed_at":"2026-08-07T10:43:51.895295Z","submitted_at":"2025-06-05T16:21:30Z","title":"The Common Pile v0.1: An 8TB Dataset of Public Domain and Openly Licensed Text","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:42.562902Z"},"links":{"cited_paper":"/paper/2312.02406","citing_paper":"/paper/2506.05209"},"observation_digest":"sha256:626772fcf8e33eb067dc02c0486d1dc9f54eec13e3e1f65c8aebf5edf49d8e1c","observation_id":"15210643-f738-44b6-9b55-0efb7dff02c0","resolution":{"observed_at":"2026-08-07T10:29:42.562902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02406","last_updated":"2023-12-09T00:27:18Z","snapshot_observed_at":"2026-08-08T13:59:51.289748Z","submitted_at":"2023-12-05T00:42:35Z","title":"Efficient Online Data Mixing For Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02406","snapshot_observed_at":"2026-08-06T16:53:07.823581Z","title":"Efficient online data mixing for language model pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12466","last_updated":"2025-07-16T17:59:45Z","snapshot_observed_at":"2026-08-07T10:43:47.278118Z","submitted_at":"2025-07-16T17:59:45Z","title":"Language Models Improve When Pretraining Data Matches Target Tasks","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T16:53:07.823581Z"},"links":{"cited_paper":"/paper/2312.02406","citing_paper":"/paper/2507.12466"},"observation_digest":"sha256:107979ebcf91d34025427435d3e30502d32e3d7ffd22a376fd8b80259d8c8bea","observation_id":"917c7a5c-e1c5-43cc-ba0e-1d04c9a4f981","resolution":{"observed_at":"2026-08-06T16:53:07.823581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02406","last_updated":"2023-12-09T00:27:18Z","snapshot_observed_at":"2026-08-08T13:59:51.289748Z","submitted_at":"2023-12-05T00:42:35Z","title":"Efficient Online Data Mixing For Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":"2312.02406","doi":"10.48550/arxiv.2312.02406","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02406","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient online data mixing for language model pre-training","venue":"arXiv (Cornell University)","work_id":"f038029e-5113-4f29-9db3-7e5d6144e95f","year":2023},"citing_paper":{"arxiv_id":"2604.14198","last_updated":"2026-04-03T04:26:43Z","snapshot_observed_at":"2026-08-06T11:58:56.492844Z","submitted_at":"2026-04-03T04:26:43Z","title":"MixAtlas: Uncertainty-aware Data Mixture Optimization for Multimodal LLM Midtraining","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T20:07:29.544613Z"},"links":{"cited_paper":"/paper/2312.02406","citing_paper":"/paper/2604.14198"},"observation_digest":"sha256:3696c9917f80127dcfaf8ca29532bc1855a13fce839741fd0d2b5e2ea2664642","observation_id":"7bda05d1-b601-47aa-ac2f-10d9cc52fb0d","resolution":{"observed_at":"2026-05-13T20:08:12.635236Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02406","last_updated":"2023-12-09T00:27:18Z","snapshot_observed_at":"2026-08-08T13:59:51.289748Z","submitted_at":"2023-12-05T00:42:35Z","title":"Efficient Online Data Mixing For Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":"2312.02406","doi":"10.48550/arxiv.2312.02406","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02406","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient online data mixing for language model pre-training","venue":"arXiv (Cornell University)","work_id":"f038029e-5113-4f29-9db3-7e5d6144e95f","year":2023},"citing_paper":{"arxiv_id":"2604.16380","last_updated":"2026-03-25T13:30:40Z","snapshot_observed_at":"2026-08-08T06:45:13.140900Z","submitted_at":"2026-03-25T13:30:40Z","title":"Data Mixing for Large Language Models Pretraining: A Survey and Outlook","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T00:56:04.958757Z"},"links":{"cited_paper":"/paper/2312.02406","citing_paper":"/paper/2604.16380"},"observation_digest":"sha256:360d49c0ce101f708774db392d04814e7d5717b949ce5b727c81d041c776c3a6","observation_id":"29625642-4fda-4ab9-a4d1-8621cc8980ab","resolution":{"observed_at":"2026-05-15T00:58:25.751611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02406","last_updated":"2023-12-09T00:27:18Z","snapshot_observed_at":"2026-08-08T13:59:51.289748Z","submitted_at":"2023-12-05T00:42:35Z","title":"Efficient Online Data Mixing For Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":"2312.02406","doi":"10.48550/arxiv.2312.02406","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02406","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient online data mixing for language model pre-training","venue":"arXiv (Cornell University)","work_id":"f038029e-5113-4f29-9db3-7e5d6144e95f","year":2023},"citing_paper":{"arxiv_id":"2605.14350","last_updated":"2026-05-14T04:22:24Z","snapshot_observed_at":"2026-07-06T23:25:49.545418Z","submitted_at":"2026-05-14T04:22:24Z","title":"Distributionally Robust Multi-Task Reinforcement Learning via Adaptive Task Sampling","version":1},"reference_index":268,"source":"arxiv_source","source_observed_at":"2026-05-15T03:05:36.871497Z"},"links":{"cited_paper":"/paper/2312.02406","citing_paper":"/paper/2605.14350"},"observation_digest":"sha256:65971a8536e6151cdc44d3ece10759f0fbc4d5ea3d85ff290206ff6215e933d1","observation_id":"a2866833-2709-4d6f-bfaf-a598fcbefb75","resolution":{"observed_at":"2026-05-15T03:08:59.654681Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02406","last_updated":"2023-12-09T00:27:18Z","snapshot_observed_at":"2026-08-08T13:59:51.289748Z","submitted_at":"2023-12-05T00:42:35Z","title":"Efficient Online Data Mixing For Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":"2312.02406","doi":"10.48550/arxiv.2312.02406","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02406","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient online data mixing for language model pre-training","venue":"arXiv (Cornell University)","work_id":"f038029e-5113-4f29-9db3-7e5d6144e95f","year":2023},"citing_paper":{"arxiv_id":"2606.07597","last_updated":"2026-05-29T06:08:57Z","snapshot_observed_at":"2026-07-29T16:14:13.340722Z","submitted_at":"2026-05-29T06:08:57Z","title":"Repetition Mismatch: Why Data Mixture Experiments Don't Scale and How to Fix Them","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-28T23:19:22.355753Z"},"links":{"cited_paper":"/paper/2312.02406","citing_paper":"/paper/2606.07597"},"observation_digest":"sha256:96211e2ec89591860998e81e4d2ed080acbc8a2e64ba995de68dc829b952cd74","observation_id":"978961dc-3dc4-47d2-9e4f-f5450bcf27c9","resolution":{"observed_at":"2026-06-28T23:22:46.209942Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02406","last_updated":"2023-12-09T00:27:18Z","snapshot_observed_at":"2026-08-08T13:59:51.289748Z","submitted_at":"2023-12-05T00:42:35Z","title":"Efficient Online Data Mixing For Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":"2312.02406","doi":"10.48550/arxiv.2312.02406","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02406","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient online data mixing for language model pre-training","venue":"arXiv (Cornell University)","work_id":"f038029e-5113-4f29-9db3-7e5d6144e95f","year":2023},"citing_paper":{"arxiv_id":"2606.08167","last_updated":"2026-07-30T10:53:08Z","snapshot_observed_at":"2026-08-02T23:58:03.710099Z","submitted_at":"2026-06-06T13:31:38Z","title":"Explaining Data Mixing Scaling Laws","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T20:20:53.599064Z"},"links":{"cited_paper":"/paper/2312.02406","citing_paper":"/paper/2606.08167"},"observation_digest":"sha256:afa8452460a092ecd37b582de4482565e54946d05336c9bfe93135205a2167f1","observation_id":"80073e1f-33d6-402a-9663-849359df43e1","resolution":{"observed_at":"2026-07-02T20:37:22.526097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02406","last_updated":"2023-12-09T00:27:18Z","snapshot_observed_at":"2026-08-08T13:59:51.289748Z","submitted_at":"2023-12-05T00:42:35Z","title":"Efficient Online Data Mixing For Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02406","snapshot_observed_at":"2026-07-15T10:54:16.434702Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08167","last_updated":"2026-07-30T10:53:08Z","snapshot_observed_at":"2026-08-02T23:58:03.710099Z","submitted_at":"2026-06-06T13:31:38Z","title":"Explaining Data Mixing Scaling Laws","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-15T10:54:16.434702Z"},"links":{"cited_paper":"/paper/2312.02406","citing_paper":"/paper/2606.08167"},"observation_digest":"sha256:1903666af22a8cfc6063e86215cf053aac6d5a7893430c83c5fa7ea9e9841873","observation_id":"a3e95546-417f-496d-b6ee-c29f887664a7","resolution":{"observed_at":"2026-07-15T10:54:16.434702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02406","last_updated":"2023-12-09T00:27:18Z","snapshot_observed_at":"2026-08-08T13:59:51.289748Z","submitted_at":"2023-12-05T00:42:35Z","title":"Efficient Online Data Mixing For Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02406","snapshot_observed_at":"2026-08-02T12:13:45.639396Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08167","last_updated":"2026-07-30T10:53:08Z","snapshot_observed_at":"2026-08-02T23:58:03.710099Z","submitted_at":"2026-06-06T13:31:38Z","title":"Explaining Data Mixing Scaling Laws","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T12:13:45.639396Z"},"links":{"cited_paper":"/paper/2312.02406","citing_paper":"/paper/2606.08167"},"observation_digest":"sha256:aa94ff9121d4a0aaf53dff1723abb324c4018ce1e30025c169ac219b49d94bc9","observation_id":"fcbbb887-5ef7-4809-91a6-a7d7a2c0f8ee","resolution":{"observed_at":"2026-08-02T12:13:45.639396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02406","last_updated":"2023-12-09T00:27:18Z","snapshot_observed_at":"2026-08-08T13:59:51.289748Z","submitted_at":"2023-12-05T00:42:35Z","title":"Efficient Online Data Mixing For Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":"2312.02406","doi":"10.48550/arxiv.2312.02406","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02406","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient online data mixing for language model pre-training","venue":"arXiv (Cornell University)","work_id":"f038029e-5113-4f29-9db3-7e5d6144e95f","year":2023},"citing_paper":{"arxiv_id":"2606.18307","last_updated":"2026-06-16T07:21:49Z","snapshot_observed_at":"2026-07-06T23:53:45.117607Z","submitted_at":"2026-06-16T07:21:49Z","title":"DRIFT: Refining Instruction Data via On-Policy Data Attribution","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T01:57:05.784589Z"},"links":{"cited_paper":"/paper/2312.02406","citing_paper":"/paper/2606.18307"},"observation_digest":"sha256:73cafd2ca3fdb9939c6ba32bbdab1e6e5c1ac561d0fc8a8aa51cbdd64292eca0","observation_id":"7b1c2692-3879-48e7-8864-d1c738009978","resolution":{"observed_at":"2026-07-03T19:18:54.754640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02406","last_updated":"2023-12-09T00:27:18Z","snapshot_observed_at":"2026-08-08T13:59:51.289748Z","submitted_at":"2023-12-05T00:42:35Z","title":"Efficient Online Data Mixing For Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":"2312.02406","doi":"10.48550/arxiv.2312.02406","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02406","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient online data mixing for language model pre-training","venue":"arXiv (Cornell University)","work_id":"f038029e-5113-4f29-9db3-7e5d6144e95f","year":2023},"citing_paper":{"arxiv_id":"2606.24133","last_updated":"2026-06-23T04:32:46Z","snapshot_observed_at":"2026-08-07T15:14:06.002150Z","submitted_at":"2026-06-23T04:32:46Z","title":"Holistic Data Scheduler for LLM Pre-training via Multi-Objective Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T00:46:13.587037Z"},"links":{"cited_paper":"/paper/2312.02406","citing_paper":"/paper/2606.24133"},"observation_digest":"sha256:1c315f048cdee7bbdc0fa625581e5eca89cb6cad4c043c892d699ff7ec4f88a2","observation_id":"2e0072df-b689-447b-a45f-cd91b1e4564a","resolution":{"observed_at":"2026-07-04T16:19:57.827829Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02406","last_updated":"2023-12-09T00:27:18Z","snapshot_observed_at":"2026-08-08T13:59:51.289748Z","submitted_at":"2023-12-05T00:42:35Z","title":"Efficient Online Data Mixing For Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":"2312.02406","doi":"10.48550/arxiv.2312.02406","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02406","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient online data mixing for language model pre-training","venue":"arXiv (Cornell University)","work_id":"f038029e-5113-4f29-9db3-7e5d6144e95f","year":2023},"citing_paper":{"arxiv_id":"2606.29858","last_updated":"2026-07-10T15:59:05Z","snapshot_observed_at":"2026-07-15T23:18:26.051643Z","submitted_at":"2026-06-29T06:53:30Z","title":"Smooth Scaling Laws Hide Stepwise Token Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T06:08:22.652557Z"},"links":{"cited_paper":"/paper/2312.02406","citing_paper":"/paper/2606.29858"},"observation_digest":"sha256:e4b5e9c28c674d01df3ee62ee2b082ba19330f85fb82c39932015f2d914debb5","observation_id":"4c3cf89b-205f-46bc-b4ad-a8646687d9e1","resolution":{"observed_at":"2026-06-30T08:14:26.553661Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02406","last_updated":"2023-12-09T00:27:18Z","snapshot_observed_at":"2026-08-08T13:59:51.289748Z","submitted_at":"2023-12-05T00:42:35Z","title":"Efficient Online Data Mixing For Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02406","snapshot_observed_at":"2026-07-13T07:15:03.029543Z","title":"Efficient online data mixing for language model pre-training.arXiv preprint arXiv:2312.02406, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.29858","last_updated":"2026-07-10T15:59:05Z","snapshot_observed_at":"2026-07-15T23:18:26.051643Z","submitted_at":"2026-06-29T06:53:30Z","title":"Smooth Scaling Laws Hide Stepwise Token Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T07:15:03.029543Z"},"links":{"cited_paper":"/paper/2312.02406","citing_paper":"/paper/2606.29858"},"observation_digest":"sha256:296227ea7e2b44bf17e58e4bb5542f3246dc4c5064f76441768a63760c57aae3","observation_id":"c6a2181e-ab22-42fa-94b5-ecccc8901c7d","resolution":{"observed_at":"2026-07-13T07:15:03.029543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02406","last_updated":"2023-12-09T00:27:18Z","snapshot_observed_at":"2026-08-08T13:59:51.289748Z","submitted_at":"2023-12-05T00:42:35Z","title":"Efficient Online Data Mixing For Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":"2312.02406","doi":"10.48550/arxiv.2312.02406","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02406","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient online data mixing for language model pre-training","venue":"arXiv (Cornell University)","work_id":"f038029e-5113-4f29-9db3-7e5d6144e95f","year":2023},"citing_paper":{"arxiv_id":"2607.01686","last_updated":"2026-07-02T04:27:45Z","snapshot_observed_at":"2026-08-02T22:27:38.007319Z","submitted_at":"2026-07-02T04:27:45Z","title":"WARP: Weight-Space Analysis for Recovering Training Data Portfolios","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-03T17:54:31.856386Z"},"links":{"cited_paper":"/paper/2312.02406","citing_paper":"/paper/2607.01686"},"observation_digest":"sha256:213bde0e7228bf28405419cc9743c0d87a906bd58a66d02b5f58fded3aafb1f6","observation_id":"64423c53-a41e-4643-9677-4e878e0b15e2","resolution":{"observed_at":"2026-07-03T17:58:46.729349Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2312.02406/citation-record","integrity":"/paper/2312.02406/integrity","json":"/paper/2312.02406/citation-record.json","paper":"/paper/2312.02406"},"outbound":[],"paper":{"arxiv_id":"2312.02406","last_updated":"2023-12-09T00:27:18Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T13:59:51.289748Z","submitted_at":"2023-12-05T00:42:35Z","title":"Efficient Online Data Mixing For Language Model Pre-Training"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 21 inbound Pith citation observations for arXiv:2312.02406."}