{"as_of":"2026-08-21T02:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c46fbcb9e4461db71cae24f640564bb2c7a9d3eb9cc4c0c99baa299eda70c03c","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T21:01:52.850037Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T12:45:04.860018Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.18663","last_updated":"2026-06-17T04:02:38Z","snapshot_observed_at":"2026-08-01T05:11:38.649391Z","submitted_at":"2026-06-17T04:02:38Z","title":"RegMix-D: Dynamic Data Mixing via Proxy Training Trajectories","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.18663","snapshot_observed_at":"2026-07-31T12:45:04.860018Z","title":"Regmix-d: Dynamic data mixing via proxy training trajectories","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24516","last_updated":"2026-07-27T14:55:04Z","snapshot_observed_at":"2026-08-17T21:36:07.601267Z","submitted_at":"2026-07-27T14:55:04Z","title":"DecoupleMix: Decoupled Ratio Search and Convex Allocation for Scalable VLM Data Recipes","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T12:45:04.860018Z"},"links":{"cited_paper":"/paper/2606.18663","citing_paper":"/paper/2607.24516"},"observation_digest":"sha256:c7ce7a17e832d0459dd2efe148aecb38f387fe54a8d619e4591ffa4e36654e73","observation_id":"3a1f65f6-93cd-4aeb-9728-8c0c636b21e0","resolution":{"observed_at":"2026-07-31T12:45:04.860018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.18663/citation-record","integrity":"/paper/2606.18663/integrity","json":"/paper/2606.18663/citation-record.json","paper":"/paper/2606.18663"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2606.18663","last_updated":"2026-06-17T04:02:38Z","snapshot_observed_at":"2026-08-01T05:11:38.649391Z","submitted_at":"2026-06-17T04:02:38Z","title":"RegMix-D: Dynamic Data Mixing via Proxy Training Trajectories","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T21:01:52.850037Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2606.18663"},"observation_digest":"sha256:c05324ca0e3fa1e2609d01f5e6e3a189eb467000ced9597d534ff70728a0e96e","observation_id":"c0dcb010-0124-49c0-b659-74bd88b45218","resolution":{"observed_at":"2026-07-04T00:39:17.553085Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15285","last_updated":"2024-12-18T18:41:18Z","snapshot_observed_at":"2026-08-18T23:32:05.050971Z","submitted_at":"2024-12-18T18:41:18Z","title":"Maximize Your Data's Potential: Enhancing LLM Accuracy with Two-Phase Pretraining","version":1},"cited_work":{"arxiv_id":"2412.15285","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15285","snapshot_observed_at":"2026-07-04T00:39:17.554218Z","title":"2412.15285 , archivePrefix=","venue":null,"work_id":"673253bd-80b6-455b-aa2a-6691f05385d1","year":null},"citing_paper":{"arxiv_id":"2606.18663","last_updated":"2026-06-17T04:02:38Z","snapshot_observed_at":"2026-08-01T05:11:38.649391Z","submitted_at":"2026-06-17T04:02:38Z","title":"RegMix-D: Dynamic Data Mixing via Proxy Training Trajectories","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T21:01:52.850037Z"},"links":{"cited_paper":"/paper/2412.15285","citing_paper":"/paper/2606.18663"},"observation_digest":"sha256:96119c6454244c8c14ade605b326d50e1d90c72ebf764b965d88e49b98383f78","observation_id":"0e1ab5ef-6b86-46ed-a171-5be072b032b1","resolution":{"observed_at":"2026-07-04T00:39:17.556230Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":"2101.00027","doi":"10.1117/1.jmi.10.6.061104","metadata_source":"pith","pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","venue":"cs.CL","work_id":"9b10667a-da61-4358-aceb-10578234d45d","year":2020},"citing_paper":{"arxiv_id":"2606.18663","last_updated":"2026-06-17T04:02:38Z","snapshot_observed_at":"2026-08-01T05:11:38.649391Z","submitted_at":"2026-06-17T04:02:38Z","title":"RegMix-D: Dynamic Data Mixing via Proxy Training Trajectories","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T21:01:52.850037Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2606.18663"},"observation_digest":"sha256:cd923726488f210d450ebe3d5c2f5942aede390da4cd0429713921af86719127","observation_id":"4019f4de-d7b8-49c4-a154-e47b2509ba3b","resolution":{"observed_at":"2026-07-04T00:39:17.552904Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2606.18663","last_updated":"2026-06-17T04:02:38Z","snapshot_observed_at":"2026-08-01T05:11:38.649391Z","submitted_at":"2026-06-17T04:02:38Z","title":"RegMix-D: Dynamic Data Mixing via Proxy Training Trajectories","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T21:01:52.850037Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2606.18663"},"observation_digest":"sha256:bcb31cffebc6987e028e81c0ff1c513702051099e3fa0ddea0ce68db85e6ce7d","observation_id":"d94a8064-3839-4ad5-b279-7b3f0505cdfe","resolution":{"observed_at":"2026-07-04T00:39:17.546858Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:01:52.850037Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.18663","last_updated":"2026-06-17T04:02:38Z","snapshot_observed_at":"2026-08-01T05:11:38.649391Z","submitted_at":"2026-06-17T04:02:38Z","title":"RegMix-D: Dynamic Data Mixing via Proxy Training Trajectories","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T21:01:52.850037Z"},"links":{"citing_paper":"/paper/2606.18663"},"observation_digest":"sha256:771378bc5ac9b58626c5fe6e168a29a951c10cfd7fa49dcc78de7efef1af5794","observation_id":"aefbebaa-8c51-44ec-9920-27463424066b","resolution":{"observed_at":"2026-06-26T21:01:52.850037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:01:52.850037Z","title":"In Proceedings of the 2017 Conference on Empirical Methods in Natural Language Processing, pages 785– 794, Copenhagen, Denmark","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.18663","last_updated":"2026-06-17T04:02:38Z","snapshot_observed_at":"2026-08-01T05:11:38.649391Z","submitted_at":"2026-06-17T04:02:38Z","title":"RegMix-D: Dynamic Data Mixing via Proxy Training Trajectories","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T21:01:52.850037Z"},"links":{"citing_paper":"/paper/2606.18663"},"observation_digest":"sha256:3f53a9a47e4a1ec86fd5f1e3a4c4e2dbd28696fcf1dc6f7db4f16c533049c7ef","observation_id":"22294470-aed9-49ba-9166-c8b75cbd77e1","resolution":{"observed_at":"2026-06-26T21:01:52.850037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.00747","last_updated":"2026-05-29T07:01:19Z","snapshot_observed_at":"2026-08-16T05:10:44.997332Z","submitted_at":"2026-01-31T14:27:46Z","title":"Decouple Searching from Training: Scaling Data Mixing via Model Merging for Large Language Model Pre-training","version":3},"cited_work":{"arxiv_id":"2602.00747","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.00747","snapshot_observed_at":"2026-07-04T00:39:17.536427Z","title":"Decouple searching from training: Scaling data mixing via model merging for large language model pre-training","venue":"cs.CL","work_id":"a4fd8a43-993b-4d61-9888-389ccd6180d9","year":2026},"citing_paper":{"arxiv_id":"2606.18663","last_updated":"2026-06-17T04:02:38Z","snapshot_observed_at":"2026-08-01T05:11:38.649391Z","submitted_at":"2026-06-17T04:02:38Z","title":"RegMix-D: Dynamic Data Mixing via Proxy Training Trajectories","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T21:01:52.850037Z"},"links":{"cited_paper":"/paper/2602.00747","citing_paper":"/paper/2606.18663"},"observation_digest":"sha256:49c8a6c2ef638d8536fad8b93aaf6a8b77f121d3a97118354831712d967aff75","observation_id":"699bda87-0340-45ae-93ba-1481266202f4","resolution":{"observed_at":"2026-07-04T00:39:17.537860Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.08124","last_updated":"2020-07-16T05:52:16Z","snapshot_observed_at":"2026-08-18T19:00:40.885312Z","submitted_at":"2020-07-16T05:52:16Z","title":"LogiQA: A Challenge Dataset for Machine Reading Comprehension with Logical Reasoning","version":1},"cited_work":{"arxiv_id":"2007.08124","doi":"10.48550/arxiv.2007.08124","metadata_source":"arxiv_reference","pith_arxiv_id":"2007.08124","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2007.08124 (2020)","venue":"arXiv (Cornell University)","work_id":"32452451-f619-44d7-b8e3-a44f4ef1d284","year":2007},"citing_paper":{"arxiv_id":"2606.18663","last_updated":"2026-06-17T04:02:38Z","snapshot_observed_at":"2026-08-01T05:11:38.649391Z","submitted_at":"2026-06-17T04:02:38Z","title":"RegMix-D: Dynamic Data Mixing via Proxy Training Trajectories","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T21:01:52.850037Z"},"links":{"cited_paper":"/paper/2007.08124","citing_paper":"/paper/2606.18663"},"observation_digest":"sha256:674417043bce565cb72fc5c4316b1032cc5dc45e4923eda7e8eb12183bb8842c","observation_id":"489123d4-9d43-41e4-af03-6104752a8a4d","resolution":{"observed_at":"2026-07-04T00:39:17.537323Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.23878","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:19:57.837117Z","title":"Actor-critic based online data mixing for language model pre-training","venue":null,"work_id":"f898f95a-5035-42af-be5b-f391c2514605","year":2025},"citing_paper":{"arxiv_id":"2606.18663","last_updated":"2026-06-17T04:02:38Z","snapshot_observed_at":"2026-08-01T05:11:38.649391Z","submitted_at":"2026-06-17T04:02:38Z","title":"RegMix-D: Dynamic Data Mixing via Proxy Training Trajectories","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T21:01:52.850037Z"},"links":{"citing_paper":"/paper/2606.18663"},"observation_digest":"sha256:700069b474f74199f51b4390da19c02ff25479d54783bcf0517024678e7a43b8","observation_id":"b9e68ac3-901a-49f9-9706-64114889e587","resolution":{"observed_at":"2026-07-04T00:39:17.535109Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.06826","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T18:40:03.223224Z","title":"Mid-training of large language models: A survey","venue":null,"work_id":"2d258d6b-f30c-4f76-b61a-2ebf6a4434cd","year":2025},"citing_paper":{"arxiv_id":"2606.18663","last_updated":"2026-06-17T04:02:38Z","snapshot_observed_at":"2026-08-01T05:11:38.649391Z","submitted_at":"2026-06-17T04:02:38Z","title":"RegMix-D: Dynamic Data Mixing via Proxy Training Trajectories","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T21:01:52.850037Z"},"links":{"citing_paper":"/paper/2606.18663"},"observation_digest":"sha256:7f9572290a3214a6bd00c92eceb82ac828feebc7129d764ea6fc6a7c4a9dc776","observation_id":"ecfa4696-2537-4850-8d61-a12e22caf124","resolution":{"observed_at":"2026-07-04T00:39:17.559034Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:01:52.850037Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.18663","last_updated":"2026-06-17T04:02:38Z","snapshot_observed_at":"2026-08-01T05:11:38.649391Z","submitted_at":"2026-06-17T04:02:38Z","title":"RegMix-D: Dynamic Data Mixing via Proxy Training Trajectories","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T21:01:52.850037Z"},"links":{"citing_paper":"/paper/2606.18663"},"observation_digest":"sha256:408661f6959b5cfa5cc78c0e5433e9e1cb67ef815c79cc6b302e3a320316069b","observation_id":"c80f5aa4-5e42-4fa7-929a-96ba99600a4c","resolution":{"observed_at":"2026-06-26T21:01:52.850037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10641","last_updated":"2019-11-21T19:01:32Z","snapshot_observed_at":"2026-08-16T10:42:13.725165Z","submitted_at":"2019-07-24T18:11:59Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","version":2},"cited_work":{"arxiv_id":"1907.10641","doi":"10.48550/arxiv.1907.10641","metadata_source":"pith","pith_arxiv_id":"1907.10641","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","venue":"cs.CL","work_id":"9587a902-54ad-434e-9cbc-bdfe54b5d3bf","year":2019},"citing_paper":{"arxiv_id":"2606.18663","last_updated":"2026-06-17T04:02:38Z","snapshot_observed_at":"2026-08-01T05:11:38.649391Z","submitted_at":"2026-06-17T04:02:38Z","title":"RegMix-D: Dynamic Data Mixing via Proxy Training Trajectories","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T21:01:52.850037Z"},"links":{"cited_paper":"/paper/1907.10641","citing_paper":"/paper/2606.18663"},"observation_digest":"sha256:6e68157250b93718600f18f2d65a911eac2642d9fb70904911940cc0fcffe006","observation_id":"849c506c-7a93-4ba5-9b91-5648810c9074","resolution":{"observed_at":"2026-07-04T00:39:17.528125Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-14T20:38:10.649009+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-14T20:38:10.649009+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:01:52.850037Z","title":"InProceedings of the 2018 EMNLP Workshop BlackboxNLP: Analyzing and Interpreting Neural Networks for NLP, pages 353–355, Brussels, Belgium","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.18663","last_updated":"2026-06-17T04:02:38Z","snapshot_observed_at":"2026-08-01T05:11:38.649391Z","submitted_at":"2026-06-17T04:02:38Z","title":"RegMix-D: Dynamic Data Mixing via Proxy Training Trajectories","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T21:01:52.850037Z"},"links":{"citing_paper":"/paper/2606.18663"},"observation_digest":"sha256:2c9c1a43fe8dce58f5fb7f795f41a4506de6a06ab5b573943fbffa54560d8c62","observation_id":"8659ef9b-b49a-45a2-836c-a48f5c29553e","resolution":{"observed_at":"2026-06-26T21:01:52.850037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.17858","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:39:17.522624Z","title":"Mergemix: Optimizing mid-training data mixtures via learnable model merging","venue":null,"work_id":"b67de2ff-bb70-4101-bdeb-88b4dba89e0f","year":2026},"citing_paper":{"arxiv_id":"2606.18663","last_updated":"2026-06-17T04:02:38Z","snapshot_observed_at":"2026-08-01T05:11:38.649391Z","submitted_at":"2026-06-17T04:02:38Z","title":"RegMix-D: Dynamic Data Mixing via Proxy Training Trajectories","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T21:01:52.850037Z"},"links":{"citing_paper":"/paper/2606.18663"},"observation_digest":"sha256:80a67f22e13e7a4338467b8c430a424b3afec12e193a0bf29b61e9658035bf66","observation_id":"f8b5a224-a9e0-4bf7-baf7-91a14c9c785d","resolution":{"observed_at":"2026-07-04T00:39:17.524351Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17677","last_updated":"2025-08-25T05:18:32Z","snapshot_observed_at":"2026-08-20T15:36:24.786499Z","submitted_at":"2025-08-25T05:18:32Z","title":"TiKMiX: Take Data Influence into Dynamic Mixture for Language Model Pre-training","version":1},"cited_work":{"arxiv_id":"2508.17677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17677","snapshot_observed_at":"2026-07-04T00:39:17.539077Z","title":"Tikmix: Take data influence into dynamic mixture for language model pre-training","venue":null,"work_id":"e5038085-2c02-45c9-b449-8ecce956acc6","year":2025},"citing_paper":{"arxiv_id":"2606.18663","last_updated":"2026-06-17T04:02:38Z","snapshot_observed_at":"2026-08-01T05:11:38.649391Z","submitted_at":"2026-06-17T04:02:38Z","title":"RegMix-D: Dynamic Data Mixing via Proxy Training Trajectories","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T21:01:52.850037Z"},"links":{"cited_paper":"/paper/2508.17677","citing_paper":"/paper/2606.18663"},"observation_digest":"sha256:3d9d79d1f20cad95162c5cb7d43b64978e2304ed97fe5b71e1222990130c4c8e","observation_id":"e0262ce9-b9e8-49f8-b9df-7a43575e99d6","resolution":{"observed_at":"2026-07-04T00:39:17.540921Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02385","last_updated":"2024-06-04T02:05:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T17:54:59Z","title":"TinyLlama: An Open-Source Small Language Model","version":2},"cited_work":{"arxiv_id":"2401.02385","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.02385","snapshot_observed_at":"2026-07-09T21:16:34.311040Z","title":"TinyLlama: An Open-Source Small Language Model","venue":"cs.CL","work_id":"d2c14bfc-b868-4f6d-8b13-12bf89321d47","year":2024},"citing_paper":{"arxiv_id":"2606.18663","last_updated":"2026-06-17T04:02:38Z","snapshot_observed_at":"2026-08-01T05:11:38.649391Z","submitted_at":"2026-06-17T04:02:38Z","title":"RegMix-D: Dynamic Data Mixing via Proxy Training Trajectories","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T21:01:52.850037Z"},"links":{"cited_paper":"/paper/2401.02385","citing_paper":"/paper/2606.18663"},"observation_digest":"sha256:30b8e37f309e3d85f7d5bf5cdf636add882e746f8a57491cf2e71c0816852c8e","observation_id":"2920864c-b146-4915-bb6e-d750804183b7","resolution":{"observed_at":"2026-07-04T00:39:17.543672Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T21:01:52.850037Z","title":"Proxy models are trained on 1 H800 GPU for 1,000 steps (1M tokens per step) and the target model is trained on 8 GPUs for 25,000 steps, totaling 25B tokens","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2606.18663","last_updated":"2026-06-17T04:02:38Z","snapshot_observed_at":"2026-08-01T05:11:38.649391Z","submitted_at":"2026-06-17T04:02:38Z","title":"RegMix-D: Dynamic Data Mixing via Proxy Training Trajectories","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T21:01:52.850037Z"},"links":{"citing_paper":"/paper/2606.18663"},"observation_digest":"sha256:20920588d51ea9b20f11dd5199f5fd45971d124015443328ab00155f32093c5c","observation_id":"9d36d063-dda9-4aad-9111-0812867c0288","resolution":{"observed_at":"2026-06-26T21:01:52.850037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0248.2448","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:39:17.519821Z","title":"We use the Pile-CC validation loss as the target predicted loss","venue":null,"work_id":"1257a7ee-2005-4976-9ed0-ed814980b7d5","year":2019},"citing_paper":{"arxiv_id":"2606.18663","last_updated":"2026-06-17T04:02:38Z","snapshot_observed_at":"2026-08-01T05:11:38.649391Z","submitted_at":"2026-06-17T04:02:38Z","title":"RegMix-D: Dynamic Data Mixing via Proxy Training Trajectories","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T21:01:52.850037Z"},"links":{"citing_paper":"/paper/2606.18663"},"observation_digest":"sha256:57d10cfb05aa4ccb50680c920ca82da82659f99952d541ca1167957db2368067","observation_id":"ff8a444e-eb64-4f55-b07f-0a8e434be125","resolution":{"observed_at":"2026-07-04T00:39:17.521440Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.18663","last_updated":"2026-06-17T04:02:38Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-01T05:11:38.649391Z","submitted_at":"2026-06-17T04:02:38Z","title":"RegMix-D: Dynamic Data Mixing via Proxy Training Trajectories"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":12,"parse_uncertain":0,"unresolved":5,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 1 inbound Pith citation observation for arXiv:2606.18663."}