{"as_of":"2026-08-06T03:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6506ea3a65d6943cf5a441c03dc5c2263a0016b4eabae661868dcf677ffcecfe","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T21:05:26.614578Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:19:57.811085Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":"2403.16952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-07-04T16:19:57.811085Z","title":"Data mixing laws: Optimizing data mixtures by predicting language modeling performance","venue":null,"work_id":"bae2fa4c-1471-459e-9a6f-e1d7f0b200c2","year":2024},"citing_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-13T18:00:53.389420Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2404.06395"},"observation_digest":"sha256:647bc55a8f8356aee13d846ad519c391ae2d01d0a7a7b8588d0e56c2e79cf1cb","observation_id":"55cf0bf7-c786-460d-8a03-aada044e2867","resolution":{"observed_at":"2026-05-13T18:00:53.498646Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":"2403.16952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-07-04T16:19:57.811085Z","title":"Data mixing laws: Optimizing data mixtures by predicting language modeling performance","venue":null,"work_id":"bae2fa4c-1471-459e-9a6f-e1d7f0b200c2","year":2024},"citing_paper":{"arxiv_id":"2504.09844","last_updated":"2026-04-27T14:30:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T03:31:22Z","title":"MegaScale-Data: Scaling Dataloader for Multisource Large Foundation Model Training","version":4},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-22T21:12:22.201810Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2504.09844"},"observation_digest":"sha256:6f79c3b5c1e0866f293f21433bfa91b2dbbd019f677d705d531e151d9e751204","observation_id":"f3992b5e-320c-44e4-97a6-1b4e7a591ed3","resolution":{"observed_at":"2026-05-22T21:15:09.608695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":"2403.16952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-07-04T16:19:57.811085Z","title":"Data mixing laws: Optimizing data mixtures by predicting language modeling performance","venue":null,"work_id":"bae2fa4c-1471-459e-9a6f-e1d7f0b200c2","year":2024},"citing_paper":{"arxiv_id":"2507.15640","last_updated":"2026-04-12T09:28:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-21T14:01:54Z","title":"Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-training","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-19T03:36:50.366757Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2507.15640"},"observation_digest":"sha256:c845f31776165f641e049fc0f59ccea0b67786448ed28dcd70cbb78a26c09161","observation_id":"a2699ca4-c700-4482-b3f7-f4859ccf8536","resolution":{"observed_at":"2026-05-19T03:37:00.829310Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-08-02T21:05:26.614578Z","title":"Data mixing laws: Optimizing data mixtures by predicting language modeling performance.ArXiv, abs/2403.16952,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.21492","last_updated":"2026-07-18T04:56:29Z","snapshot_observed_at":"2026-08-04T06:06:14.689327Z","submitted_at":"2026-02-25T01:54:50Z","title":"GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T21:05:26.614578Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2602.21492"},"observation_digest":"sha256:0839a9aff9cf284119a2a77a3e15e9f1c9b7b754df634879a16c768bcedd77f6","observation_id":"486b6b78-bd24-4905-841b-b6487ca3b1de","resolution":{"observed_at":"2026-08-02T21:05:26.614578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":"2403.16952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-07-04T16:19:57.811085Z","title":"Data mixing laws: Optimizing data mixtures by predicting language modeling performance","venue":null,"work_id":"bae2fa4c-1471-459e-9a6f-e1d7f0b200c2","year":2024},"citing_paper":{"arxiv_id":"2604.19341","last_updated":"2026-04-21T11:24:09Z","snapshot_observed_at":"2026-07-06T23:06:02.635464Z","submitted_at":"2026-04-21T11:24:09Z","title":"Evaluation-driven Scaling for Scientific Discovery","version":1},"reference_index":165,"source":"pdf_text","source_observed_at":"2026-05-10T03:39:52.204043Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2604.19341"},"observation_digest":"sha256:ed23413e0a2eda2c4abff49e9a001850411290cb6897ad1efaf79d0bc0044b18","observation_id":"89741ca0-f45b-4bd2-b4e4-1bafc3b8a197","resolution":{"observed_at":"2026-05-11T12:26:06.999694Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":"2403.16952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-07-04T16:19:57.811085Z","title":"Data mixing laws: Optimizing data mixtures by predicting language modeling performance","venue":null,"work_id":"bae2fa4c-1471-459e-9a6f-e1d7f0b200c2","year":2024},"citing_paper":{"arxiv_id":"2605.06859","last_updated":"2026-05-07T19:00:12Z","snapshot_observed_at":"2026-08-02T07:36:10.858134Z","submitted_at":"2026-05-07T19:00:12Z","title":"Knowledge Transfer Scaling Laws for 3D Medical Imaging","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-11T01:30:50.324360Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2605.06859"},"observation_digest":"sha256:8ae227f3aa24a087fd922dca72e35e3decc25820c3bb965b2f98a7b44aaadde1","observation_id":"fef432e1-3217-462a-b59d-b0ca16be6637","resolution":{"observed_at":"2026-05-11T01:45:51.622263Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":"2403.16952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-07-04T16:19:57.811085Z","title":"Data mixing laws: Optimizing data mixtures by predicting language modeling performance","venue":null,"work_id":"bae2fa4c-1471-459e-9a6f-e1d7f0b200c2","year":2024},"citing_paper":{"arxiv_id":"2605.07546","last_updated":"2026-05-08T10:21:09Z","snapshot_observed_at":"2026-07-06T23:19:56.415523Z","submitted_at":"2026-05-08T10:21:09Z","title":"On the Invariance and Generality of Neural Scaling Laws","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-11T02:34:14.087140Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2605.07546"},"observation_digest":"sha256:2b838bb136030cc3483d39349e2c6841d9563602ae0ca77b45983e40a73e5aff","observation_id":"0fb22db8-e891-4c72-bfaf-c83f20e2eb62","resolution":{"observed_at":"2026-05-11T03:15:56.035239Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":"2403.16952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-07-04T16:19:57.811085Z","title":"Data mixing laws: Optimizing data mixtures by predicting language modeling performance","venue":null,"work_id":"bae2fa4c-1471-459e-9a6f-e1d7f0b200c2","year":2024},"citing_paper":{"arxiv_id":"2605.12715","last_updated":"2026-05-15T17:01:07Z","snapshot_observed_at":"2026-07-06T23:24:23.402304Z","submitted_at":"2026-05-12T20:22:45Z","title":"Scaling Laws for Mixture Pretraining Under Data Constraints","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-14T21:44:31.429223Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2605.12715"},"observation_digest":"sha256:1dc814151fa80f43dd74ad3bab543e0c62c6636647f24d59e7bc6f8837341f92","observation_id":"854f6c11-7a77-439d-b3c0-053bd22b24d3","resolution":{"observed_at":"2026-05-14T21:48:00.954431Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":"2403.16952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-07-04T16:19:57.811085Z","title":"Data mixing laws: Optimizing data mixtures by predicting language modeling performance","venue":null,"work_id":"bae2fa4c-1471-459e-9a6f-e1d7f0b200c2","year":2024},"citing_paper":{"arxiv_id":"2605.13225","last_updated":"2026-05-13T09:17:51Z","snapshot_observed_at":"2026-08-02T19:28:51.230887Z","submitted_at":"2026-05-13T09:17:51Z","title":"Mix, Don't Tune: Bilingual Pre-Training Outperforms Hyperparameter Search in Data-Constrained Settings","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-14T20:17:26.661595Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2605.13225"},"observation_digest":"sha256:6620e089365c259361be4d5a226bcb65706f9a70d5649dc87cb06ac7e4ab5510","observation_id":"a69322f0-547a-4290-83bf-0595bd573e66","resolution":{"observed_at":"2026-05-14T20:19:27.486738Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":"2403.16952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-07-04T16:19:57.811085Z","title":"Data mixing laws: Optimizing data mixtures by predicting language modeling performance","venue":null,"work_id":"bae2fa4c-1471-459e-9a6f-e1d7f0b200c2","year":2024},"citing_paper":{"arxiv_id":"2605.31164","last_updated":"2026-05-29T11:13:43Z","snapshot_observed_at":"2026-07-06T23:40:22.583302Z","submitted_at":"2026-05-29T11:13:43Z","title":"D$^3$: Dynamic Directional Graph-Constrained Data Scheduling for LLM Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T22:41:12.453128Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2605.31164"},"observation_digest":"sha256:ab32eadb53abd27a4c2cd97d01a79439f36d29019aa736e698a7297cf6275d2e","observation_id":"1e6235db-4944-4a0b-bcb3-0c2bd92e20cb","resolution":{"observed_at":"2026-06-28T22:42:46.231130Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":"2403.16952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-07-04T16:19:57.811085Z","title":"Data mixing laws: Optimizing data mixtures by predicting language modeling performance","venue":null,"work_id":"bae2fa4c-1471-459e-9a6f-e1d7f0b200c2","year":2024},"citing_paper":{"arxiv_id":"2606.05029","last_updated":"2026-06-03T15:57:42Z","snapshot_observed_at":"2026-08-01T16:51:47.025025Z","submitted_at":"2026-06-03T15:57:42Z","title":"Validity Threats for Foundation Model Research","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-06-28T06:52:41.653304Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2606.05029"},"observation_digest":"sha256:c032652dc8ead0d244fa9cdd00d6fae513136919988eb211ffdff88bc6af4235","observation_id":"8f41a52d-1312-4e67-9349-18a28f33a787","resolution":{"observed_at":"2026-07-02T07:36:44.897985Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":"2403.16952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-07-04T16:19:57.811085Z","title":"Data mixing laws: Optimizing data mixtures by predicting language modeling performance","venue":null,"work_id":"bae2fa4c-1471-459e-9a6f-e1d7f0b200c2","year":2024},"citing_paper":{"arxiv_id":"2606.24133","last_updated":"2026-06-23T04:32:46Z","snapshot_observed_at":"2026-07-06T23:58:44.541819Z","submitted_at":"2026-06-23T04:32:46Z","title":"Holistic Data Scheduler for LLM Pre-training via Multi-Objective Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T00:46:13.587037Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2606.24133"},"observation_digest":"sha256:4c8ab405d1fbb0401d35fff7ad10a1ed6004476367e8c20864af9b6b780a8aac","observation_id":"60a76257-86aa-4335-9722-75b17b21b171","resolution":{"observed_at":"2026-07-04T16:19:57.812566Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":"2403.16952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-07-04T16:19:57.811085Z","title":"Data mixing laws: Optimizing data mixtures by predicting language modeling performance","venue":null,"work_id":"bae2fa4c-1471-459e-9a6f-e1d7f0b200c2","year":2024},"citing_paper":{"arxiv_id":"2606.28471","last_updated":"2026-06-26T14:45:57Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T14:45:57Z","title":"Data and Evaluation Closed-Loop for Model Capability Enhancement","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-30T01:33:08.134048Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2606.28471"},"observation_digest":"sha256:d45e66778aa557eb5910c0f4c6d1d77fa9bdaf4c83981dc529cf38be0915cc15","observation_id":"7cefba8d-d3b0-4c9e-b540-1fdc4c684421","resolution":{"observed_at":"2026-07-01T15:25:48.051684Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":"2403.16952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-07-04T16:19:57.811085Z","title":"Data mixing laws: Optimizing data mixtures by predicting language modeling performance","venue":null,"work_id":"bae2fa4c-1471-459e-9a6f-e1d7f0b200c2","year":2024},"citing_paper":{"arxiv_id":"2607.02266","last_updated":"2026-07-02T14:51:42Z","snapshot_observed_at":"2026-08-01T16:10:16.151976Z","submitted_at":"2026-07-02T14:51:42Z","title":"HERMES: A Multi-Granularity Labeling Substrate for Pre-training Data Mixtures","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-03T16:44:41.720388Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2607.02266"},"observation_digest":"sha256:c713942f3d45ff69883593e3c2f34d84acd7575b30d9568c08219c1ff1515226","observation_id":"a752bcf8-4bee-40a3-8504-d02272321cae","resolution":{"observed_at":"2026-07-03T16:48:39.450809Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-07-12T01:54:44.256835Z","title":"arXiv preprint arXiv:2403.16952 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03522","last_updated":"2026-07-03T17:50:03Z","snapshot_observed_at":"2026-07-12T01:54:40.664960Z","submitted_at":"2026-07-03T17:50:03Z","title":"Co-Adaptive Multi-Task LoRA: Transfer-Aware, Label-Free Control of Domain Participation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-12T01:54:44.256835Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2607.03522"},"observation_digest":"sha256:a257181d68cee60cfdbff7ccc1ae01cfb9bd7a796515fd8b8351b07bed5cd14f","observation_id":"808aa92c-8e34-43b1-9180-58d2f58b0605","resolution":{"observed_at":"2026-07-12T01:54:44.256835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-07-14T07:24:27.255815Z","title":"Data mixing laws: Optimizing data mixtures by predicting language modeling performance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11052","last_updated":"2026-07-13T03:31:03Z","snapshot_observed_at":"2026-08-06T00:22:57.583274Z","submitted_at":"2026-07-13T03:31:03Z","title":"Domain-Aware Scaling Laws Uncover Data Synergy","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T07:24:27.255815Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2607.11052"},"observation_digest":"sha256:4585774f06c7e9107e7f967eef5cc710c7899d9323913112c0044117da8abf82","observation_id":"72a3f635-59e7-4db1-9179-1a7d6df13ef4","resolution":{"observed_at":"2026-07-14T07:24:27.255815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-08-01T14:24:46.118299Z","title":"Data mixing laws: Optimizing data mixtures by predicting language modeling performance.arXiv preprint arXiv:2403.16952,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18789","last_updated":"2026-07-21T07:07:19Z","snapshot_observed_at":"2026-08-03T00:36:19.592702Z","submitted_at":"2026-07-21T07:07:19Z","title":"Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T14:24:46.118299Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2607.18789"},"observation_digest":"sha256:ba6dcd064a10d3c06a98c5f995c60cf98813c30051ee6183cc2f7687f0593787","observation_id":"22de8f3c-08d4-4808-a226-b81939f715aa","resolution":{"observed_at":"2026-08-01T14:24:46.118299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-08-01T10:34:41.807413Z","title":"Data mixing laws: Optimizing data mixtures by predicting language modeling performance.arXiv preprint arXiv:2403.16952, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27281","last_updated":"2026-07-29T13:46:52Z","snapshot_observed_at":"2026-08-05T13:25:15.469453Z","submitted_at":"2026-07-29T13:46:52Z","title":"The Kinetics of Training: A Driven-Nucleation Rate Law for Emergence, Plasticity Loss, and Circuit Control in Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T10:34:41.807413Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2607.27281"},"observation_digest":"sha256:05b8a74fa17de5e59c64e27f66aca10f97a4a04a6088de21624e5617958d0219","observation_id":"ddca782f-f0ad-4a5e-b0fb-b577d2f1ceab","resolution":{"observed_at":"2026-08-01T10:34:41.807413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2403.16952/citation-record","integrity":"/paper/2403.16952/integrity","json":"/paper/2403.16952/citation-record.json","paper":"/paper/2403.16952"},"outbound":[],"paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 18 inbound Pith citation observations for arXiv:2403.16952."}