{"as_of":"2026-08-08T04:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b590eacb2f09109002ccf3e82ca8cf443906cbd12d56c2204a9afa506a4427fa","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:33:55.004931Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.21598/citation-record","integrity":"/paper/2505.21598/integrity","json":"/paper/2505.21598/citation-record.json","paper":"/paper/2505.21598"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.16827","last_updated":"2024-08-02T17:59:31Z","snapshot_observed_at":"2026-08-03T03:15:21.035418Z","submitted_at":"2024-02-26T18:54:35Z","title":"A Survey on Data Selection for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16827","snapshot_observed_at":"2026-08-07T13:33:48.370150Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:48.370150Z"},"links":{"cited_paper":"/paper/2402.16827","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:b1dfd2749e626e138a6c30ef45674610cd7a1fe41725226aa4203a01c4ebaee8","observation_id":"36bc18a6-cb30-40c1-a97f-4897f475f9cf","resolution":{"observed_at":"2026-08-07T13:33:48.370150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02406","last_updated":"2023-12-09T00:27:18Z","snapshot_observed_at":"2026-07-06T16:56:57.763886Z","submitted_at":"2023-12-05T00:42:35Z","title":"Efficient Online Data Mixing For Language Model Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02406","snapshot_observed_at":"2026-08-07T13:33:48.487199Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:48.487199Z"},"links":{"cited_paper":"/paper/2312.02406","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:30c6f098c8c9793a8ffcdfc8a1192b073f2ebcdea3fa2361d4493587e5de6857","observation_id":"62f76901-e1cd-4dd5-b557-a4ee9abbe3a4","resolution":{"observed_at":"2026-08-07T13:33:48.487199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:58.249138Z","title":null,"venue":null,"work_id":"884f1abe-20b0-47e3-bf31-6dac5050ac28","year":2002},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:48.603636Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:5fdc073aea1821c65c2e407afef21a73323d13073bbfddf75ad4aa0042a28900","observation_id":"882719b5-0d86-4d79-951b-57fdb5e0f51b","resolution":{"observed_at":"2026-08-07T13:33:58.307035Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15950","last_updated":"2025-02-21T21:27:48Z","snapshot_observed_at":"2026-08-07T17:57:27.395782Z","submitted_at":"2025-02-21T21:27:48Z","title":"Optimizing Pre-Training Data Mixtures with Mixtures of Data Expert Models","version":1},"cited_work":{"arxiv_id":"2502.15950","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.15950","snapshot_observed_at":"2026-08-07T13:33:57.298782Z","title":"Optimizing Pre-Training Data Mixtures with Mixtures of Data Expert Models","venue":"cs.LG","work_id":"dff2628a-7ed6-47a7-a667-bb6524c98cea","year":2025},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:48.730422Z"},"links":{"cited_paper":"/paper/2502.15950","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:0c122b2e18a0323f0cd56b9ba07415ec2586080b794dd95db24978c08eac5ad3","observation_id":"b4addb51-6306-41eb-b8c1-294a5259ce6b","resolution":{"observed_at":"2026-08-07T13:33:57.368547Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:48.893722Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:48.893722Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:28ec51b80630990ff4c9cb2f7c53c9fecf7f2ab4363b780f73788d3b30c75023","observation_id":"ab01c965-32fd-4ebb-b0ae-849adfda1d2f","resolution":{"observed_at":"2026-08-07T13:33:48.893722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05735","last_updated":"2025-04-21T03:50:23Z","snapshot_observed_at":"2026-07-06T19:47:34.320753Z","submitted_at":"2024-11-08T17:50:24Z","title":"Aioli: A Unified Optimization Framework for Language Model Data Mixing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05735","snapshot_observed_at":"2026-08-07T13:33:49.082128Z","title":"Chen, Michael Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:49.082128Z"},"links":{"cited_paper":"/paper/2411.05735","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:aae644cbb983459534df581ca395b698e5b941314776501c0e8fdbe5400be858","observation_id":"74c29320-b6e8-4c06-b69c-a39e6b5ba3d9","resolution":{"observed_at":"2026-08-07T13:33:49.082128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14430","last_updated":"2023-07-26T18:01:49Z","snapshot_observed_at":"2026-08-02T22:31:42.480177Z","submitted_at":"2023-07-26T18:01:49Z","title":"Skill-it! A Data-Driven Skills Framework for Understanding and Training Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14430","snapshot_observed_at":"2026-08-07T13:33:49.258242Z","title":"Chen, Nicholas Roberts, Kush Bhatia, Jue Wang, Ce Zhang, Frederic Sala, and Christopher Ré","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:49.258242Z"},"links":{"cited_paper":"/paper/2307.14430","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:f46cfd664572e454a26dc81ae225056984fff57caa3285ce834461cc75ee27b1","observation_id":"bcc8f024-6663-461c-8527-49b1cecfbe75","resolution":{"observed_at":"2026-08-07T13:33:49.258242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-07-06T14:08:18.855958Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-08-07T13:33:49.385365Z","title":"Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:49.385365Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:cfb55fff64e71fd3273e2d6c3ea818b46d645dabd0ce65f459e187ef80fd0f68","observation_id":"e3ce5e90-f245-477f-a761-efa5cf0f381d","resolution":{"observed_at":"2026-08-07T13:33:49.385365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.00141","last_updated":"2018-02-13T16:33:55Z","snapshot_observed_at":"2026-07-06T06:07:09.962753Z","submitted_at":"2017-10-31T23:09:08Z","title":"Training GANs with Optimism","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.00141","snapshot_observed_at":"2026-08-07T13:33:49.511514Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:49.511514Z"},"links":{"cited_paper":"/paper/1711.00141","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:ced0e64906b5bcbd9750946b0d6442df5c956b41795222f1d47b5168e794f03c","observation_id":"23546973-3ab1-4667-a1c8-176bd45dbb1e","resolution":{"observed_at":"2026-08-07T13:33:49.511514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1807.03907","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:56.988686Z","title":null,"venue":null,"work_id":"c58aeece-92f2-4b0b-bcc7-cf0d504fe922","year":2018},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:49.614639Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:3a81754c6e9a297a03f78af55f15986bfd1c8542a7ad6bed15c8033e29c09b64","observation_id":"f28c872d-09c2-4910-96ae-4e6d2f031454","resolution":{"observed_at":"2026-08-07T13:33:57.103547Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.06905","last_updated":"2022-08-01T21:07:58Z","snapshot_observed_at":"2026-07-06T12:18:14.988251Z","submitted_at":"2021-12-13T18:58:19Z","title":"GLaM: Efficient Scaling of Language Models with Mixture-of-Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.06905","snapshot_observed_at":"2026-08-07T13:33:49.759942Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:49.759942Z"},"links":{"cited_paper":"/paper/2112.06905","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:b550be879208e69d2a0403761eeae01c294b24b54c1741fe61aa94c1981274fa","observation_id":"963250a7-090d-4ab7-9b92-d715f9f2a4b9","resolution":{"observed_at":"2026-08-07T13:33:49.759942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:49.915397Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:49.915397Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:b68edfd816d8b8d30e0373d45d3670cdb357a8dad2c33b43bf60c3d39cdb2ddd","observation_id":"fd576d84-729d-4da9-a0a7-2ed46f8e60e4","resolution":{"observed_at":"2026-08-07T13:33:49.915397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:58.056821Z","title":null,"venue":null,"work_id":"3f20a321-532b-4544-a2ad-4d3595a1c1c6","year":2023},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:50.039377Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:41992f324e06b96c5bc2bee2483ea2912bffbd008973489b78978fde84d642f7","observation_id":"b5ee6c42-924a-406c-ba0f-feb001fb6ba3","resolution":{"observed_at":"2026-08-07T13:33:58.127646Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.01785","last_updated":"2017-12-12T17:17:59Z","snapshot_observed_at":"2026-07-06T05:32:29.378894Z","submitted_at":"2017-03-06T09:44:32Z","title":"Forward and Reverse Gradient-Based Hyperparameter Optimization","version":3},"cited_work":{"arxiv_id":"1703.01785","doi":null,"metadata_source":"pith","pith_arxiv_id":"1703.01785","snapshot_observed_at":"2026-08-07T13:33:56.703706Z","title":"Forward and Reverse Gradient-Based Hyperparameter Optimization","venue":"stat.ML","work_id":"4e66ad60-8fbe-4b93-8ad5-87aa3e4fe765","year":2017},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:50.178732Z"},"links":{"cited_paper":"/paper/1703.01785","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:5ea77acf50777cb4ca8b3249ec130acaf8177cf8a4eada76aa62d96698bd3ab4","observation_id":"ccbd187d-b65b-45d9-b2fd-9eee1d0eddbc","resolution":{"observed_at":"2026-08-07T13:33:56.797037Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08540","last_updated":"2024-06-14T20:21:05Z","snapshot_observed_at":"2026-07-06T17:43:56.860733Z","submitted_at":"2024-03-13T13:54:00Z","title":"Language models scale reliably with over-training and on downstream tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08540","snapshot_observed_at":"2026-08-07T13:33:50.325132Z","title":"Dimakis, Gabriel Ilharco, Pang Wei Koh, Shuran Song, Thomas Kollar, Yair Carmon, Achal Dave, Reinhard Heckel, Niklas Muennighoff, and Ludwig Schmidt","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:50.325132Z"},"links":{"cited_paper":"/paper/2403.08540","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:d813f1225071d622372d9a4e77832e845b3f8a50ed5b363713c5e22ad3e723b9","observation_id":"1e4ebb40-ae5c-4daf-960c-187a2e144079","resolution":{"observed_at":"2026-08-07T13:33:50.325132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-07T13:33:50.472683Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:50.472683Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:1bf2806f2fefe5e478f6de239f8f291f00580c7198d6adc1e625ca43527fb818","observation_id":"df30824e-1b19-4511-92de-89ab5d0166ef","resolution":{"observed_at":"2026-08-07T13:33:50.472683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14908","last_updated":"2025-01-27T11:25:33Z","snapshot_observed_at":"2026-08-07T08:10:41.068262Z","submitted_at":"2024-05-23T09:44:02Z","title":"BiMix: A Bivariate Data Mixing Law for Language Model Pretraining","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14908","snapshot_observed_at":"2026-08-07T13:33:50.604941Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:50.604941Z"},"links":{"cited_paper":"/paper/2405.14908","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:464aae78fc1441b1d87e6a0c44976550c1a882099f3841784032578ace0d921c","observation_id":"66437165-7de4-4550-accc-8ec38fb8c18a","resolution":{"observed_at":"2026-08-07T13:33:50.604941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.14177","last_updated":"2023-03-24T17:38:58Z","snapshot_observed_at":"2026-08-01T15:00:39.464566Z","submitted_at":"2023-03-24T17:38:58Z","title":"Scaling Expert Language Models with Unsupervised Domain Discovery","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.14177","snapshot_observed_at":"2026-08-07T13:33:50.715368Z","title":"Smith, and Luke Zettlemoyer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:50.715368Z"},"links":{"cited_paper":"/paper/2303.14177","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:0ea37f009b8c46a203ad19a318ef1d0cb02f02adfe24d26ffcdcad6ab28788d8","observation_id":"dea4f49c-d8e5-4686-86dd-5cdaa69a665a","resolution":{"observed_at":"2026-08-07T13:33:50.715368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-07T13:33:50.850028Z","title":"Rae, Oriol Vinyals, and Laurent Sifre","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:50.850028Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:061c6dea0fd894e3b46cba91661aa645eccef5a85cb4c8b479aee32cd0cd084d","observation_id":"40a15f17-2fd7-4935-88c7-255670c03bb2","resolution":{"observed_at":"2026-08-07T13:33:50.850028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11820","last_updated":"2024-10-15T17:47:44Z","snapshot_observed_at":"2026-08-04T18:20:45.624958Z","submitted_at":"2024-10-15T17:47:44Z","title":"Adaptive Data Optimization: Dynamic Sample Selection with Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11820","snapshot_observed_at":"2026-08-07T13:33:50.960916Z","title":"Zico Kolter","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:50.960916Z"},"links":{"cited_paper":"/paper/2410.11820","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:9820f10c9e7ccc54f29f336a4e1180d2e26aac21b00cef292c118df38e5c0437","observation_id":"b311690c-0dce-4614-b305-f00efb81c32c","resolution":{"observed_at":"2026-08-07T13:33:50.960916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:51.071911Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:51.071911Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:0e109b525b8c7e0ebf9ca7121c0c120f71d3355905b3c06ff5dc243e6cefcc26","observation_id":"108619fd-ffb3-4a8e-a9bb-e1fe273c38d7","resolution":{"observed_at":"2026-08-07T13:33:51.071911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T13:33:51.178477Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:51.178477Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:57f4c209c63f81ee18439174b853743deb88c33b2e215698cb8d136f505582dc","observation_id":"c14ea77e-2f43-4978-9bd0-6ac2aab41cba","resolution":{"observed_at":"2026-08-07T13:33:51.178477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10945","last_updated":"2023-01-26T05:34:21Z","snapshot_observed_at":"2026-07-31T06:33:49.580015Z","submitted_at":"2023-01-26T05:34:21Z","title":"A Fully First-Order Method for Stochastic Bilevel Optimization","version":1},"cited_work":{"arxiv_id":"2301.10945","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.10945","snapshot_observed_at":"2026-08-07T13:33:56.242402Z","title":"A Fully First-Order Method for Stochastic Bilevel Optimization","venue":"math.OC","work_id":"07cec854-3d68-4802-9d4a-c7a7abf285ce","year":2023},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:51.298763Z"},"links":{"cited_paper":"/paper/2301.10945","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:aaaae5301a84a804eeb040abb07121caf7e9c2eef4e7660afbef1c11d5a605d8","observation_id":"7f11cfa6-090e-4ecf-a0a8-b8fda047eca8","resolution":{"observed_at":"2026-08-07T13:33:56.324802Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:57.913017Z","title":null,"venue":null,"work_id":"26999abf-1570-4f19-bfbb-5215570c10da","year":2020},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:51.414889Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:7455dee035f54c77457a0fac7758d9f6cc3a78e946881e8b9cfeb66d212a21a3","observation_id":"e5192bdd-f44b-4a8a-9ca8-ee3e999773ef","resolution":{"observed_at":"2026-08-07T13:33:57.971782Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02303","last_updated":"2023-11-04T02:22:40Z","snapshot_observed_at":"2026-07-06T16:42:57.571795Z","submitted_at":"2023-11-04T02:22:40Z","title":"MFTCoder: Boosting Code LLMs with Multitask Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02303","snapshot_observed_at":"2026-08-07T13:33:51.548263Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:51.548263Z"},"links":{"cited_paper":"/paper/2311.02303","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:3f2a6c23e4fe1440cf693dc10aac32fa710a1ab2bf78cbf9fc4dce0736f20e7a","observation_id":"72f6d54c-d65e-473f-b53d-f57aa729b933","resolution":{"observed_at":"2026-08-07T13:33:51.548263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03792","last_updated":"2023-10-30T02:45:50Z","snapshot_observed_at":"2026-07-06T15:39:18.493629Z","submitted_at":"2023-06-06T15:39:54Z","title":"FAMO: Fast Adaptive Multitask Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03792","snapshot_observed_at":"2026-08-07T13:33:51.661519Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:51.661519Z"},"links":{"cited_paper":"/paper/2306.03792","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:7fb1820c15fb76c2876f2ffa53c0e2d86b136867d9dd7f0815c6044b5fdb600f","observation_id":"1004f965-6e3d-4c85-8453-fc39bb0c4af4","resolution":{"observed_at":"2026-08-07T13:33:51.661519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:57.757129Z","title":null,"venue":null,"work_id":"2eb383d4-f146-406e-869c-cb0904f191a2","year":2021},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:51.772616Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:a857a75fe2382b582b63a1fe36683f70069fa4cd087cc3920f7bfcee5bc927c6","observation_id":"ae44435e-3711-4976-ac39-7797fd167ca0","resolution":{"observed_at":"2026-08-07T13:33:57.813615Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:51.884698Z","title":null,"venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:51.884698Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:861513a99177df401242cae25dbaedef5ba5511d453346edd8fc48002a5208a4","observation_id":"ea6153a1-ef08-4c32-bce6-d6fbdf085acc","resolution":{"observed_at":"2026-08-07T13:33:51.884698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:57.573390Z","title":null,"venue":null,"work_id":"8a695fef-772b-4262-a736-1ce7335c6a10","year":2021},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:51.984488Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:b505b94e815f5c1328a97b4014d070e80b3f0fc9689a1aad907a2d7bb15d81ea","observation_id":"5f0f9683-56eb-49ac-9295-c930cdaa501e","resolution":{"observed_at":"2026-08-07T13:33:57.644662Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01492","last_updated":"2025-01-23T17:35:43Z","snapshot_observed_at":"2026-07-06T18:39:43.472708Z","submitted_at":"2024-07-01T17:31:03Z","title":"RegMix: Data Mixture as Regression for Language Model Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01492","snapshot_observed_at":"2026-08-07T13:33:52.124575Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:52.124575Z"},"links":{"cited_paper":"/paper/2407.01492","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:b9a33e83d3924dcece1a2847bd2b010e3ec43d3888bf6c6c30df25c20208fc4d","observation_id":"02ee085f-bef2-4e81-9cac-ed70b0ea99f1","resolution":{"observed_at":"2026-08-07T13:33:52.124575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02590","last_updated":"2019-11-06T19:04:16Z","snapshot_observed_at":"2026-07-06T08:35:15.491391Z","submitted_at":"2019-11-06T19:04:16Z","title":"Optimizing Millions of Hyperparameters by Implicit Differentiation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02590","snapshot_observed_at":"2026-08-07T13:33:52.282275Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:52.282275Z"},"links":{"cited_paper":"/paper/1911.02590","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:a3d472f17a48bd1e52d5420d87835bf344b5741e4a275ca19a7828eb1f222645","observation_id":"5b8c3ab1-ee23-4537-86aa-73cb9e83704b","resolution":{"observed_at":"2026-08-07T13:33:52.282275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14318","last_updated":"2025-05-20T15:09:35Z","snapshot_observed_at":"2026-08-06T07:45:33.824127Z","submitted_at":"2024-11-21T17:10:02Z","title":"Velocitune: A Velocity-based Dynamic Domain Reweighting Method for Continual Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14318","snapshot_observed_at":"2026-08-07T13:33:52.387698Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:52.387698Z"},"links":{"cited_paper":"/paper/2411.14318","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:c4fe3c023a0055455f2035f63b1dd580273892321d8a1d2a3f6fb06ca40991ba","observation_id":"a8254859-93c3-45ee-ba9e-011c5d60762b","resolution":{"observed_at":"2026-08-07T13:33:52.387698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14619","last_updated":"2024-05-02T00:30:57Z","snapshot_observed_at":"2026-07-06T18:04:04.541434Z","submitted_at":"2024-04-22T23:12:03Z","title":"OpenELM: An Efficient Language Model Family with Open Training and Inference Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14619","snapshot_observed_at":"2026-08-07T13:33:52.514060Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:52.514060Z"},"links":{"cited_paper":"/paper/2404.14619","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:2f3fb80107012edd8ef583b162d4a45360aa2e66ecb93228e5f17bd136a0f811","observation_id":"583b578c-c295-45fa-840c-1ee032eaad82","resolution":{"observed_at":"2026-08-07T13:33:52.514060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:52.622870Z","title":"Hashimoto, and Percy Liang","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:52.622870Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:24e427693ada4231eba2fd6aea3b13bbf9beaa02df66eed5a27fa4b561070f8a","observation_id":"9d15914f-4f31-498a-8937-b25454cee021","resolution":{"observed_at":"2026-08-07T13:33:52.622870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17919","last_updated":"2024-12-25T19:03:23Z","snapshot_observed_at":"2026-07-06T17:51:28.420385Z","submitted_at":"2024-03-26T17:55:02Z","title":"LISA: Layerwise Importance Sampling for Memory-Efficient Large Language Model Fine-Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17919","snapshot_observed_at":"2026-08-07T13:33:52.754333Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:52.754333Z"},"links":{"cited_paper":"/paper/2403.17919","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:d0f7de2bfce89366dc90bed226b766f00c995f2293dcb955faee3116d49f905d","observation_id":"47ac372b-45d2-4da2-843c-777b6e795982","resolution":{"observed_at":"2026-08-07T13:33:52.754333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19976","last_updated":"2025-05-25T05:03:51Z","snapshot_observed_at":"2026-07-06T18:38:29.579641Z","submitted_at":"2024-06-28T15:03:08Z","title":"ScaleBiO: Scalable Bilevel Optimization for LLM Data Reweighting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19976","snapshot_observed_at":"2026-08-07T13:33:52.895760Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:52.895760Z"},"links":{"cited_paper":"/paper/2406.19976","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:e6eb644f806111b705a748ddb82c3331c3adf5bd7e8f8b14e272ecace2664090","observation_id":"29e0cfed-d8b5-454a-b07d-51453c2f516d","resolution":{"observed_at":"2026-08-07T13:33:52.895760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01375","last_updated":"2024-06-03T14:40:31Z","snapshot_observed_at":"2026-08-03T14:53:38.066418Z","submitted_at":"2024-06-03T14:40:31Z","title":"D-CPT Law: Domain-specific Continual Pre-Training Scaling Law for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01375","snapshot_observed_at":"2026-08-07T13:33:52.994596Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:52.994596Z"},"links":{"cited_paper":"/paper/2406.01375","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:80f6905cda091fe4f5e71a082b95a362f0be28240def16e7866eb426debedc73","observation_id":"16c2a519-496c-4d04-b4fa-96a085159c1a","resolution":{"observed_at":"2026-08-07T13:33:52.994596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:53.139442Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:53.139442Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:7efed6b15681870ded70897684d6d69aaad0c77bd50eb8ca176c663ba2bd0a1c","observation_id":"6914823b-34a4-443b-93df-1ad0ec8df797","resolution":{"observed_at":"2026-08-07T13:33:53.139442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2020.30038","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:55.796793Z","title":null,"venue":null,"work_id":"5a1439c2-2708-4b17-beb8-a70d9d3a2163","year":2020},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:53.242787Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:3516754d57e4ebb87299d4a51ab573504f14ceb5b6e31b4c461c3c695bbeac4f","observation_id":"af4c5844-478f-4d49-979d-0b99705c36cc","resolution":{"observed_at":"2026-08-07T13:33:55.904518Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.08731","last_updated":"2020-04-02T05:40:29Z","snapshot_observed_at":"2026-08-02T19:28:48.954133Z","submitted_at":"2019-11-20T06:43:41Z","title":"Distributionally Robust Neural Networks for Group Shifts: On the Importance of Regularization for Worst-Case Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.08731","snapshot_observed_at":"2026-08-07T13:33:53.325891Z","title":"Hashimoto, and Percy Liang","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:53.325891Z"},"links":{"cited_paper":"/paper/1911.08731","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:5ef7fa4d8094cb01222827e2a0c647c97a4813e6b800e2489c740fb7d1d200d2","observation_id":"70d827fa-3469-459e-8020-9b16f8b81515","resolution":{"observed_at":"2026-08-07T13:33:53.325891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10818","last_updated":"2024-05-09T13:56:06Z","snapshot_observed_at":"2026-08-07T23:26:20.937888Z","submitted_at":"2023-09-19T17:59:54Z","title":"SlimPajama-DC: Understanding Data Combinations for LLM Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10818","snapshot_observed_at":"2026-08-07T13:33:53.419429Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:53.419429Z"},"links":{"cited_paper":"/paper/2309.10818","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:760a7d0c7e59f57b4866a3f2e8467394a7d94d40a25c7ee10ae68127ace6a16c","observation_id":"7fe70179-7f88-46f0-8088-731f97cbb0cf","resolution":{"observed_at":"2026-08-07T13:33:53.419429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11527","last_updated":"2024-12-06T17:31:39Z","snapshot_observed_at":"2026-08-06T05:54:17.831942Z","submitted_at":"2024-08-21T11:06:02Z","title":"The Vizier Gaussian Process Bandit Algorithm","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11527","snapshot_observed_at":"2026-08-07T13:33:53.554390Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:53.554390Z"},"links":{"cited_paper":"/paper/2408.11527","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:a2342f5fa19f9f86b6d3a22c5750c7b638419e373232aefbbb029e5bed1e5f2d","observation_id":"b6821ead-e6e2-44de-843c-4a7f822e84a6","resolution":{"observed_at":"2026-08-07T13:33:53.554390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:53.715579Z","title":"Oliphant, Matt Haberland, Tyler Reddy, David Cournapeau, Evgeni Burovski, Pearu Peterson, Warren Weckesser, Jonathan Bright, Stéfan J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:53.715579Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:2ed9443d6fc22d0f44d3901db9b23b896d208d8f355d4bf3014261f4b14286aa","observation_id":"66e1e1d6-b288-4248-a255-e95759f080ca","resolution":{"observed_at":"2026-08-07T13:33:53.715579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-07T13:33:53.834351Z","title":"Zhao, Kelvin Guu, Adams Wei Yu, Brian Lester, Nan Du, Andrew M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:53.834351Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:6ed8d38f24da113761185fc6814af531f35f975c6bc9a29c24c66d24f273e74b","observation_id":"1c3b19b2-514e-4dc4-8c72-bee9fdeb6b64","resolution":{"observed_at":"2026-08-07T13:33:53.834351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06694","last_updated":"2024-04-11T01:18:06Z","snapshot_observed_at":"2026-08-07T03:20:22.127593Z","submitted_at":"2023-10-10T15:13:30Z","title":"Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06694","snapshot_observed_at":"2026-08-07T13:33:53.990057Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:53.990057Z"},"links":{"cited_paper":"/paper/2310.06694","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:eea3c6f988096dde0ced0e5d5780d314d6331e6bf20b5c1195dc951df0fcafee","observation_id":"3597c35a-4d91-4682-82bc-7cb147cc2dab","resolution":{"observed_at":"2026-08-07T13:33:53.990057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10429","last_updated":"2023-11-21T02:01:53Z","snapshot_observed_at":"2026-07-06T15:28:49.253125Z","submitted_at":"2023-05-17T17:58:13Z","title":"DoReMi: Optimizing Data Mixtures Speeds Up Language Model Pretraining","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10429","snapshot_observed_at":"2026-08-07T13:33:54.125833Z","title":"Le, Tengyu Ma, and Adams Wei Yu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:54.125833Z"},"links":{"cited_paper":"/paper/2305.10429","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:421a0d21c3031c6fa845a0c638a2a7e33501dab466669109f734f14a976e75e9","observation_id":"8d4d2737-a203-4e5d-a27c-6133fb09a45f","resolution":{"observed_at":"2026-08-07T13:33:54.125833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.7489","last_updated":"2015-03-26T15:29:50Z","snapshot_observed_at":"2026-08-04T04:09:11.311000Z","submitted_at":"2014-12-23T19:50:21Z","title":"A Unified Perspective on Multi-Domain and Multi-Task Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.7489","snapshot_observed_at":"2026-08-07T13:33:54.253956Z","title":"Hospedales","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:54.253956Z"},"links":{"cited_paper":"/paper/1412.7489","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:c6db7eccca0acac8a73ba71f0e323abe812d7c679763b74a3a9dd7d1b0fc55dc","observation_id":"70accda3-7105-445a-8a53-0fa773379f6d","resolution":{"observed_at":"2026-08-07T13:33:54.253956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16952","last_updated":"2025-03-20T03:31:27Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:14:00Z","title":"Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16952","snapshot_observed_at":"2026-08-07T13:33:54.384371Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:54.384371Z"},"links":{"cited_paper":"/paper/2403.16952","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:95603539e45d6a17a16f363042fa8b48318a8dcbad081f1e72a24b6d1b836e46","observation_id":"eb873359-d146-41a6-a21c-3727d824a5d8","resolution":{"observed_at":"2026-08-07T13:33:54.384371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.06782","last_updated":"2020-12-22T00:35:46Z","snapshot_observed_at":"2026-08-07T17:16:18.324802Z","submitted_at":"2020-01-19T06:33:47Z","title":"Gradient Surgery for Multi-Task Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.06782","snapshot_observed_at":"2026-08-07T13:33:54.509096Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:54.509096Z"},"links":{"cited_paper":"/paper/2001.06782","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:6b8c45ea74c3db3e2857ca94115638dffd9cf81ed30d00aaf18f67028969d464","observation_id":"a18e95ba-7dc5-42a9-b983-6530db2b0d41","resolution":{"observed_at":"2026-08-07T13:33:54.509096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.15768","last_updated":"2025-03-20T15:46:13Z","snapshot_observed_at":"2026-07-06T10:09:53.518263Z","submitted_at":"2020-10-29T17:13:46Z","title":"A Single-Loop Smoothed Gradient Descent-Ascent Algorithm for Nonconvex-Concave Min-Max Problems","version":3},"cited_work":{"arxiv_id":"2010.15768","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.15768","snapshot_observed_at":"2026-08-07T13:33:55.246692Z","title":"A Single-Loop Smoothed Gradient Descent-Ascent Algorithm for Nonconvex-Concave Min-Max Problems","venue":"math.OC","work_id":"f7dfaa96-7743-4209-bfa9-ed9968a6acd2","year":2020},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:54.674767Z"},"links":{"cited_paper":"/paper/2010.15768","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:e08bc84136367a9c150dbfafac26a2dc86443c41ce3c8df1970b60d11d676170","observation_id":"34000aaf-f730-4f6e-9659-43a4e2ce50f5","resolution":{"observed_at":"2026-08-07T13:33:55.333064Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00788","last_updated":"2023-12-20T20:30:24Z","snapshot_observed_at":"2026-07-06T16:01:26.276862Z","submitted_at":"2023-08-01T18:59:07Z","title":"An Introduction to Bi-level Optimization: Foundations and Applications in Signal Processing and Machine Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00788","snapshot_observed_at":"2026-08-07T13:33:54.796497Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:54.796497Z"},"links":{"cited_paper":"/paper/2308.00788","citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:9135aaf0650f754a388a1e5701eb29db44258f555fd3d17bea6730f8623f3124","observation_id":"141ad7d3-e01b-4495-b403-50e15e80cb69","resolution":{"observed_at":"2026-08-07T13:33:54.796497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:54.889501Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:54.889501Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:c52dd3b4704613f30358f0d98b6e649822c3ec489f7e169c0b2b211da4998f35","observation_id":"5bb3652e-81b6-4dc2-9b03-43b5ae33a944","resolution":{"observed_at":"2026-08-07T13:33:54.889501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:33:55.004931Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:55.004931Z"},"links":{"citing_paper":"/paper/2505.21598"},"observation_digest":"sha256:8a19171be19565459530f9eeabf694aff519a7c9629c2e9cd757cf3f6b1155c2","observation_id":"b1e40183-72ef-4dd2-9328-0352283a0f8c","resolution":{"observed_at":"2026-08-07T13:33:55.004931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.21598","last_updated":"2025-05-27T16:56:54Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T13:26:02.241328Z","submitted_at":"2025-05-27T16:56:54Z","title":"Rethinking Data Mixture for Large Language Models: A Comprehensive Survey and New Perspectives"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":47,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2505.21598."}