{"as_of":"2026-08-18T18:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a07e3753974cf54297701dcb2d0460d14506477843dc46fd922289bc7bb8bac8","coverage":[{"denominator":250,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T22:57:01.768492Z","state":"measured"},{"denominator":108,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":108,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:25:14.843945Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":4,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02980","snapshot_observed_at":"2026-08-08T04:52:23.165807Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08515","last_updated":"2025-02-12T15:47:48Z","snapshot_observed_at":"2026-08-15T13:19:29.071427Z","submitted_at":"2025-02-12T15:47:48Z","title":"The Paradox of Stochasticity: Limited Creativity and Computational Decoupling in Temperature-Varied LLM Outputs of Structured Fictional Data","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T04:52:23.165807Z"},"links":{"cited_paper":"/paper/2412.02980","citing_paper":"/paper/2502.08515"},"observation_digest":"sha256:fd89de82037159f88d3706218fb907185d2adc67f5d737a5d6fa61d34af86eb6","observation_id":"be90d5ce-b715-4011-b0c8-7bc675552597","resolution":{"observed_at":"2026-08-08T04:52:23.165807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02980","snapshot_observed_at":"2026-08-16T10:25:14.843945Z","title":"Surveying the Effects of Quality , Diversity , and Complexity in Synthetic Data From Large Language Models , December 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18225","last_updated":"2025-04-25T10:17:04Z","snapshot_observed_at":"2026-08-16T10:19:10.205144Z","submitted_at":"2025-04-25T10:17:04Z","title":"Even Small Reasoners Should Quote Their Sources: Introducing the Pleias-RAG Model Family","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T10:25:14.843945Z"},"links":{"cited_paper":"/paper/2412.02980","citing_paper":"/paper/2504.18225"},"observation_digest":"sha256:65292574e75ea8359afef86e9c2645b4d6c3149bb4d4ae6dab32866684269da5","observation_id":"85a4a3b0-7a68-43a8-9211-8b540f8af01b","resolution":{"observed_at":"2026-08-16T10:25:14.843945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"cited_work":{"arxiv_id":"2412.02980","doi":"10.48550/arxiv.2412.02980","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alex Havrilla, Andrew Dai, Laura O’Mahony, Koen Oostermeijer, Vera Zisler, Alon Albalak, Fab- rizio Milo, Sharath Chandra Raparthy, Kanishk Gandhi, Baber Abbasi, et al","venue":"arXiv (Cornell University)","work_id":"5f6ef17a-9504-4ef2-909f-3fc27575c181","year":2024},"citing_paper":{"arxiv_id":"2508.13654","last_updated":"2026-04-21T03:24:34Z","snapshot_observed_at":"2026-08-11T04:49:10.568001Z","submitted_at":"2025-08-19T09:04:13Z","title":"Input-Time Scaling: Adding Noise and Irrelevance into Less-Is-More Drastically Improves Reasoning Performance and Efficiency","version":6},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T22:42:53.663354Z"},"links":{"cited_paper":"/paper/2412.02980","citing_paper":"/paper/2508.13654"},"observation_digest":"sha256:4ba730fa730ffefa4cc157ce40b86fc4a4dede6b74addee2ed53795c1709a803","observation_id":"60f67684-1c2c-44ac-95b8-4474dc49c70d","resolution":{"observed_at":"2026-05-18T22:46:53.810511Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02980","snapshot_observed_at":"2026-08-05T14:13:47.911651Z","title":"Surveying the effects of quality, diversity, and complexity in synthetic data from large language models.arXiv preprint arXiv:2412.02980, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21589","last_updated":"2025-10-22T11:09:23Z","snapshot_observed_at":"2026-08-11T01:24:04.693782Z","submitted_at":"2025-08-29T12:47:27Z","title":"Middo: Model-Informed Dynamic Data Optimization for Enhanced LLM Fine-Tuning via Closed-Loop Learning","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T14:13:47.911651Z"},"links":{"cited_paper":"/paper/2412.02980","citing_paper":"/paper/2508.21589"},"observation_digest":"sha256:f367a67648cacd1d798b41364659a2db5daba89e5dbf4025e6cb79f66f9357e3","observation_id":"42cfd222-065e-48ae-a358-ca2839290159","resolution":{"observed_at":"2026-08-05T14:13:47.911651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02980","snapshot_observed_at":"2026-08-15T16:09:27.538964Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08490","last_updated":"2025-09-10T11:01:29Z","snapshot_observed_at":"2026-08-18T09:41:49.081457Z","submitted_at":"2025-09-10T11:01:29Z","title":"A Structured Review of Underwater Object Detection Challenges and Solutions: From Traditional to Large Vision Language Models","version":1},"reference_index":157,"source":"pdf_text","source_observed_at":"2026-08-15T16:09:27.538964Z"},"links":{"cited_paper":"/paper/2412.02980","citing_paper":"/paper/2509.08490"},"observation_digest":"sha256:a787207a665a3bb9696d19a897cc2443133e6bab537be6c4b30e8ec986262a80","observation_id":"cc68e87c-10ea-400f-bafe-b75d7918390c","resolution":{"observed_at":"2026-08-15T16:09:27.538964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02980","snapshot_observed_at":"2026-08-03T01:17:11.716401Z","title":"Surveying the effects of quality, diversity, and complexity in synthetic data from large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.10388","last_updated":"2026-05-29T05:05:29Z","snapshot_observed_at":"2026-08-07T17:40:15.715656Z","submitted_at":"2026-02-11T00:23:13Z","title":"Less is Enough: Synthesizing Diverse Data in LLM Feature Space with Sparse Autoencoders","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T01:17:11.716401Z"},"links":{"cited_paper":"/paper/2412.02980","citing_paper":"/paper/2602.10388"},"observation_digest":"sha256:c23201bdd83889387a48f29f326b39c73fdc231842ed706fc37b6e1e189454dc","observation_id":"c054272a-e05c-49d4-b976-d52fef094b1e","resolution":{"observed_at":"2026-08-03T01:17:11.716401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"cited_work":{"arxiv_id":"2412.02980","doi":"10.48550/arxiv.2412.02980","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alex Havrilla, Andrew Dai, Laura O’Mahony, Koen Oostermeijer, Vera Zisler, Alon Albalak, Fab- rizio Milo, Sharath Chandra Raparthy, Kanishk Gandhi, Baber Abbasi, et al","venue":"arXiv (Cornell University)","work_id":"5f6ef17a-9504-4ef2-909f-3fc27575c181","year":2024},"citing_paper":{"arxiv_id":"2604.22551","last_updated":"2026-04-24T13:45:04Z","snapshot_observed_at":"2026-08-11T10:01:46.024559Z","submitted_at":"2026-04-24T13:45:04Z","title":"QDTraj: Exploration of Diverse Trajectory Primitives for Articulated Objects Robotic Manipulation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T11:22:38.704101Z"},"links":{"cited_paper":"/paper/2412.02980","citing_paper":"/paper/2604.22551"},"observation_digest":"sha256:4402ef3367312e1ff63a9cef50ad305aae49fed78734c802f1ab5f8360a6ea71","observation_id":"6183855b-a281-4259-97a5-c825df00506c","resolution":{"observed_at":"2026-05-08T21:49:16.087338Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"cited_work":{"arxiv_id":"2412.02980","doi":"10.48550/arxiv.2412.02980","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alex Havrilla, Andrew Dai, Laura O’Mahony, Koen Oostermeijer, Vera Zisler, Alon Albalak, Fab- rizio Milo, Sharath Chandra Raparthy, Kanishk Gandhi, Baber Abbasi, et al","venue":"arXiv (Cornell University)","work_id":"5f6ef17a-9504-4ef2-909f-3fc27575c181","year":2024},"citing_paper":{"arxiv_id":"2606.29721","last_updated":"2026-06-29T02:56:46Z","snapshot_observed_at":"2026-08-13T12:11:01.223784Z","submitted_at":"2026-06-29T02:56:46Z","title":"Redefining Maritime Anomaly Detection via Equation-Grounded Synthetic Anomalies","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T07:51:09.994244Z"},"links":{"cited_paper":"/paper/2412.02980","citing_paper":"/paper/2606.29721"},"observation_digest":"sha256:9dd8ac70cdc22340fe55eec56f1a5c9784a3e192ab2d2a2f8cd4ef29b8a2f5e9","observation_id":"445ca751-b242-46fb-bb21-5ef8c3ac78a1","resolution":{"observed_at":"2026-06-30T07:54:21.928310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.02980/citation-record","integrity":"/paper/2412.02980/integrity","json":"/paper/2412.02980/citation-record.json","paper":"/paper/2412.02980"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:57:01.482320Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.482320Z"},"links":{"citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:7245cc921082fe1e144e9cea69a0c8d77f6f845c6aa4820c083d04575b1dd9cb","observation_id":"2ca369a7-fbe5-4dfe-9944-7dad12e0af99","resolution":{"observed_at":"2026-08-11T22:57:01.482320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:57:01.487766Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.487766Z"},"links":{"citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:272ce9099bd55cc6cb996a951a365da1885b845d926050b4b09ec929118ad7f2","observation_id":"c13b4df7-8aed-460a-86f3-6d9bd1998347","resolution":{"observed_at":"2026-08-11T22:57:01.487766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:57:01.490993Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.490993Z"},"links":{"citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:cd433ef0b729280250ac66a98fb0d4d37d2e82b208c71f48f03f7158066b8236","observation_id":"a892d8d3-8cee-4d31-9dea-cc9f20ad253d","resolution":{"observed_at":"2026-08-11T22:57:01.490993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:57:01.493802Z","title":"and ``interesting","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.493802Z"},"links":{"citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:4896f8ddb8d091c33438b809b00fcad27b69b9f353bfbbd0408e7b303f4f90f9","observation_id":"7cd26eab-6064-4aa5-81d2-691d3c23bbef","resolution":{"observed_at":"2026-08-11T22:57:01.493802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-08-06T15:07:40.203199Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-11T22:57:01.499375Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.499375Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:ced45c6f5ac94d76887b82990cb780ccdbd758a0200db90d213fa36cb2b8a973","observation_id":"7f083a30-2642-4441-b9aa-925f58a1d7c5","resolution":{"observed_at":"2026-08-11T22:57:01.499375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-11T22:57:01.502803Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.502803Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:138f8f639a0b938e69d164a1146ba08380c99615558d638d68fd3722cca1f385","observation_id":"747c2bcd-fbb4-46e9-8c81-997a5b3eed86","resolution":{"observed_at":"2026-08-11T22:57:01.502803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:57:01.506520Z","title":"Knowledge graph based synthetic corpus generation for knowledge-enhanced language model pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.506520Z"},"links":{"citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:c3cbe5b87fa27910b99c97d28d7034e60fb39a98aa5d91ae59b8e0fb1196caef","observation_id":"1f5d0bd3-c4de-4a2a-aa52-d76aebb4946e","resolution":{"observed_at":"2026-08-11T22:57:01.506520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-11T22:57:01.509683Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.509683Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:e017dd9b3144b0b016329a06c8f98182c3aa2e2bdf2ee341a25a37f13e06d8c5","observation_id":"ae144ebf-c346-4247-9ce4-cee9e803ace0","resolution":{"observed_at":"2026-08-11T22:57:01.509683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:57:01.513009Z","title":"Efficient online data mixing for language model pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.513009Z"},"links":{"citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:5caf73988ba49b79e5f9df9cfcdd4c4deba469967f8bd6d2da484839a4f18a9d","observation_id":"a65ba5dd-1056-4949-8c0b-0b57eaba19aa","resolution":{"observed_at":"2026-08-11T22:57:01.513009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:57:01.516004Z","title":"Improving few-shot generalization by exploring and exploiting auxiliary data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.516004Z"},"links":{"citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:1e2b03de3179675fac81e7ee97b6cf6618fb7899218144a489c7b2078ab33306","observation_id":"91530c31-3c06-48f5-a462-136afa3d4950","resolution":{"observed_at":"2026-08-11T22:57:01.516004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16827","last_updated":"2024-08-02T17:59:31Z","snapshot_observed_at":"2026-08-16T14:15:11.706978Z","submitted_at":"2024-02-26T18:54:35Z","title":"A Survey on Data Selection for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16827","snapshot_observed_at":"2026-08-11T22:57:01.518663Z","title":"A survey on data selection for language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.518663Z"},"links":{"cited_paper":"/paper/2402.16827","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:a9fbc781986c0cefa789cc404c0ba6a6b8efd26e5963fb3c27256d17a0795550","observation_id":"a81d3178-50f5-48c9-b16a-727521ad396c","resolution":{"observed_at":"2026-08-11T22:57:01.518663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-08-17T19:11:47.163118Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-11T22:57:01.521247Z","title":"Chang, and Prithviraj Ammanabrolu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.521247Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:162ce1b166b91a1a94a93d9644f554820232fa01c4736d97323fc06e3f77a32a","observation_id":"b7aa2b78-6f4b-44dc-bb86-50b84738b03b","resolution":{"observed_at":"2026-08-11T22:57:01.521247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-11T22:57:01.524028Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback, 2022 a","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.524028Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:f21bb5609e064c06da0a449c7ab5f85d9a2a6ec55116e7187aee7321a27915cf","observation_id":"9ee600e0-4856-409d-9537-7a5428855c18","resolution":{"observed_at":"2026-08-11T22:57:01.524028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-11T22:57:01.527354Z","title":"Bowman, Zac Hatfield-Dodds, Ben Mann, Dario Amodei, Nicholas Joseph, Sam McCandlish, Tom Brown, and Jared Kaplan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.527354Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:6f91b42aec4d569c97e39ab87570f9aff6d457685173751db83f9998a2836c3c","observation_id":"fa077800-dfc4-405d-bf45-fbc87e8caeb0","resolution":{"observed_at":"2026-08-11T22:57:01.527354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02524","last_updated":"2024-02-01T22:06:51Z","snapshot_observed_at":"2026-08-16T14:29:44.982340Z","submitted_at":"2024-01-04T20:23:51Z","title":"Comprehensive Exploration of Synthetic Data Generation: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02524","snapshot_observed_at":"2026-08-11T22:57:01.530403Z","title":"Comprehensive exploration of synthetic data generation: A survey, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.530403Z"},"links":{"cited_paper":"/paper/2401.02524","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:0c7c9b03655de17fbe9a1b4649e775c7ce6778dc3f9d5931c98c3e0d68c7649d","observation_id":"0b5c7929-0bae-4512-a413-a98f048578c0","resolution":{"observed_at":"2026-08-11T22:57:01.530403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:57:01.533152Z","title":"Cosmopedia, February 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.533152Z"},"links":{"citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:4ec25fbeec0abc186f777123703ecc0de5dce4a3ea27251747ef7fe9f74ddf38","observation_id":"bcd2e3d7-27e5-4217-a39b-d1daf2065adf","resolution":{"observed_at":"2026-08-11T22:57:01.533152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:57:01.535517Z","title":null,"venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.535517Z"},"links":{"citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:e07ca21733335dd024c11ef696c915b81e4122d95afebd1af0c97f24d5a591cb","observation_id":"46859079-e847-476d-b5c8-c881a719ce9d","resolution":{"observed_at":"2026-08-11T22:57:01.535517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:57:01.538043Z","title":"Deep surrogate assisted generation of environments","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.538043Z"},"links":{"citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:9205925dd60a6e7ff9704ac482c8a78305774d8b18fdb7166af66f80ab468971","observation_id":"a7e1d83e-b2f1-4af1-902f-be7ca3a97e01","resolution":{"observed_at":"2026-08-11T22:57:01.538043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00771","last_updated":"2020-10-27T21:23:03Z","snapshot_observed_at":"2026-08-13T23:02:34.454175Z","submitted_at":"2020-05-02T09:40:05Z","title":"ProtoQA: A Question Answering Dataset for Prototypical Common-Sense Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00771","snapshot_observed_at":"2026-08-11T22:57:01.540311Z","title":"Protoqa: A question answering dataset for prototypical common-sense reasoning, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.540311Z"},"links":{"cited_paper":"/paper/2005.00771","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:0d799582b3af0804e868c790822d39163cb8d7877997264e476d9b00515e8675","observation_id":"b2556043-8934-4ea5-b430-9f9ab62573e2","resolution":{"observed_at":"2026-08-11T22:57:01.540311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13032","last_updated":"2023-12-07T19:56:21Z","snapshot_observed_at":"2026-08-16T14:50:45.640595Z","submitted_at":"2023-10-19T12:13:58Z","title":"Quality-Diversity through AI Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13032","snapshot_observed_at":"2026-08-11T22:57:01.542835Z","title":"Quality-diversity through ai feedback, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.542835Z"},"links":{"cited_paper":"/paper/2310.13032","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:3946912b51d997015eb5b9186060b3ac1d8d7f644d8629e1cdf19b359f119f02","observation_id":"c2e2f868-5835-4599-b660-6aa2f91ed240","resolution":{"observed_at":"2026-08-11T22:57:01.542835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-08-14T10:00:52.343929Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-11T22:57:01.545371Z","title":"Le, Christopher Ré, and Azalia Mirhoseini","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.545371Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:5e241828804f77494cb5efbb44814e177507cb0061967a818423c3ae3d134862","observation_id":"b7237118-9a0f-49e4-a4b4-dccd62e61844","resolution":{"observed_at":"2026-08-11T22:57:01.545371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:57:01.548089Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.548089Z"},"links":{"citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:375c154c807b4921103af088410e9357382fde9242fd08bd84c073820cd4311f","observation_id":"df24554b-6a7b-47a2-a52f-368dfcf035de","resolution":{"observed_at":"2026-08-11T22:57:01.548089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-11T22:57:01.550889Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.550889Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:dce710b7bf1c27ed79bbb98f78a0019ce9a75da1158f56a4dc6e2ea23f80d8c4","observation_id":"0fc349bd-e9f3-431a-b5d9-d8f5915245cd","resolution":{"observed_at":"2026-08-11T22:57:01.550889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14736","last_updated":"2024-11-11T13:58:11Z","snapshot_observed_at":"2026-08-16T14:41:23.945472Z","submitted_at":"2023-11-21T19:12:18Z","title":"Data Diversity Matters for Robust Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14736","snapshot_observed_at":"2026-08-11T22:57:01.553604Z","title":"Data diversity matters for robust instruction tuning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.553604Z"},"links":{"cited_paper":"/paper/2311.14736","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:17ce6fcd18451d0c356a75c4e43e2e3d4a8a6dba25b2ea2b0b974b5a668cea5d","observation_id":"0f290ad2-10f8-43bb-8b6d-ddd3659857a2","resolution":{"observed_at":"2026-08-11T22:57:01.553604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09390","last_updated":"2023-12-14T23:07:33Z","snapshot_observed_at":"2026-08-16T14:34:35.228009Z","submitted_at":"2023-12-14T23:07:33Z","title":"Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09390","snapshot_observed_at":"2026-08-11T22:57:01.556302Z","title":"Weak-to-strong generalization: Eliciting strong capabilities with weak supervision, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.556302Z"},"links":{"cited_paper":"/paper/2312.09390","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:b1add2cd534d2c0f2ce2c41374b814b8b1a408786103e3ffe8e3a8262d10e124","observation_id":"e9f24745-87f6-461d-96de-cfddffac80d5","resolution":{"observed_at":"2026-08-11T22:57:01.556302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06290","last_updated":"2024-07-26T18:09:11Z","snapshot_observed_at":"2026-08-18T08:00:36.453042Z","submitted_at":"2023-07-12T16:37:31Z","title":"Instruction Mining: Instruction Data Selection for Tuning Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06290","snapshot_observed_at":"2026-08-11T22:57:01.559066Z","title":"Instruction mining: Instruction data selection for tuning large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.559066Z"},"links":{"cited_paper":"/paper/2307.06290","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:174c669e10ac5348f6a8143b1f3b65948f2d2077030453710e7eacb99ffbfa2c","observation_id":"f58c4426-27ed-40aa-8914-61e0532ec9fb","resolution":{"observed_at":"2026-08-11T22:57:01.559066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.06765","last_updated":"2019-02-27T07:21:44Z","snapshot_observed_at":"2026-08-17T15:08:27.941458Z","submitted_at":"2019-02-27T07:21:44Z","title":"A Machine Learning Approach to Comment Toxicity Classification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.06765","snapshot_observed_at":"2026-08-11T22:57:01.561721Z","title":"A machine learning approach to comment toxicity classification, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.561721Z"},"links":{"cited_paper":"/paper/1903.06765","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:6d0c9c53ffac9f6467a92f9058017cf9bcd9b3debe74c5bf4c5ceff92c872a92","observation_id":"7aff04f3-0f19-4868-9400-7a4291f4f1a1","resolution":{"observed_at":"2026-08-11T22:57:01.561721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20094","last_updated":"2025-05-08T00:24:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-28T17:59:01Z","title":"Scaling Synthetic Data Creation with 1,000,000,000 Personas","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20094","snapshot_observed_at":"2026-08-11T22:57:01.564680Z","title":"Scaling synthetic data creation with 1,000,000,000 personas, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.564680Z"},"links":{"cited_paper":"/paper/2406.20094","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:26e82058256947365dfa2ae3ff60f13c82effe6bfc04e77a88c10b4cacc38829","observation_id":"a36fe951-d449-43c3-94aa-34d6ce902b20","resolution":{"observed_at":"2026-08-11T22:57:01.564680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14369","last_updated":"2024-02-27T19:21:46Z","snapshot_observed_at":"2026-08-18T07:41:20.966522Z","submitted_at":"2023-12-22T01:43:27Z","title":"Quality-Diversity Generative Sampling for Learning with Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14369","snapshot_observed_at":"2026-08-11T22:57:01.567562Z","title":"Fontaine, Serena Booth, Maja J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.567562Z"},"links":{"cited_paper":"/paper/2312.14369","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:8928b415023a27fd430d28516a1ae4c44c5ca99b9720f44d5e1db0c0771c3111","observation_id":"4e374418-b12c-4c3e-9343-dbfdc317b935","resolution":{"observed_at":"2026-08-11T22:57:01.567562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10510","last_updated":"2025-03-07T05:29:18Z","snapshot_observed_at":"2026-08-16T14:26:15.364612Z","submitted_at":"2024-01-19T05:58:30Z","title":"When Large Language Models Meet Evolutionary Algorithms: Potential Enhancements and Challenges","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10510","snapshot_observed_at":"2026-08-11T22:57:01.570539Z","title":"A match made in consistency heaven: when large language models meet evolutionary algorithms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.570539Z"},"links":{"cited_paper":"/paper/2401.10510","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:57f57e5193d70e4cbe43f694a0b48f7b1237c1ad1e431bdd3f627dfa36f6df69","observation_id":"cc628f81-24a9-49e9-a667-494f4a6839c2","resolution":{"observed_at":"2026-08-11T22:57:01.570539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:57:01.573375Z","title":"Quality-diversity optimization: a novel branch of stochastic optimization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.573375Z"},"links":{"citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:9f67b676df151901a4d1785d2c7306726fdaeb267c8a1d700ec2e7a0284521be","observation_id":"4afa5f68-d35f-4545-80b8-cfe3dbacc57a","resolution":{"observed_at":"2026-08-11T22:57:01.573375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.14838","last_updated":"2023-11-16T18:02:19Z","snapshot_observed_at":"2026-08-16T15:51:58.581542Z","submitted_at":"2023-02-28T18:37:25Z","title":"EvoPrompting: Language Models for Code-Level Neural Architecture Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.14838","snapshot_observed_at":"2026-08-11T22:57:01.575642Z","title":"Dohan, and David R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.575642Z"},"links":{"cited_paper":"/paper/2302.14838","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:26c97ebd15e032ed4e650ef5b77998556013db881b360d260ec0e6bf34c34e38","observation_id":"f647a0a2-19be-4b99-a646-61c71b727276","resolution":{"observed_at":"2026-08-11T22:57:01.575642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-08-16T13:07:44.720730Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-11T22:57:01.578235Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.578235Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:1d0be269ad8e05610199b2cf298ae8e32a74dfe34639be2fc720a862ba08df8e","observation_id":"79a021ac-c605-4bd2-a971-f3ef6ab589fd","resolution":{"observed_at":"2026-08-11T22:57:01.578235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08701","last_updated":"2024-02-13T18:37:25Z","snapshot_observed_at":"2026-08-16T15:15:35.760076Z","submitted_at":"2023-07-17T17:59:40Z","title":"AlpaGasus: Training A Better Alpaca with Fewer Data","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08701","snapshot_observed_at":"2026-08-11T22:57:01.580717Z","title":"Alpagasus: Training a better alpaca with fewer data, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.580717Z"},"links":{"cited_paper":"/paper/2307.08701","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:90cfe457e0169b54e6e625fb103b8590c8fe10738f13149e90b26c938dcd4959","observation_id":"a46fcc67-ed1f-4136-82ea-c631522f09f9","resolution":{"observed_at":"2026-08-11T22:57:01.580717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14430","last_updated":"2023-07-26T18:01:49Z","snapshot_observed_at":"2026-08-16T15:13:02.034881Z","submitted_at":"2023-07-26T18:01:49Z","title":"Skill-it! A Data-Driven Skills Framework for Understanding and Training Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14430","snapshot_observed_at":"2026-08-11T22:57:01.583153Z","title":"Chen, Nicholas Roberts, Kush Bhatia, Jue Wang, Ce Zhang, Frederic Sala, and Christopher Ré","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.583153Z"},"links":{"cited_paper":"/paper/2307.14430","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:26c105c7d6cae041d0187782744a1bab7cc0309ddcf4e4a560cd00644b1f06e7","observation_id":"6a7b69a9-3a39-41ae-86ba-2a379d29608d","resolution":{"observed_at":"2026-08-11T22:57:01.583153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12588","last_updated":"2023-10-23T01:27:38Z","snapshot_observed_at":"2026-08-02T13:06:11.850456Z","submitted_at":"2022-11-22T21:06:00Z","title":"Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12588","snapshot_observed_at":"2026-08-11T22:57:01.585897Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.585897Z"},"links":{"cited_paper":"/paper/2211.12588","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:bcb9a16b1ffc20382ab7a34b36be2af9ea4c4962d78b4e05ded9d27af9970488","observation_id":"fbd7dd49-382c-4124-9013-666138e7347d","resolution":{"observed_at":"2026-08-11T22:57:01.585897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-08-15T08:59:30.302596Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01335","snapshot_observed_at":"2026-08-11T22:57:01.588450Z","title":"Self-play fine-tuning converts weak language models to strong language models, 2024 c","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.588450Z"},"links":{"cited_paper":"/paper/2401.01335","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:265a929511dbaa77b2b9169e6df8c92dbdb538480d88943e44187456829e23ce","observation_id":"499bd87f-ee68-4e9e-8a3b-6bd532e9fe9f","resolution":{"observed_at":"2026-08-11T22:57:01.588450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.06671","last_updated":"2023-02-22T19:18:28Z","snapshot_observed_at":"2026-08-16T15:55:37.821246Z","submitted_at":"2023-02-13T20:18:25Z","title":"GenAug: Retargeting behaviors to unseen situations via Generative Augmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.06671","snapshot_observed_at":"2026-08-11T22:57:01.591004Z","title":"Genaug: Retargeting behaviors to unseen situations via generative augmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.591004Z"},"links":{"cited_paper":"/paper/2302.06671","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:2db3b667276e9e9029389ca38e6c71f204d1883664116934ff298c62c4d0cb2d","observation_id":"9df11f52-52b9-474e-863d-ce810e8ac246","resolution":{"observed_at":"2026-08-11T22:57:01.591004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:57:01.593846Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.593846Z"},"links":{"citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:65499b223bb939db9d1f1a651192d643eed91dcbbc0bffa6c09d4d38504c90d3","observation_id":"0e84f979-b41c-4d41-868f-f52a7c48ec96","resolution":{"observed_at":"2026-08-11T22:57:01.593846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06084","last_updated":"2024-10-08T14:40:51Z","snapshot_observed_at":"2026-08-16T13:11:28.483062Z","submitted_at":"2024-10-08T14:40:51Z","title":"Diversity-Rewarded CFG Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06084","snapshot_observed_at":"2026-08-11T22:57:01.596170Z","title":"Diversity-rewarded cfg distillation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.596170Z"},"links":{"cited_paper":"/paper/2410.06084","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:ae2a4b34cd426eae6062e18446e6577f7b7daabc8c555083b056d6a8c0fca91f","observation_id":"a73503b5-e71e-4312-88ac-1774d42e6bbd","resolution":{"observed_at":"2026-08-11T22:57:01.596170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-11T22:57:01.599116Z","title":"Training verifiers to solve math word problems, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.599116Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:5a19ab33e4a3ced34238db44a89c84da726b5ab8a02424c4ddd6da6748fb9d82","observation_id":"9157f503-a280-4968-a3b6-94a9078fae44","resolution":{"observed_at":"2026-08-11T22:57:01.599116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:57:01.602002Z","title":"Quality and diversity optimization: A unifying modular framework","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.602002Z"},"links":{"citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:8f4270a7a9c6e92258745dac2c2b84e5fcff9a1dff1affb072597d1197ebd917","observation_id":"6f509ba6-8617-4aaf-9f80-fd5b2a20975d","resolution":{"observed_at":"2026-08-11T22:57:01.602002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:57:01.604653Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.604653Z"},"links":{"citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:6914d764022bb1d689df2568245317873db6cb28b9f8d0feaf85a9740ee535da","observation_id":"ba317188-fac3-4cfa-9bd6-31fd3687cb90","resolution":{"observed_at":"2026-08-11T22:57:01.604653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10450","last_updated":"2023-06-14T16:11:50Z","snapshot_observed_at":"2026-08-18T08:12:27.255968Z","submitted_at":"2022-12-20T17:28:41Z","title":"Is GPT-3 a Good Data Annotator?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10450","snapshot_observed_at":"2026-08-11T22:57:01.607230Z","title":"Is gpt-3 a good data annotator?, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.607230Z"},"links":{"cited_paper":"/paper/2212.10450","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:29f2ea2cfc34256d9e9888c2d74df91a54d9b928d9c76b5a7c13fa9d2e68a016","observation_id":"85751ac7-0807-47fa-a81a-114b5adca09e","resolution":{"observed_at":"2026-08-11T22:57:01.607230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12103","last_updated":"2024-06-04T08:39:33Z","snapshot_observed_at":"2026-08-18T15:58:14.587900Z","submitted_at":"2023-10-18T16:46:16Z","title":"Quality Diversity through Human Feedback: Towards Open-Ended Diversity-Driven Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12103","snapshot_observed_at":"2026-08-11T22:57:01.610062Z","title":"Quality diversity through human feedback: Towards open-ended diversity-driven optimization, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.610062Z"},"links":{"cited_paper":"/paper/2310.12103","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:65d1000432b331ebdad5411cd13ec964627715870265aaee5fffc0660ed95f65","observation_id":"a215cac1-d840-4703-ba99-6eff333784dc","resolution":{"observed_at":"2026-08-11T22:57:01.610062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05492","last_updated":"2024-06-07T15:51:08Z","snapshot_observed_at":"2026-08-16T14:53:55.872485Z","submitted_at":"2023-10-09T07:56:16Z","title":"How Abilities in Large Language Models are Affected by Supervised Fine-tuning Data Composition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05492","snapshot_observed_at":"2026-08-11T22:57:01.613086Z","title":"How abilities in large language models are affected by supervised fine-tuning data composition, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.613086Z"},"links":{"cited_paper":"/paper/2310.05492","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:24bef7b397d46fcbb806402540d83eddbdfbb658c823e9fd630489211f8e2620","observation_id":"ac034c98-970f-4300-a76d-7bf9922331ce","resolution":{"observed_at":"2026-08-11T22:57:01.613086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-11T22:57:01.616180Z","title":"Raft: Reward ranked finetuning for generative foundation model alignment, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.616180Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:cd1110b4729f6c3e1edd9f57394d6f5f2a5a288a57c002c2a96bc5c14488c9df","observation_id":"83ce8e05-f2f9-4331-ab7a-aedceafe4f48","resolution":{"observed_at":"2026-08-11T22:57:01.616180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.06905","last_updated":"2022-08-01T21:07:58Z","snapshot_observed_at":"2026-08-16T17:35:00.350389Z","submitted_at":"2021-12-13T18:58:19Z","title":"GLaM: Efficient Scaling of Language Models with Mixture-of-Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.06905","snapshot_observed_at":"2026-08-11T22:57:01.619639Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.619639Z"},"links":{"cited_paper":"/paper/2112.06905","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:0db14f07842625ab3c5715caf8feda7899dbcf8b7371e8bb4666a8ebb5d9b364","observation_id":"627cb14b-9c02-4ba8-af9b-d8e0467d3879","resolution":{"observed_at":"2026-08-11T22:57:01.619639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T22:57:01.626085Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.626085Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:7e5a111e4571403572cb1b431989edf72b3ebdb45b40d3b59dc5eb12f21df6d3","observation_id":"424ca5a5-5e2d-411a-ba4e-18f0017fd222","resolution":{"observed_at":"2026-08-11T22:57:01.626085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07759","last_updated":"2023-05-24T23:30:43Z","snapshot_observed_at":"2026-08-18T15:07:59.954930Z","submitted_at":"2023-05-12T20:56:48Z","title":"TinyStories: How Small Can Language Models Be and Still Speak Coherent English?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07759","snapshot_observed_at":"2026-08-11T22:57:01.628809Z","title":"Tinystories: How small can language models be and still speak coherent english?, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.628809Z"},"links":{"cited_paper":"/paper/2305.07759","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:f6782ccb54ccae87f3f0113c86347d9326d117a7c0527f654227ed68d33da20e","observation_id":"1741d9bb-6a8b-4c68-b1f4-474d1bd0267f","resolution":{"observed_at":"2026-08-11T22:57:01.628809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:57:01.631852Z","title":"Understanding dataset difficulty with V -usable information","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.631852Z"},"links":{"citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:34568cd562d4047de94a979cbc123c34b8523ca5d2915adef5db79bf71b471fe","observation_id":"07e4259e-4d95-4f78-9969-1f184bcf421d","resolution":{"observed_at":"2026-08-11T22:57:01.631852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04567","last_updated":"2023-12-07T18:59:59Z","snapshot_observed_at":"2026-08-16T14:36:43.264736Z","submitted_at":"2023-12-07T18:59:59Z","title":"Scaling Laws of Synthetic Images for Model Training ... for Now","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04567","snapshot_observed_at":"2026-08-11T22:57:01.634864Z","title":"Scaling laws of synthetic images for model training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.634864Z"},"links":{"cited_paper":"/paper/2312.04567","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:7867ec14f796479f47bf43adc875383631a4a95b0fc5afe02e8c06052c835c0c","observation_id":"77dab9f3-2543-4c49-a93d-8690774d3531","resolution":{"observed_at":"2026-08-11T22:57:01.634864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15389","last_updated":"2023-10-23T22:41:33Z","snapshot_observed_at":"2026-08-18T02:44:50.937763Z","submitted_at":"2023-10-23T22:41:33Z","title":"Irreducible Curriculum for Language Model Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15389","snapshot_observed_at":"2026-08-11T22:57:01.637548Z","title":"Irreducible curriculum for language model pretraining, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.637548Z"},"links":{"cited_paper":"/paper/2310.15389","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:d67f3e89b321ab77604004ba06d9d6061689018fef81b32b67e410092b7041c6","observation_id":"7d772907-ce09-4d00-8749-dba835be5d5e","resolution":{"observed_at":"2026-08-11T22:57:01.637548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:57:01.640034Z","title":"Promptbreeder: Self-referential self-improvement via prompt evolution, 2023 a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.640034Z"},"links":{"citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:9c2e99f2c526ae962e3f069c9a2aae51599ac67066a6732b7ed4608b8ed91e88","observation_id":"d76f722c-6e36-40b6-ac00-de14e0c9267e","resolution":{"observed_at":"2026-08-11T22:57:01.640034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16797","last_updated":"2023-09-28T19:01:07Z","snapshot_observed_at":"2026-08-14T11:37:32.461743Z","submitted_at":"2023-09-28T19:01:07Z","title":"Promptbreeder: Self-Referential Self-Improvement Via Prompt Evolution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16797","snapshot_observed_at":"2026-08-11T22:57:01.642298Z","title":"Promptbreeder: Self-referential self-improvement via prompt evolution, 2023 b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.642298Z"},"links":{"cited_paper":"/paper/2309.16797","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:4fe66d9d3708f0ef69b658753ebe57b5795ac884f6117ea97ec5eb3c51b4b24f","observation_id":"88f73475-dc91-4167-b578-16b4c9e04ebc","resolution":{"observed_at":"2026-08-11T22:57:01.642298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:57:01.645406Z","title":"A quality diversity approach to automatically generating human-robot interaction scenarios in shared autonomy","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.645406Z"},"links":{"citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:154d356a782f37220339ca073ba3db81d1098d0618aaa01c1e98baf9a34d08d0","observation_id":"ecc80338-7120-4599-bf41-01279bf3df9c","resolution":{"observed_at":"2026-08-11T22:57:01.645406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:57:01.647930Z","title":"On the importance of environments in human-robot coordination","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.647930Z"},"links":{"citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:d5151e45c255dd74d630e38534a90580c2d38135ff78abd4e638b6cf30847295","observation_id":"bf916bd4-30ca-4a4b-9244-869e38c4b099","resolution":{"observed_at":"2026-08-11T22:57:01.647930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.05674","last_updated":"2021-06-21T04:14:08Z","snapshot_observed_at":"2026-07-06T09:37:21.014976Z","submitted_at":"2020-07-11T03:38:06Z","title":"Illuminating Mario Scenes in the Latent Space of a Generative Adversarial Network","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.05674","snapshot_observed_at":"2026-08-11T22:57:01.650297Z","title":"Fontaine, Ruilin Liu, Ahmed Khalifa, Jignesh Modi, Julian Togelius, Amy K","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.650297Z"},"links":{"cited_paper":"/paper/2007.05674","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:b0dbfef548f94958b2a5e8470e9ae22146041cae14440433d292b5d6f35b508e","observation_id":"9fd70db5-bffe-460b-8a3f-43f1eea54535","resolution":{"observed_at":"2026-08-11T22:57:01.650297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03683","last_updated":"2024-04-01T06:50:52Z","snapshot_observed_at":"2026-08-17T18:41:15.883469Z","submitted_at":"2024-04-01T06:50:52Z","title":"Stream of Search (SoS): Learning to Search in Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03683","snapshot_observed_at":"2026-08-11T22:57:01.652896Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.652896Z"},"links":{"cited_paper":"/paper/2404.03683","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:6be26760f0712fc1ef03a3a7312d055b610fd9b411d3b8970505a341545395e0","observation_id":"9aeb525a-544c-48ec-aa30-4c66713173e4","resolution":{"observed_at":"2026-08-11T22:57:01.652896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14361","last_updated":"2024-04-26T19:02:23Z","snapshot_observed_at":"2026-08-18T11:17:15.212859Z","submitted_at":"2024-04-22T17:15:32Z","title":"Better Synthetic Data by Retrieving and Transforming Existing Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14361","snapshot_observed_at":"2026-08-11T22:57:01.655643Z","title":"Better synthetic data by retrieving and transforming existing datasets, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.655643Z"},"links":{"cited_paper":"/paper/2404.14361","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:6fdcd73b8f3acdffc1aeb247a429f5aabfaf424b9ac3e7a017d3a4e6d50612a4","observation_id":"034d0254-0f7a-42c8-b96b-b600df627392","resolution":{"observed_at":"2026-08-11T22:57:01.655643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-11T22:57:01.658065Z","title":"The pile: An 800gb dataset of diverse text for language modeling, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.658065Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:eb29d39ad82dc7a88e92a8cd586dfbbd4eb0721ba3a70b3e40cc74b0d875a5e6","observation_id":"eeda1ad2-35b9-4727-8d21-4f822953af51","resolution":{"observed_at":"2026-08-11T22:57:01.658065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11738","last_updated":"2024-02-21T12:59:21Z","snapshot_observed_at":"2026-07-31T18:12:14.483728Z","submitted_at":"2023-05-19T15:19:44Z","title":"CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11738","snapshot_observed_at":"2026-08-11T22:57:01.660719Z","title":"Critic: Large language models can self-correct with tool-interactive critiquing, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.660719Z"},"links":{"cited_paper":"/paper/2305.11738","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:07dfd845700117832e1af826618a8ba87288f98e85a2b5a1e9079b4b5d670c47","observation_id":"ad6fd7ed-313c-4616-a9fd-eedfb5c70edc","resolution":{"observed_at":"2026-08-11T22:57:01.660719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.03003","last_updated":"2017-04-10T18:25:29Z","snapshot_observed_at":"2026-08-14T21:07:25.596799Z","submitted_at":"2017-04-10T18:25:29Z","title":"Automated Curriculum Learning for Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.03003","snapshot_observed_at":"2026-08-11T22:57:01.663277Z","title":"Bellemare, Jacob Menick, Remi Munos, and Koray Kavukcuoglu","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.663277Z"},"links":{"cited_paper":"/paper/1704.03003","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:3c3006b8cc0f926267f601890b85c590455670eda4fff52c9a739e04aec40439","observation_id":"0fcbdf0a-ecf8-4007-a715-64f4390c38fc","resolution":{"observed_at":"2026-08-11T22:57:01.663277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-08-13T14:38:32.919809Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08998","snapshot_observed_at":"2026-08-11T22:57:01.666199Z","title":"Reinforced self-training (rest) for language modeling, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.666199Z"},"links":{"cited_paper":"/paper/2308.08998","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:8243af917f82468ef5196c5bba057e0910f327e00fc7b366243ad81d260eb2db","observation_id":"948ab8f3-5eab-4fa6-b5c8-81681024ed3a","resolution":{"observed_at":"2026-08-11T22:57:01.666199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-08-13T11:19:55.436754Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11644","snapshot_observed_at":"2026-08-11T22:57:01.669080Z","title":"Textbooks are all you need","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.669080Z"},"links":{"cited_paper":"/paper/2306.11644","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:76b00ec88a29aaa2767d270aa41792f7c8500186b40c378bfeae9f46fe164425","observation_id":"35d57db0-c7c2-4732-a3bc-812863b1f5ba","resolution":{"observed_at":"2026-08-11T22:57:01.669080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04190","last_updated":"2024-03-07T03:38:44Z","snapshot_observed_at":"2026-08-18T09:21:11.805386Z","submitted_at":"2024-03-07T03:38:44Z","title":"Generative AI for Synthetic Data Generation: Methods, Challenges and the Future","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04190","snapshot_observed_at":"2026-08-11T22:57:01.671903Z","title":"Generative ai for synthetic data generation: Methods, challenges and the future, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.671903Z"},"links":{"cited_paper":"/paper/2403.04190","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:eb4d9b3d632e8223d99ae91faaaa857e296d891b0c8504899cda6d63ba020828","observation_id":"35415944-4c42-40ba-8726-d1034c241e57","resolution":{"observed_at":"2026-08-11T22:57:01.671903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-11T22:57:01.674944Z","title":"Mastering diverse domains through world models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.674944Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:4b63ae5574c562e1481c6e769344f412badfd47c906737b80d98180499f31235","observation_id":"92076b25-8751-43cd-9914-d591fcb38e4b","resolution":{"observed_at":"2026-08-11T22:57:01.674944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02792","last_updated":"2019-04-04T21:03:34Z","snapshot_observed_at":"2026-08-16T03:04:17.238046Z","submitted_at":"2019-04-04T21:03:34Z","title":"Unifying Human and Statistical Evaluation for Natural Language Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02792","snapshot_observed_at":"2026-08-11T22:57:01.677969Z","title":"Hashimoto, Hugh Zhang, and Percy Liang","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.677969Z"},"links":{"cited_paper":"/paper/1904.02792","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:6640ac6f5a35bac368bc132aa49278cd65fe54f3b0f8bcc160e0d5713230361a","observation_id":"8262b2bc-3063-465d-9c2e-a697dd650092","resolution":{"observed_at":"2026-08-11T22:57:01.677969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06646","last_updated":"2024-11-11T01:05:28Z","snapshot_observed_at":"2026-08-16T13:01:20.253184Z","submitted_at":"2024-11-11T01:05:28Z","title":"Understanding Scaling Laws with Statistical and Approximation Theory for Transformer Neural Networks on Intrinsically Low-dimensional Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06646","snapshot_observed_at":"2026-08-11T22:57:01.681157Z","title":"Understanding scaling laws with statistical and approximation theory for transformer neural networks on intrinsically low-dimensional data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.681157Z"},"links":{"cited_paper":"/paper/2411.06646","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:c747b972f3279b63ffe6931f8f5971cdf49c0d63be7400a768c2543611524150","observation_id":"c03b2c12-18c3-4c56-bc5e-946add09214a","resolution":{"observed_at":"2026-08-11T22:57:01.681157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-16T14:11:54.240619Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-11T22:57:01.684212Z","title":"Teaching large language models to reason with reinforcement learning, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.684212Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:8b2eb721672c861d5d30af6ec3e4976e0b8a1b1480dd902715c71214c6cee650","observation_id":"cf63e4ed-bb18-479c-aa5d-50872c9e5c05","resolution":{"observed_at":"2026-08-11T22:57:01.684212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10963","last_updated":"2024-06-25T03:14:10Z","snapshot_observed_at":"2026-08-16T14:18:50.765820Z","submitted_at":"2024-02-13T20:16:29Z","title":"GLoRe: When, Where, and How to Improve LLM Reasoning via Global and Local Refinements","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10963","snapshot_observed_at":"2026-08-11T22:57:01.687322Z","title":"Glore: When, where, and how to improve llm reasoning via global and local refinements, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.687322Z"},"links":{"cited_paper":"/paper/2402.10963","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:ea47d3c48f1fb748afe97ce417ab30f818896c74c68c4d56049f5bbc6538c5f1","observation_id":"acf75beb-9fe9-411e-a2a2-7c781bf8c757","resolution":{"observed_at":"2026-08-11T22:57:01.687322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:57:01.690353Z","title":"trl X : A framework for large scale reinforcement learning from human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.690353Z"},"links":{"citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:f8cce375f4cc43ce41886dfa4966401f813720c1f2ad8ca6b5d55c45fdb9d98e","observation_id":"01d088df-9690-4bb2-ac26-6ca339dfe67b","resolution":{"observed_at":"2026-08-11T22:57:01.690353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15645","last_updated":"2024-07-22T14:02:59Z","snapshot_observed_at":"2026-08-16T13:32:08.352934Z","submitted_at":"2024-07-22T14:02:59Z","title":"Psychometric Alignment: Capturing Human Knowledge Distributions via Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15645","snapshot_observed_at":"2026-08-11T22:57:01.693082Z","title":"Psychometric alignment: Capturing human knowledge distributions via language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.693082Z"},"links":{"cited_paper":"/paper/2407.15645","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:35c1c744fc8ce6628bd1c308cea09b4fe28b99f8fe2317a5d9be677aa08e206b","observation_id":"6581e03e-2b94-4961-9357-d9cdf31563b9","resolution":{"observed_at":"2026-08-11T22:57:01.693082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-11T22:57:01.695535Z","title":"Measuring massive multitask language understanding, 2021 a","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.695535Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:f6a8145df256a58ada650c0392a8d4ad25e47b97b16959a4b0642988fe87fb7b","observation_id":"f9bdbce1-5d1f-48de-b64e-41ffec152fc4","resolution":{"observed_at":"2026-08-11T22:57:01.695535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-11T22:57:01.697925Z","title":"Measuring mathematical problem solving with the math dataset, 2021 b","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.697925Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:34024a3d5096c1f74d1f98c77a503616498d2d9fca353d2dcc4b7ceaca280ba1","observation_id":"00cb816c-f9e6-4679-97aa-a3f85c5ec5e7","resolution":{"observed_at":"2026-08-11T22:57:01.697925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-11T22:57:01.700468Z","title":"Rae, Oriol Vinyals, and Laurent Sifre","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.700468Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:b6668a800e1a630de8ccf98ad3b869abcd52fbcce4a12b3d075c92180ddcaf2d","observation_id":"ac913df3-750e-488d-8c79-9783db39da81","resolution":{"observed_at":"2026-08-11T22:57:01.700468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09751","last_updated":"2020-02-14T21:56:30Z","snapshot_observed_at":"2026-07-06T07:47:32.745963Z","submitted_at":"2019-04-22T07:17:18Z","title":"The Curious Case of Neural Text Degeneration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09751","snapshot_observed_at":"2026-08-11T22:57:01.703647Z","title":"The curious case of neural text degeneration, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.703647Z"},"links":{"cited_paper":"/paper/1904.09751","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:32daaa6c40c5c2aba7009809dcee57d87e1fa21db3b98ff4f63988448614df57","observation_id":"8af74132-cdb8-44f8-bed3-d9a6c34f9230","resolution":{"observed_at":"2026-08-11T22:57:01.703647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09689","last_updated":"2022-12-19T18:21:00Z","snapshot_observed_at":"2026-08-18T07:06:13.630649Z","submitted_at":"2022-12-19T18:21:00Z","title":"Unnatural Instructions: Tuning Language Models with (Almost) No Human Labor","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09689","snapshot_observed_at":"2026-08-11T22:57:01.706316Z","title":"Unnatural instructions: Tuning language models with (almost) no human labor, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.706316Z"},"links":{"cited_paper":"/paper/2212.09689","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:ee37023e580b407aba38d70e56579aab8c3aea694f117eacfb85b6243c9ba6d5","observation_id":"0da5afc7-794f-4b0d-a6e5-2ac3ddc5ab34","resolution":{"observed_at":"2026-08-11T22:57:01.706316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11610","last_updated":"2022-10-25T17:45:17Z","snapshot_observed_at":"2026-08-09T02:27:34.152063Z","submitted_at":"2022-10-20T21:53:54Z","title":"Large Language Models Can Self-Improve","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11610","snapshot_observed_at":"2026-08-11T22:57:01.708834Z","title":"Large language models can self-improve, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.708834Z"},"links":{"cited_paper":"/paper/2210.11610","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:d5bb36523c7b6ceff0057214d9814b0c9534d8961f5f1aee6e86e60fe67c725a","observation_id":"3c6e9091-4c9f-4398-a386-0a006ec3390b","resolution":{"observed_at":"2026-08-11T22:57:01.708834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:57:01.711490Z","title":"Open-endedness is essential for artificial superhuman intelligence, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.711490Z"},"links":{"citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:268fec2b5baeaa8da7b937a87ad78a55dc9838d33966e558d1f608c4cea5209f","observation_id":"a3694079-8ba1-4f51-a90a-282186aa9d14","resolution":{"observed_at":"2026-08-11T22:57:01.711490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:57:01.713937Z","title":"Phi-2: The surprising power of small language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.713937Z"},"links":{"citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:5a784b15a4f68f73910ed696e2c98d089ebddc4126b66e232702debc531d6074","observation_id":"3a061c03-6bfc-41c3-af7c-1ccd99501f48","resolution":{"observed_at":"2026-08-11T22:57:01.713937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:57:01.716230Z","title":"General intelligence requires rethinking exploration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.716230Z"},"links":{"citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:61ade442cbd44bccd3638e56c182c365f5c6aa58d9d9ebc8477710802ef93227","observation_id":"ab76df70-6753-472e-b41b-b8d27678b8ee","resolution":{"observed_at":"2026-08-11T22:57:01.716230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:57:01.718524Z","title":"Self-planning code generation with large language models, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.718524Z"},"links":{"citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:341fecd04db74ef458d4308bcf31b3d04257c85acc5ef564f50e8028c6d2bb98","observation_id":"06ad8221-2593-467d-b048-7d462f818a90","resolution":{"observed_at":"2026-08-11T22:57:01.718524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11820","last_updated":"2024-10-15T17:47:44Z","snapshot_observed_at":"2026-08-16T13:09:05.378101Z","submitted_at":"2024-10-15T17:47:44Z","title":"Adaptive Data Optimization: Dynamic Sample Selection with Scaling Laws","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11820","snapshot_observed_at":"2026-08-11T22:57:01.720797Z","title":"Zico Kolter","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.720797Z"},"links":{"cited_paper":"/paper/2410.11820","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:4259b374d566f34181fea22200f095f6966152ec79b572a9aaff7b1462d70cfe","observation_id":"bdb7789a-0e56-494b-8906-9c4d1b8c0e4b","resolution":{"observed_at":"2026-08-11T22:57:01.720797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06416","last_updated":"2024-08-02T21:59:03Z","snapshot_observed_at":"2026-08-18T15:44:42.458749Z","submitted_at":"2024-01-12T07:24:26Z","title":"Mission: Impossible Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06416","snapshot_observed_at":"2026-08-11T22:57:01.723763Z","title":"Mission: Impossible language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.723763Z"},"links":{"cited_paper":"/paper/2401.06416","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:39a8e9f8a6b90f897a7502433208d1946c8cbcbc00debbef8944ccc6708af885","observation_id":"5cbbc3c9-49e4-4da0-b441-d37f4a99ddfc","resolution":{"observed_at":"2026-08-11T22:57:01.723763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-11T22:57:01.727044Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.727044Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:56f0e540a69af8d0045502694cc15fe9ac4dabc73600c65d1a1d97a902086c93","observation_id":"d1046448-6e8e-4603-9698-51141f95787a","resolution":{"observed_at":"2026-08-11T22:57:01.727044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13735","last_updated":"2023-10-21T01:50:54Z","snapshot_observed_at":"2026-08-16T15:30:47.399344Z","submitted_at":"2023-05-23T06:41:16Z","title":"Aligning Large Language Models through Synthetic Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13735","snapshot_observed_at":"2026-08-11T22:57:01.730077Z","title":"Aligning large language models through synthetic feedback, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.730077Z"},"links":{"cited_paper":"/paper/2305.13735","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:831b8b1f901013c876a4d9441371970a9094f58f6373024d147a2084944532ce","observation_id":"9943dbdd-8938-4107-a15c-1f13f1750abf","resolution":{"observed_at":"2026-08-11T22:57:01.730077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06452","last_updated":"2024-02-19T14:39:07Z","snapshot_observed_at":"2026-08-14T15:51:49.712613Z","submitted_at":"2023-10-10T09:25:44Z","title":"Understanding the Effects of RLHF on LLM Generalisation and Diversity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06452","snapshot_observed_at":"2026-08-11T22:57:01.733324Z","title":"Understanding the effects of rlhf on llm generalisation and diversity, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.733324Z"},"links":{"cited_paper":"/paper/2310.06452","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:86b33dbe4fa3a08ced44fd426db8cf7cf64f0358c21bd5c0a7544e7da17af56f","observation_id":"13209e60-0223-48ae-ad90-738155a0883a","resolution":{"observed_at":"2026-08-11T22:57:01.733324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11275","last_updated":"2022-10-21T10:24:00Z","snapshot_observed_at":"2026-08-18T03:58:36.104476Z","submitted_at":"2022-05-23T12:47:13Z","title":"RL with KL penalties is better viewed as Bayesian inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11275","snapshot_observed_at":"2026-08-11T22:57:01.736400Z","title":"Rl with kl penalties is better viewed as bayesian inference, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.736400Z"},"links":{"cited_paper":"/paper/2205.11275","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:b524f221e50cfb656db2ad39da1bcfcd12db92cc53b07a3db6a86ce3c39020d5","observation_id":"b6138706-4deb-459f-b813-80733664939a","resolution":{"observed_at":"2026-08-11T22:57:01.736400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-08-16T03:33:39.637646Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12917","snapshot_observed_at":"2026-08-11T22:57:01.739813Z","title":"Training language models to self-correct via reinforcement learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.739813Z"},"links":{"cited_paper":"/paper/2409.12917","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:9eb2258a25193ba44009c477d819db19e250a10e01881ba4c8ea41ea31c7d9f6","observation_id":"fe491448-3b42-4fb9-b63b-5e8516dc2f54","resolution":{"observed_at":"2026-08-11T22:57:01.739813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.00833","last_updated":"2023-10-31T04:06:28Z","snapshot_observed_at":"2026-08-17T21:18:59.102876Z","submitted_at":"2023-05-01T14:02:48Z","title":"Learning to Reason and Memorize with Self-Notes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.00833","snapshot_observed_at":"2026-08-11T22:57:01.743666Z","title":"Learning to reason and memorize with self-notes, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.743666Z"},"links":{"cited_paper":"/paper/2305.00833","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:b198043cca8aaf12bc9685ccd6baf7ff3ee42a5390f242405d487732ad8fb9ef","observation_id":"c5c86204-982b-4715-b3b6-82f55f993042","resolution":{"observed_at":"2026-08-11T22:57:01.743666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.01780","last_updated":"2022-11-03T08:32:59Z","snapshot_observed_at":"2026-08-16T16:48:21.526954Z","submitted_at":"2022-07-05T02:42:15Z","title":"CodeRL: Mastering Code Generation through Pretrained Models and Deep Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.01780","snapshot_observed_at":"2026-08-11T22:57:01.746812Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.746812Z"},"links":{"cited_paper":"/paper/2207.01780","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:7b1f89fdc3cd66228c929b5a66793866bbc25cd025a4f4d4b0c9bf5ce8b16689","observation_id":"4f05602f-0752-4c6a-a7a7-bffad41cd4b2","resolution":{"observed_at":"2026-08-11T22:57:01.746812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13840","last_updated":"2025-07-02T21:53:51Z","snapshot_observed_at":"2026-08-18T07:57:11.786318Z","submitted_at":"2023-06-24T02:25:56Z","title":"Beyond Scale: The Diversity Coefficient as a Data Quality Metric for Variability in Natural Language Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13840","snapshot_observed_at":"2026-08-11T22:57:01.749831Z","title":"Beyond scale: the diversity coefficient as a data quality metric demonstrates llms are pre-trained on formally diverse data, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.749831Z"},"links":{"cited_paper":"/paper/2306.13840","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:82913409327c3a17a15b5a381b35dc611096038af0efaad6293015695de5dd76","observation_id":"9324db8a-0105-409a-8a16-3a3cfe74a07c","resolution":{"observed_at":"2026-08-11T22:57:01.749831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09518","last_updated":"2024-06-16T22:46:38Z","snapshot_observed_at":"2026-08-16T14:52:10.701494Z","submitted_at":"2023-10-14T07:16:08Z","title":"Instruction Tuning with Human Curriculum","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09518","snapshot_observed_at":"2026-08-11T22:57:01.753024Z","title":"Lee, Hyunsoo Cho, and Kang Min Yoo","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.753024Z"},"links":{"cited_paper":"/paper/2310.09518","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:9a7f58c8b18fefa9583565387b5ac370d50e3ba880a36fc0dc977d058ca41130","observation_id":"941fbff9-7757-4086-94bf-39c697544f26","resolution":{"observed_at":"2026-08-11T22:57:01.753024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:57:01.755907Z","title":"Deduplicating training data makes language models better","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.755907Z"},"links":{"citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:358e9512fb786a707d645f8448bd296d3d64e02b6d27be6d41181f45f12b16ab","observation_id":"6ed99d71-dfed-40e1-ab46-c691969ea203","resolution":{"observed_at":"2026-08-11T22:57:01.755907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:57:01.758590Z","title":"Abandoning objectives: Evolution through the search for novelty alone","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.758590Z"},"links":{"citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:2a3ca1d1c58fda75289b4059fb7a0f14a153234e3623ce08f99008ce1c37b798","observation_id":"f0f94df1-0c3c-4834-a046-b0c3ed2233a1","resolution":{"observed_at":"2026-08-11T22:57:01.758590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:57:01.760882Z","title":"Evolving a diversity of virtual creatures through novelty search and local competition","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.760882Z"},"links":{"citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:b4b2b003a743835b8aa7132c74f84cb5578638fae3f024e87d272dc880c82bc8","observation_id":"7d0b9bca-0335-45c3-926b-96272425247b","resolution":{"observed_at":"2026-08-11T22:57:01.760882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08896","last_updated":"2022-06-17T17:07:04Z","snapshot_observed_at":"2026-08-16T16:52:11.513223Z","submitted_at":"2022-06-17T17:07:04Z","title":"Evolution through Large Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08896","snapshot_observed_at":"2026-08-11T22:57:01.763082Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.763082Z"},"links":{"cited_paper":"/paper/2206.08896","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:b3bde2ad0a319ff457bd183dc5dbe0d432596048fbda152adf566c3b93981b1d","observation_id":"e18d0083-7a52-431a-86db-85fefda34a6e","resolution":{"observed_at":"2026-08-11T22:57:01.763082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04706","last_updated":"2024-03-07T18:00:40Z","snapshot_observed_at":"2026-08-16T14:11:52.394188Z","submitted_at":"2024-03-07T18:00:40Z","title":"Common 7B Language Models Already Possess Strong Math Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04706","snapshot_observed_at":"2026-08-11T22:57:01.765903Z","title":"Common 7b language models already possess strong math capabilities, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.765903Z"},"links":{"cited_paper":"/paper/2403.04706","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:30e2d8100370cb88b3a5fbd44cacf22bbe74954733cc2df4db0bd657f71c5750","observation_id":"e37ea368-107c-4581-8034-d9ed45bf1621","resolution":{"observed_at":"2026-08-11T22:57:01.765903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11794","snapshot_observed_at":"2026-08-11T22:57:01.768492Z","title":"Dimakis, Yair Carmon, Achal Dave, Ludwig Schmidt, and Vaishaal Shankar","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models","version":2},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-08-11T22:57:01.768492Z"},"links":{"cited_paper":"/paper/2406.11794","citing_paper":"/paper/2412.02980"},"observation_digest":"sha256:966233ce78404c9fd55ff6ae6343b298ecd4d16dfd4107afa2036221fc7acfa3","observation_id":"97c5a342-eece-47d4-b4d3-bf5b7bead9e8","resolution":{"observed_at":"2026-08-11T22:57:01.768492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.02980","last_updated":"2024-12-09T22:23:41Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T13:18:49.671776Z","submitted_at":"2024-12-04T02:47:45Z","title":"Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":250},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 100 of 250 outbound references and 8 inbound Pith citation observations for arXiv:2412.02980."}