{"as_of":"2026-08-08T05:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:16231586144862ac131f0a5c079a1979ec68183b0e0efdf927e7ac777711f6eb","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:12:19.055117Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:53:39.113934Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19262","snapshot_observed_at":"2026-08-05T15:53:39.113934Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19402","last_updated":"2025-08-26T19:55:40Z","snapshot_observed_at":"2026-08-06T16:54:45.880880Z","submitted_at":"2025-08-26T19:55:40Z","title":"One Joke to Rule them All? On the (Im)possibility of Generalizing Humor","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T15:53:39.113934Z"},"links":{"cited_paper":"/paper/2506.19262","citing_paper":"/paper/2508.19402"},"observation_digest":"sha256:475f812d89ea5cfcb746f62d70d906b8ea407a785f4ca67a01ad50ba7dbf5b89","observation_id":"f400b560-54ac-4a6e-a286-d40eb55b50fc","resolution":{"observed_at":"2026-08-05T15:53:39.113934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"cited_work":{"arxiv_id":"2506.19262","doi":"10.48550/arxiv.2506.19262","metadata_source":"pith","pith_arxiv_id":"2506.19262","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","venue":"cs.CL","work_id":"512f9f97-6c70-49b4-9766-de445994aa44","year":2025},"citing_paper":{"arxiv_id":"2512.15011","last_updated":"2026-07-29T22:32:02Z","snapshot_observed_at":"2026-08-05T20:21:25.305335Z","submitted_at":"2025-12-17T02:03:28Z","title":"Epistemic diversity across language models mitigates knowledge collapse","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T15:57:18.174038Z"},"links":{"cited_paper":"/paper/2506.19262","citing_paper":"/paper/2512.15011"},"observation_digest":"sha256:0fddaa05658b9576f0b77adbe33fcc1e6caf52bf1aff63ba7550b5d12584fef5","observation_id":"f76b29ef-44c0-4475-9f5d-890516a762cf","resolution":{"observed_at":"2026-08-03T15:59:04.798474Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19262","snapshot_observed_at":"2026-08-03T01:17:11.723762Z","title":"What matters in llm-generated data: Diversity and its effect on model fine-tuning.arXiv preprint arXiv:2506.19262, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.10388","last_updated":"2026-05-29T05:05:29Z","snapshot_observed_at":"2026-08-07T17:40:15.715656Z","submitted_at":"2026-02-11T00:23:13Z","title":"Less is Enough: Synthesizing Diverse Data in LLM Feature Space with Sparse Autoencoders","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T01:17:11.723762Z"},"links":{"cited_paper":"/paper/2506.19262","citing_paper":"/paper/2602.10388"},"observation_digest":"sha256:c565890abbe856a31631c6f9496ece6b55324928a72a476dd262df10493d8f51","observation_id":"41c68f9a-9d4c-4b38-ae8d-500c2ce2c6f5","resolution":{"observed_at":"2026-08-03T01:17:11.723762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.19262/citation-record","integrity":"/paper/2506.19262/integrity","json":"/paper/2506.19262/citation-record.json","paper":"/paper/2506.19262"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-05T04:04:21.846023Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-08-06T23:12:18.851748Z","title":"Phi-4 technical report.arXiv preprint arXiv:2412.08905, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.851748Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:6cb0e4e5e894f05a3519ecc96a3a449f4a817638523c2abbb6ff870bd67be7e6","observation_id":"645864b0-6078-460d-894c-0f73a24b1c66","resolution":{"observed_at":"2026-08-06T23:12:18.851748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T23:12:18.857973Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.857973Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:aa1d122b94afa2a33f326f00812f1b679bfad05829b63dcc90e697a67dc552f7","observation_id":"bba064c8-de37-4c7e-84c8-f3930b16b45b","resolution":{"observed_at":"2026-08-06T23:12:18.857973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16737","last_updated":"2024-10-07T19:37:10Z","snapshot_observed_at":"2026-08-05T14:38:11.927737Z","submitted_at":"2024-08-29T17:32:35Z","title":"Smaller, Weaker, Yet Better: Training LLM Reasoners via Compute-Optimal Sampling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16737","snapshot_observed_at":"2026-08-06T23:12:18.863690Z","title":"Smaller, weaker, yet better: Training llm reasoners via compute-optimal sampling.arXiv preprint arXiv:2408.16737, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.863690Z"},"links":{"cited_paper":"/paper/2408.16737","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:24dd61f593700c0842dcc08162dd1cca9828b1d3012f4c46a2ac65e07f8878ba","observation_id":"7043876b-332c-475d-a4fb-22d500c877cd","resolution":{"observed_at":"2026-08-06T23:12:18.863690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16822","last_updated":"2024-06-17T07:07:30Z","snapshot_observed_at":"2026-07-06T16:53:51.485946Z","submitted_at":"2023-11-28T14:36:43Z","title":"Large Language Models Suffer From Their Own Output: An Analysis of the Self-Consuming Training Loop","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16822","snapshot_observed_at":"2026-08-06T23:12:18.868972Z","title":"Large language models suffer from their own output: An analysis of the self-consuming training loop.arXiv preprint arXiv:2311.16822, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.868972Z"},"links":{"cited_paper":"/paper/2311.16822","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:555c53af2eeba7bdbc52bdd09844dd3092b114ceb930b9af61976f089573b640","observation_id":"6492b30d-3ec5-4f39-a21b-099f9cb35650","resolution":{"observed_at":"2026-08-06T23:12:18.868972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.02549","last_updated":"2020-02-19T22:44:37Z","snapshot_observed_at":"2026-08-04T12:55:07.027032Z","submitted_at":"2018-11-06T18:44:11Z","title":"Language GANs Falling Short","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.02549","snapshot_observed_at":"2026-08-06T23:12:18.875688Z","title":"Language gans falling short.arXiv preprint arXiv:1811.02549, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.875688Z"},"links":{"cited_paper":"/paper/1811.02549","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:a8aa21d2c37bd765df5b467aee97a47d0c02f134a07671eaaef5bbac691fe2ff","observation_id":"b6c58840-c707-4615-bd4a-26565c4b61e0","resolution":{"observed_at":"2026-08-06T23:12:18.875688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-07-06T19:36:32.581033Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-06T23:12:18.881689Z","title":"On the diversity of synthetic data and its impact on training large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.881689Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:10c875e97f92d2bbb78398de224ea2aa22ac2112815287080924194edbf9cbad","observation_id":"89491718-442f-463f-aaa7-146c097564c0","resolution":{"observed_at":"2026-08-06T23:12:18.881689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12397","last_updated":"2024-06-18T08:38:59Z","snapshot_observed_at":"2026-08-04T02:35:22.924349Z","submitted_at":"2024-06-18T08:38:59Z","title":"Unveiling the Flaws: Exploring Imperfections in Synthetic Data and Mitigation Strategies for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12397","snapshot_observed_at":"2026-08-06T23:12:18.888836Z","title":"Unveiling the flaws: Exploring imperfections in synthetic data and mitigation strategies for large language models.arXiv preprint arXiv:2406.12397, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.888836Z"},"links":{"cited_paper":"/paper/2406.12397","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:bb3009d7692ca3868545e1530d408b6f3db2bd4ddadfc6e74a34d50e86f2ef97","observation_id":"5567f7ba-0961-48e8-9080-1a02a7cf09ed","resolution":{"observed_at":"2026-08-06T23:12:18.888836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13007","last_updated":"2023-03-20T11:39:47Z","snapshot_observed_at":"2026-07-06T14:55:41.638936Z","submitted_at":"2023-02-25T06:58:16Z","title":"AugGPT: Leveraging ChatGPT for Text Data Augmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13007","snapshot_observed_at":"2026-08-06T23:12:18.893945Z","title":"Auggpt: Leveraging chatgpt for text data augmentation.arXiv preprint arXiv:2302.13007, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.893945Z"},"links":{"cited_paper":"/paper/2302.13007","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:1beb3ebd37b1d7f82a6f9171182b2ad40c090c854c575589f69aa0363392050e","observation_id":"505260d3-412a-48a7-a24d-6128c7fccdf9","resolution":{"observed_at":"2026-08-06T23:12:18.893945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:19.781706Z","title":"Universality of the π2/6 pathway in avoiding model collapse, 2024","venue":null,"work_id":"26a6950f-083e-4179-a6a9-0450c5d8cc5b","year":2024},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.899052Z"},"links":{"citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:cba46021730f272079bd5545e822482c42e08b3f34897c9b0b6fc9945d39aee2","observation_id":"0df68e44-eaa5-4ce3-a3f6-002123cd2fe3","resolution":{"observed_at":"2026-08-06T23:12:19.787288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10450","last_updated":"2023-06-14T16:11:50Z","snapshot_observed_at":"2026-07-06T14:33:03.656499Z","submitted_at":"2022-12-20T17:28:41Z","title":"Is GPT-3 a Good Data Annotator?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10450","snapshot_observed_at":"2026-08-06T23:12:18.904149Z","title":"Is gpt-3 a good data annotator?arXiv preprint arXiv:2212.10450, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.904149Z"},"links":{"cited_paper":"/paper/2212.10450","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:14572c2fef32b4781268f814f8d750ee254100fc0b510ed1035833e0be163cd5","observation_id":"42019cdb-260c-4c0f-a28c-833ec6c747c1","resolution":{"observed_at":"2026-08-06T23:12:18.904149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:19.762942Z","title":"Data augmentation using llms: Data perspectives, learning paradigms and challenges","venue":null,"work_id":"4addfe94-22df-4325-b7b7-ee55ebfc79b8","year":2024},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.909378Z"},"links":{"citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:8d72f4cfc70f7d74a9d145fd17fa238a11c855c2bebc715211871f621ee7d50d","observation_id":"8c071fe3-c614-4553-ba3d-e2f9dc40d8b9","resolution":{"observed_at":"2026-08-06T23:12:19.769259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07712","last_updated":"2024-04-30T18:03:13Z","snapshot_observed_at":"2026-07-06T17:28:56.092370Z","submitted_at":"2024-02-12T15:26:01Z","title":"Model Collapse Demystified: The Case of Regression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07712","snapshot_observed_at":"2026-08-06T23:12:18.914754Z","title":"Model collapse demystified: The case of regression.arXiv preprint arXiv:2402.07712, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.914754Z"},"links":{"cited_paper":"/paper/2402.07712","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:1765d5d92f0216b6719635a54ca8928438a544c7787f605e24a72e1d726e8cb6","observation_id":"e53f2ab7-2b3f-4ea7-98ae-47bb7a5f405d","resolution":{"observed_at":"2026-08-06T23:12:18.914754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04840","last_updated":"2024-10-08T16:14:43Z","snapshot_observed_at":"2026-07-06T19:28:52.383175Z","submitted_at":"2024-10-07T08:54:23Z","title":"Strong Model Collapse","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04840","snapshot_observed_at":"2026-08-06T23:12:18.920822Z","title":"Strong model collapse","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.920822Z"},"links":{"cited_paper":"/paper/2410.04840","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:8f2368c8c48be4502c216bfc6298a01a8253c8b41e385233a2b372b616a6ec0c","observation_id":"5bcb2006-a0a3-4586-9a10-828463c2288e","resolution":{"observed_at":"2026-08-06T23:12:18.920822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07043","last_updated":"2024-05-31T12:27:52Z","snapshot_observed_at":"2026-07-06T17:28:27.220300Z","submitted_at":"2024-02-10T21:06:34Z","title":"A Tale of Tails: Model Collapse as a Change of Scaling Laws","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07043","snapshot_observed_at":"2026-08-06T23:12:18.925506Z","title":"A tale of tails: Model collapse as a change of scaling laws.arXiv preprint arXiv:2402.07043, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.925506Z"},"links":{"cited_paper":"/paper/2402.07043","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:a42c4338212b81dfb15c98e3eef62703eda3051aa1c17663ddfa469bd53a0992","observation_id":"fd1d13bd-5531-4d84-ac15-50c6891f3cbe","resolution":{"observed_at":"2026-08-06T23:12:18.925506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T23:12:18.930500Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.930500Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:8126004e81c2fde4fc7354e702b3584d99c938ebfd122eba32c416bfef1e6c72","observation_id":"c0e572d1-5b86-4daa-95cb-0c81f392a9c2","resolution":{"observed_at":"2026-08-06T23:12:18.930500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07515","last_updated":"2024-10-25T03:38:41Z","snapshot_observed_at":"2026-07-06T18:29:04.294349Z","submitted_at":"2024-06-11T17:46:16Z","title":"Beyond Model Collapse: Scaling Up with Synthesized Data Requires Verification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07515","snapshot_observed_at":"2026-08-06T23:12:18.934682Z","title":"Beyond model collapse: Scaling up with syn-thesized data requires verification.arXiv preprint arXiv:2406.07515, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.934682Z"},"links":{"cited_paper":"/paper/2406.07515","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:da2b9497930c67ed22492f280e380c720555d7ecb390497bf45c5a3e0568f274","observation_id":"4a98b15e-7d2e-4c28-b846-013385ff65ff","resolution":{"observed_at":"2026-08-06T23:12:18.934682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01413","last_updated":"2024-04-29T23:13:42Z","snapshot_observed_at":"2026-07-06T17:54:11.726535Z","submitted_at":"2024-04-01T18:31:24Z","title":"Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01413","snapshot_observed_at":"2026-08-06T23:12:18.939264Z","title":"Is model collapse inevitable? breaking the curse of recursion by accumulating real and synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.939264Z"},"links":{"cited_paper":"/paper/2404.01413","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:c6e3f982e1099899b704c381dbfdf22d2a74da2e166663d40fc324ee0355919b","observation_id":"a81f5911-b703-410c-8c4a-ea02c64c4425","resolution":{"observed_at":"2026-08-06T23:12:18.939264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:18.943859Z","title":"Chatgpt outperforms crowd workers for text-annotation tasks.Proceedings of the National Academy of Sciences, 120(30):e2305016120, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.943859Z"},"links":{"citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:b5d5229e03fd94c4d8b252c41ca22e21a52f0c2b138992d03d7ff6e50096c2d7","observation_id":"1991e3be-c794-4a86-925d-05e592661c07","resolution":{"observed_at":"2026-08-06T23:12:18.943859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09807","last_updated":"2024-04-16T15:57:11Z","snapshot_observed_at":"2026-08-06T05:19:26.896278Z","submitted_at":"2023-11-16T11:31:50Z","title":"The Curious Decline of Linguistic Diversity: Training Language Models on Synthetic Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09807","snapshot_observed_at":"2026-08-06T23:12:18.948737Z","title":"The curious decline of lin- guistic diversity: Training language models on synthetic text.arXiv preprint arXiv:2311.09807, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.948737Z"},"links":{"cited_paper":"/paper/2311.09807","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:c0553bbebdb0f927ec17712f880c7c7207e4c3d36948f4dc9533fb4a01ad6910","observation_id":"d43b8f4d-bb3b-462c-8989-9ac16ce16723","resolution":{"observed_at":"2026-08-06T23:12:18.948737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17876","last_updated":"2024-08-08T06:32:00Z","snapshot_observed_at":"2026-08-03T20:39:10.958165Z","submitted_at":"2023-10-27T03:32:17Z","title":"TarGEN: Targeted Data Generation with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17876","snapshot_observed_at":"2026-08-06T23:12:18.953175Z","title":"Targen: Targeted data genera- tion with large language models.arXiv preprint arXiv:2310.17876, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.953175Z"},"links":{"cited_paper":"/paper/2310.17876","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:aaa7e26ee1016790d37662e8e285bdba95693dc726f8b0487d488dca7fb55ee5","observation_id":"e7322882-a784-449e-93f6-5e77106b91ab","resolution":{"observed_at":"2026-08-06T23:12:18.953175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16713","last_updated":"2025-03-17T21:14:46Z","snapshot_observed_at":"2026-08-07T11:24:11.399872Z","submitted_at":"2024-10-22T05:49:24Z","title":"Collapse or Thrive? Perils and Promises of Synthetic Data in a Self-Generating World","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16713","snapshot_observed_at":"2026-08-06T23:12:18.957552Z","title":"Collapse or thrive? perils and promises of synthetic data in a self-generating world.arXiv preprint arXiv:2410.16713, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.957552Z"},"links":{"cited_paper":"/paper/2410.16713","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:23d81ff19c345e90b37d56ac6992955bd1bbfa50d97f9af59cda6f8f00ff816a","observation_id":"7de1fa9a-a33c-4f24-8c98-16f7edaedbb3","resolution":{"observed_at":"2026-08-06T23:12:18.957552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:18.962396Z","title":"The narrativeqa reading comprehension challenge, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.962396Z"},"links":{"citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:71249e37b084235261da7ba5dcfa691fef4b43857e482e749fc51cce3ba9b19d","observation_id":"551809de-a8ab-45bf-a7ed-46802623ffbc","resolution":{"observed_at":"2026-08-06T23:12:18.962396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21526","last_updated":"2025-03-22T17:19:57Z","snapshot_observed_at":"2026-07-06T19:41:10.332290Z","submitted_at":"2024-10-28T20:53:49Z","title":"Not All LLM-Generated Data Are Equal: Rethinking Data Weighting in Text Classification","version":2},"cited_work":{"arxiv_id":"2410.21526","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.21526","snapshot_observed_at":"2026-08-06T23:12:19.330021Z","title":"Not All LLM-Generated Data Are Equal: Rethinking Data Weighting in Text Classification","venue":"cs.LG","work_id":"0b785f05-49ad-4f52-87d6-33fca10eb179","year":2024},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.967285Z"},"links":{"cited_paper":"/paper/2410.21526","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:0badd94b55476e1bf92f79a5e31b4c4b8da430dad45b217198d7e5cc4489e8c4","observation_id":"00dbaa3d-0fe8-48ec-ad14-e4843330d71f","resolution":{"observed_at":"2026-08-06T23:12:19.334959Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:19.726697Z","title":"A diversity- promoting objective function for neural conversation models","venue":null,"work_id":"39018b09-1275-47cb-bbfa-1c5c45533e06","year":2016},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.972529Z"},"links":{"citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:183084ef2ad5bb2a9a0b7f913f5025a33846b22881239108b410454de5c81432","observation_id":"7c60ce21-922e-463b-afa8-1cbbd6de9982","resolution":{"observed_at":"2026-08-06T23:12:19.732046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07849","last_updated":"2023-10-13T01:31:59Z","snapshot_observed_at":"2026-07-06T16:31:29.379540Z","submitted_at":"2023-10-11T19:51:13Z","title":"Synthetic Data Generation with Large Language Models for Text Classification: Potential and Limitations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07849","snapshot_observed_at":"2026-08-06T23:12:18.977169Z","title":"Synthetic data generation with large lan- guage models for text classification: Potential and limitations.arXiv preprint arXiv:2310.07849, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.977169Z"},"links":{"cited_paper":"/paper/2310.07849","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:0c2d6c07a9e5fc3a946c888cc54ee088ecf8474ca754227499fc69e4cf6ba0e8","observation_id":"5c87fad9-1675-4c54-a5c8-50224cb584aa","resolution":{"observed_at":"2026-08-06T23:12:18.977169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08343","last_updated":"2024-08-22T11:29:51Z","snapshot_observed_at":"2026-07-06T19:01:15.196625Z","submitted_at":"2024-08-15T14:48:42Z","title":"API-guided Dataset Synthesis to Finetune Large Code Models","version":2},"cited_work":{"arxiv_id":"2408.08343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08343","snapshot_observed_at":"2026-08-06T23:12:19.287279Z","title":"API-guided Dataset Synthesis to Finetune Large Code Models","venue":"cs.SE","work_id":"ff55d4f3-6b42-4c3e-915c-2a1e8ac8e37a","year":2024},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.981774Z"},"links":{"cited_paper":"/paper/2408.08343","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:340e463a012235a2fccfcd6d92b4dd5c08ab416b1ae77ce34e18cd3952a70bc2","observation_id":"a74c14c8-a7b2-4817-a577-3595866ff611","resolution":{"observed_at":"2026-08-06T23:12:19.293347Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:19.710461Z","title":"Generating training data with language models: Towards zero-shot language understanding.Advances in Neural Information Processing Systems, 35:462–477, 2022","venue":null,"work_id":"f3a076de-6e79-4173-83ba-199163954d2f","year":2022},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.986716Z"},"links":{"citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:2126760f3ffb1823f18ac7a7ff9095cf15756785fb7105940fd6c71e07114a16","observation_id":"ec65d921-5081-405f-910d-cd222a216ae7","resolution":{"observed_at":"2026-08-06T23:12:19.716531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:18.990942Z","title":"A corpus and cloze evaluation for deeper understanding of commonsense stories","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.990942Z"},"links":{"citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:e8ba1435ed786869f768dbdfffdf9f0e1a311818e9839759b44cc785ce23e367","observation_id":"04faf82d-35c8-4fb2-95f5-f385cf7333e1","resolution":{"observed_at":"2026-08-06T23:12:18.990942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:19.679718Z","title":"I learn better if you speak my language: Understanding the superior performance of fine-tuning large language models with llm-generated responses","venue":null,"work_id":"622a0a1b-a6e5-4f9a-a8b7-5b4ca4c3f1ef","year":2024},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.995370Z"},"links":{"citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:01e3c6c2d456212288ae3dd88ca24e9d4153b2f9202449fd9fb60291f906a3fa","observation_id":"e8b62230-41bd-4f64-ad14-816ffc6addee","resolution":{"observed_at":"2026-08-06T23:12:19.685719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05090","last_updated":"2024-04-07T22:15:13Z","snapshot_observed_at":"2026-08-07T21:01:04.875067Z","submitted_at":"2024-04-07T22:15:13Z","title":"How Bad is Training on Synthetic Data? A Statistical Analysis of Language Model Collapse","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05090","snapshot_observed_at":"2026-08-06T23:12:18.999831Z","title":"How bad is training on synthetic data? a statistical analysis of language model collapse","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.999831Z"},"links":{"cited_paper":"/paper/2404.05090","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:bbaf8a110296ac1ae389e768c428a6f23b0d95f7bab51d4a3c277a49f9a45c83","observation_id":"9e77a416-a27a-4afa-88bf-749bc2797c13","resolution":{"observed_at":"2026-08-06T23:12:18.999831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17493","last_updated":"2024-04-14T05:20:10Z","snapshot_observed_at":"2026-08-05T16:03:40.517679Z","submitted_at":"2023-05-27T15:10:41Z","title":"The Curse of Recursion: Training on Generated Data Makes Models Forget","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17493","snapshot_observed_at":"2026-08-06T23:12:19.004646Z","title":"The curse of recursion: Training on generated data makes models forget.arXiv preprint arXiv:2305.17493, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:19.004646Z"},"links":{"cited_paper":"/paper/2305.17493","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:d095bb94aa0e42289f2e797cf4d95c1d03e3e401943dff074b3e514b10ea2b14","observation_id":"7562b1ae-da84-49a0-98c6-5009f362cd28","resolution":{"observed_at":"2026-08-06T23:12:19.004646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:19.009713Z","title":"Ai models collapse when trained on recursively generated data.Nature, 631(8022):755– 759, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:19.009713Z"},"links":{"citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:a3c226b85bdfe7aa6d62e1d1c32822c5b32a5810a2052db4b0de99ea19b54075","observation_id":"b8ed6bdd-5545-402b-8ab4-7adc93da7581","resolution":{"observed_at":"2026-08-06T23:12:19.009713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13446","last_updated":"2024-12-02T20:55:15Z","snapshot_observed_at":"2026-07-06T17:33:08.817655Z","submitted_at":"2024-02-21T00:44:04Z","title":"Large Language Models for Data Annotation and Synthesis: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13446","snapshot_observed_at":"2026-08-06T23:12:19.014617Z","title":"Large language models for data annotation: A survey.arXiv preprint arXiv:2402.13446, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:19.014617Z"},"links":{"cited_paper":"/paper/2402.13446","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:20ef11a978347c37aba08e424f43740162977829f997d1ed121bbf771a6c68c7","observation_id":"9b67ba55-54a6-4052-b681-92f2c2ea78dd","resolution":{"observed_at":"2026-08-06T23:12:19.014617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.02990","last_updated":"2021-01-24T09:49:19Z","snapshot_observed_at":"2026-08-05T20:29:03.208508Z","submitted_at":"2020-04-06T20:44:10Z","title":"Evaluating the Evaluation of Diversity in Natural Language Generation","version":3},"cited_work":{"arxiv_id":"2004.02990","doi":null,"metadata_source":"pith","pith_arxiv_id":"2004.02990","snapshot_observed_at":"2026-08-06T23:12:19.203323Z","title":"Evaluating the Evaluation of Diversity in Natural Language Generation","venue":"cs.CL","work_id":"f9e4dde8-3857-4414-90c4-1a57f3211519","year":2020},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:19.020253Z"},"links":{"cited_paper":"/paper/2004.02990","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:9c15cc81c3163434ab8f3af2dfed659ee324203967504222674e628327570a31","observation_id":"ecf7367b-4479-42d4-a809-59f21da280f5","resolution":{"observed_at":"2026-08-06T23:12:19.211776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10560","last_updated":"2023-05-25T23:50:07Z","snapshot_observed_at":"2026-07-06T14:33:11.945106Z","submitted_at":"2022-12-20T18:59:19Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10560","snapshot_observed_at":"2026-08-06T23:12:19.026402Z","title":"Self-instruct: Aligning language models with self-generated instruc- tions.arXiv preprint arXiv:2212.10560, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:19.026402Z"},"links":{"cited_paper":"/paper/2212.10560","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:93bac5d2027067fc384f7e701d927f8cccc3b7da210421afe0009d5f6f9c5e86","observation_id":"1b8f8fe9-b838-442d-9eca-3a0233a5f284","resolution":{"observed_at":"2026-08-06T23:12:19.026402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05875","last_updated":"2024-04-08T21:15:36Z","snapshot_observed_at":"2026-08-07T12:08:06.802905Z","submitted_at":"2024-04-08T21:15:36Z","title":"CodecLM: Aligning Language Models with Tailored Synthetic Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05875","snapshot_observed_at":"2026-08-06T23:12:19.031822Z","title":"Codeclm: Aligning language models with tailored synthetic data.arXiv preprint arXiv:2404.05875, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:19.031822Z"},"links":{"cited_paper":"/paper/2404.05875","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:7fe20c09ae2fcd798462843dfa5abdb261788daa07d1bb6164bba6bc0e2f8553","observation_id":"e757d0cb-d62c-4142-8bc9-97b74cad6e9e","resolution":{"observed_at":"2026-08-06T23:12:19.031822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.12329","last_updated":"2022-10-22T02:07:10Z","snapshot_observed_at":"2026-08-05T12:22:29.405210Z","submitted_at":"2022-10-22T02:07:10Z","title":"ProGen: Progressive Zero-shot Dataset Generation via In-context Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.12329","snapshot_observed_at":"2026-08-06T23:12:19.036726Z","title":"Progen: Pro- gressive zero-shot dataset generation via in-context feedback.arXiv preprint arXiv:2210.12329, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:19.036726Z"},"links":{"cited_paper":"/paper/2210.12329","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:85092ac61bcc884d0d58953c207635186963626b5c27c6170028dcbee65043d6","observation_id":"67fb0533-6b1d-479a-83cd-02341d3088a7","resolution":{"observed_at":"2026-08-06T23:12:19.036726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07922","last_updated":"2022-10-22T01:32:03Z","snapshot_observed_at":"2026-08-07T11:18:43.093334Z","submitted_at":"2022-02-16T08:18:02Z","title":"ZeroGen: Efficient Zero-shot Learning via Dataset Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07922","snapshot_observed_at":"2026-08-06T23:12:19.041283Z","title":"Zerogen: Efficient zero-shot learning via dataset generation.arXiv preprint arXiv:2202.07922, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:19.041283Z"},"links":{"cited_paper":"/paper/2202.07922","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:f957b5d9905330dc5b34c2e2a2af2c8969b3f961f6133b9c12bb11ea8c388943","observation_id":"7d3c46d2-027f-47ac-8757-7cd61c6761b9","resolution":{"observed_at":"2026-08-06T23:12:19.041283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08826","last_updated":"2021-11-18T07:56:58Z","snapshot_observed_at":"2026-07-06T11:01:05.577957Z","submitted_at":"2021-04-18T11:39:33Z","title":"GPT3Mix: Leveraging Large-scale Language Models for Text Augmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08826","snapshot_observed_at":"2026-08-06T23:12:19.045722Z","title":"Gpt3mix: Leveraging large-scale language models for text augmentation.arXiv preprint arXiv:2104.08826, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:19.045722Z"},"links":{"cited_paper":"/paper/2104.08826","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:b18128ad2f15fb4b06adb22e11c8caac21cbc7c5c41d46a95de7ff65d8bf4b64","observation_id":"19c461a0-09a6-4266-98e1-70345fc5d622","resolution":{"observed_at":"2026-08-06T23:12:19.045722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:19.648482Z","title":"Large language model as attributed training data generator: A tale of diversity and bias.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"c37bdd80-cc3d-4f29-b438-76c0b78a7199","year":2024},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:19.050725Z"},"links":{"citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:10c61712d446d8eecd9c867c31d859eeb55387b8c59a165866a71e25df9b19d4","observation_id":"8804a4a2-3eb3-4378-9620-e07eea7c5218","resolution":{"observed_at":"2026-08-06T23:12:19.654995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14689","last_updated":"2025-05-28T05:22:58Z","snapshot_observed_at":"2026-08-04T04:46:32.909222Z","submitted_at":"2024-12-19T09:43:39Z","title":"How to Synthesize Text Data without Model Collapse?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14689","snapshot_observed_at":"2026-08-06T23:12:19.055117Z","title":"question","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:19.055117Z"},"links":{"cited_paper":"/paper/2412.14689","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:45b02e285801d630491333a99c98808df4393dd4413ceb945c715d1c6fcba722","observation_id":"82b574e1-7c95-4cdf-9616-d733186d0f80","resolution":{"observed_at":"2026-08-06T23:12:19.055117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":3,"verified_fuzzy":6},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 3 inbound Pith citation observations for arXiv:2506.19262."}