{"as_of":"2026-08-09T00:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ec88572c962847bc1dcb4403ddd7cf23df7ce5d5a1c138ae6580b1982740b26f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:36:27.187131Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-23T01:05:16.441022Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-07-06T19:36:32.581033Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.15226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the diversity of synthetic data and its impact on training large language models","venue":null,"work_id":"ddea9b76-0744-46d6-b090-e64b0a9f32d6","year":2024},"citing_paper":{"arxiv_id":"2503.08223","last_updated":"2026-04-09T15:28:27Z","snapshot_observed_at":"2026-07-06T20:50:33.513259Z","submitted_at":"2025-03-11T09:41:29Z","title":"Will LLMs Scaling Hit the Wall? Breaking Barriers via Distributed Resources on Massive Edge Devices","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-23T01:03:26.037233Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2503.08223"},"observation_digest":"sha256:2b6410521724de6c5338973483959e46979848aa7b3f603de922af3d22a056dc","observation_id":"de6d5b97-cada-44eb-b0e1-02327be1b867","resolution":{"observed_at":"2026-05-23T01:05:16.443483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-07-06T19:36:32.581033Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.15226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the diversity of synthetic data and its impact on training large language models","venue":null,"work_id":"ddea9b76-0744-46d6-b090-e64b0a9f32d6","year":2024},"citing_paper":{"arxiv_id":"2504.01919","last_updated":"2026-01-12T12:46:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-02T17:26:40Z","title":"Bridging the Linguistic Divide: A Survey on Leveraging Large Language Models for Machine Translation","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-22T21:38:29.497183Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2504.01919"},"observation_digest":"sha256:befa7aa5c8629d5b72142f6a211579ef0963fc31466aa90c14bee0aff37c3e1c","observation_id":"19a490b8-8506-42a9-acf6-c02471a8b6ee","resolution":{"observed_at":"2026-05-22T21:42:11.341426Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-07-06T19:36:32.581033Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-07T14:33:12.926530Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18458","last_updated":"2025-06-01T16:00:34Z","snapshot_observed_at":"2026-08-07T20:59:19.597449Z","submitted_at":"2025-05-24T01:57:12Z","title":"A Survey of LLM $\\times$ DATA","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:12.926530Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2505.18458"},"observation_digest":"sha256:907852ec1fb065a43bacdf12bbecd803eefea4f54100f6dc1ecc545849a12334","observation_id":"e1b02181-3a81-4300-a01c-574aa08769c7","resolution":{"observed_at":"2026-08-07T14:33:12.926530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-07-06T19:36:32.581033Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-07T14:36:27.187131Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18523","last_updated":"2025-05-24T05:40:23Z","snapshot_observed_at":"2026-08-07T14:27:54.077723Z","submitted_at":"2025-05-24T05:40:23Z","title":"Diversity and Inclusion in AI: Insights from a Survey of AI/ML Practitioners","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:36:27.187131Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2505.18523"},"observation_digest":"sha256:ca6e99c9618f390c01ead764633977d7228768e2836c0ce2902b91c3d90b68dd","observation_id":"a7769956-febd-4cb5-9cfd-3a11cdce4331","resolution":{"observed_at":"2026-08-07T14:36:27.187131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-07-06T19:36:32.581033Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-07T14:10:22.223731Z","title":"Irina I Chironova","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.19848","last_updated":"2025-05-26T11:35:01Z","snapshot_observed_at":"2026-08-08T15:36:25.891635Z","submitted_at":"2025-05-26T11:35:01Z","title":"Improving Multilingual Math Reasoning for African Languages","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:10:22.223731Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2505.19848"},"observation_digest":"sha256:111b25004402c8c562e6397745bbc3e7de230841adbd3b3db0912a3b5da4e4a0","observation_id":"e6b33bc2-bc30-45a3-9220-ff8d696581bb","resolution":{"observed_at":"2026-08-07T14:10:22.223731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-07-06T19:36:32.581033Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-07T12:18:34.656149Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:34.656149Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:25725cfb3e553901aa9357132418d8989966f5283651d5ae864d667be551ac2b","observation_id":"554c546f-1901-4c8e-a9e3-7f8222d36398","resolution":{"observed_at":"2026-08-07T12:18:34.656149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-07-06T19:36:32.581033Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-07T11:13:38.936758Z","title":"On the diversity of synthetic data and its impact on training large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03051","last_updated":"2025-06-03T16:31:52Z","snapshot_observed_at":"2026-08-07T11:07:16.634534Z","submitted_at":"2025-06-03T16:31:52Z","title":"Facts Do Care About Your Language: Assessing Answer Quality of Multilingual LLMs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:13:38.936758Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2506.03051"},"observation_digest":"sha256:86a70da74e2d512593062f442ba89ef04f4da8ed50a161fb236236e56a0c2c26","observation_id":"5165d9af-17c1-4889-9451-44f121e702a9","resolution":{"observed_at":"2026-08-07T11:13:38.936758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-07-06T19:36:32.581033Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-06T23:12:18.881689Z","title":"On the diversity of synthetic data and its impact on training large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19262","last_updated":"2025-06-25T03:25:04Z","snapshot_observed_at":"2026-08-08T05:27:16.733839Z","submitted_at":"2025-06-24T02:44:58Z","title":"What Matters in LLM-generated Data: Diversity and Its Effect on Model Fine-Tuning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:18.881689Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2506.19262"},"observation_digest":"sha256:10c875e97f92d2bbb78398de224ea2aa22ac2112815287080924194edbf9cbad","observation_id":"89491718-442f-463f-aaa7-146c097564c0","resolution":{"observed_at":"2026-08-06T23:12:18.881689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-07-06T19:36:32.581033Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-06T22:18:43.992346Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22050","last_updated":"2025-06-27T09:45:37Z","snapshot_observed_at":"2026-08-06T22:10:25.019009Z","submitted_at":"2025-06-27T09:45:37Z","title":"Decoding Machine Translationese in English-Chinese News: LLMs vs. NMTs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T22:18:43.992346Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2506.22050"},"observation_digest":"sha256:4cf6e3a846526a672857caa8ca24398c2f0091e084751b647912f0475c89d5c8","observation_id":"1252be6c-09c8-4d9d-a801-dbb63384c66b","resolution":{"observed_at":"2026-08-06T22:18:43.992346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-07-06T19:36:32.581033Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-05T22:56:28.179383Z","title":"Yuri Chervonyi, Trieu H Trinh, Miroslav Olˇs´ak, Xiaomeng Yang, Hoang Nguyen, Marcelo Menegali, Junehyuk Jung, Vikas Verma, Quoc V Le, and Thang Luong","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06592","last_updated":"2025-08-08T11:16:56Z","snapshot_observed_at":"2026-08-06T11:19:20.440634Z","submitted_at":"2025-08-08T11:16:56Z","title":"Towards Integrated Alignment","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T22:56:28.179383Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2508.06592"},"observation_digest":"sha256:441f57a42211045c9fd521969abdce5d883d0f52a7545fb15b06f5445e3450fd","observation_id":"607080ba-3337-4ebf-9fee-1b5d0d7c9046","resolution":{"observed_at":"2026-08-05T22:56:28.179383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-07-06T19:36:32.581033Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-05T15:53:34.195737Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19402","last_updated":"2025-08-26T19:55:40Z","snapshot_observed_at":"2026-08-08T16:12:29.944218Z","submitted_at":"2025-08-26T19:55:40Z","title":"One Joke to Rule them All? On the (Im)possibility of Generalizing Humor","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T15:53:34.195737Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2508.19402"},"observation_digest":"sha256:5a4d021f795d4fe61ad0cede73b684bf8a1172899a44918fce0792e237835b10","observation_id":"940f0155-255a-47b8-b72c-44ddd6090555","resolution":{"observed_at":"2026-08-05T15:53:34.195737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-07-06T19:36:32.581033Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-04T09:18:33.177856Z","title":"On the diversity of synthetic data and its impact on training large language models.arXiv preprint arXiv:2410.15226,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.16657","last_updated":"2026-07-16T03:25:47Z","snapshot_observed_at":"2026-08-08T15:16:56.011041Z","submitted_at":"2025-10-18T22:39:39Z","title":"Escaping Model Collapse via Synthetic Data Verification: Near-term Improvements and Long-term Convergence","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T09:18:33.177856Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2510.16657"},"observation_digest":"sha256:4da030680c43ea5db81296a0002346441f20f19cfb749f0e066bb3c92e4526b0","observation_id":"cfabcb30-0aa8-474e-9008-071f03e6a5d1","resolution":{"observed_at":"2026-08-04T09:18:33.177856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-07-06T19:36:32.581033Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.15226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the diversity of synthetic data and its impact on training large language models","venue":null,"work_id":"ddea9b76-0744-46d6-b090-e64b0a9f32d6","year":2024},"citing_paper":{"arxiv_id":"2511.01490","last_updated":"2026-04-28T14:06:15Z","snapshot_observed_at":"2026-08-08T15:54:39.103342Z","submitted_at":"2025-11-03T11:57:11Z","title":"Synthetic Eggs in Many Baskets: The Impact of Synthetic Data Diversity on LLM Fine-Tuning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T01:17:12.349379Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2511.01490"},"observation_digest":"sha256:b93f7f8f3796f231710e8ad505be4eed03cbcfe30af11c00fc1408216aba8e5c","observation_id":"bd88e7af-3de9-47bd-a9b4-7d91d00be7a0","resolution":{"observed_at":"2026-05-18T01:20:34.760847Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-07-06T19:36:32.581033Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.15226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the diversity of synthetic data and its impact on training large language models","venue":null,"work_id":"ddea9b76-0744-46d6-b090-e64b0a9f32d6","year":2024},"citing_paper":{"arxiv_id":"2512.05929","last_updated":"2026-06-29T18:18:24Z","snapshot_observed_at":"2026-08-03T18:19:06.255338Z","submitted_at":"2025-12-05T18:12:21Z","title":"LLM Harms: A Taxonomy and Discussion","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-17T00:29:07.951709Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2512.05929"},"observation_digest":"sha256:360a03b413677c4cb58dc540314ba17d3b59954a53319e393c5b811af8011ee3","observation_id":"d7b76357-7cb1-45c1-a438-10c4e08f1b75","resolution":{"observed_at":"2026-05-17T00:31:24.718186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-07-06T19:36:32.581033Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-03T18:19:14.106904Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05929","last_updated":"2026-06-29T18:18:24Z","snapshot_observed_at":"2026-08-03T18:19:06.255338Z","submitted_at":"2025-12-05T18:12:21Z","title":"LLM Harms: A Taxonomy and Discussion","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T18:19:14.106904Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2512.05929"},"observation_digest":"sha256:36d84cfb6f00d61ec41f66197481ec01447826556bdbe7688ff69be5617ef0f4","observation_id":"41d6d484-1029-41bd-b685-8a92f3c91341","resolution":{"observed_at":"2026-08-03T18:19:14.106904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-07-06T19:36:32.581033Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-03T01:17:11.720224Z","title":"On the diversity of synthetic data and its impact on training large language models.arXiv preprint arXiv:2410.15226, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.10388","last_updated":"2026-05-29T05:05:29Z","snapshot_observed_at":"2026-08-07T17:40:15.715656Z","submitted_at":"2026-02-11T00:23:13Z","title":"Less is Enough: Synthesizing Diverse Data in LLM Feature Space with Sparse Autoencoders","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T01:17:11.720224Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2602.10388"},"observation_digest":"sha256:2a09b0cd31a7fee29b1a165743157eec59f1f7207c2e5c54a3eeb852b0d8ab40","observation_id":"5c7b28c0-ef08-497d-96f3-d7f216c7bd3f","resolution":{"observed_at":"2026-08-03T01:17:11.720224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-07-06T19:36:32.581033Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.15226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the diversity of synthetic data and its impact on training large language models","venue":null,"work_id":"ddea9b76-0744-46d6-b090-e64b0a9f32d6","year":2024},"citing_paper":{"arxiv_id":"2604.11290","last_updated":"2026-07-07T09:01:05Z","snapshot_observed_at":"2026-08-07T13:41:15.137494Z","submitted_at":"2026-04-13T10:53:51Z","title":"Polyglot Teachers: Evaluating Language Models for Multilingual Synthetic Data Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T15:31:54.897698Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2604.11290"},"observation_digest":"sha256:5127b42143e2399a50aa70ce0193d5f9a8e952c805d05abe2a2d409b9b7e923e","observation_id":"630e7589-959c-4a62-b376-41c94716e8c5","resolution":{"observed_at":"2026-05-11T10:21:03.324208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-07-06T19:36:32.581033Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-07-12T22:04:56.445021Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.11290","last_updated":"2026-07-07T09:01:05Z","snapshot_observed_at":"2026-08-07T13:41:15.137494Z","submitted_at":"2026-04-13T10:53:51Z","title":"Polyglot Teachers: Evaluating Language Models for Multilingual Synthetic Data Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:56.445021Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2604.11290"},"observation_digest":"sha256:12abc6822ad1259b27cbe22cb12098c589b486f8980a455d82e7e5abbd73cf93","observation_id":"b41115f6-2f7f-419d-8633-a73a02c5371a","resolution":{"observed_at":"2026-07-12T22:04:56.445021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-07-06T19:36:32.581033Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.15226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the diversity of synthetic data and its impact on training large language models","venue":null,"work_id":"ddea9b76-0744-46d6-b090-e64b0a9f32d6","year":2024},"citing_paper":{"arxiv_id":"2605.11922","last_updated":"2026-05-12T10:36:56Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T10:36:56Z","title":"StepCodeReasoner: Aligning Code Reasoning with Stepwise Execution Traces via Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-13T05:27:37.521421Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2605.11922"},"observation_digest":"sha256:33c9c19d7f9bb80c547db0f386c14c59c2051fcbe3776a5af2146b043b906ad0","observation_id":"664fb5a8-2388-4f86-8985-57cc40083518","resolution":{"observed_at":"2026-05-13T05:32:20.304263Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2410.15226/citation-record","integrity":"/paper/2410.15226/integrity","json":"/paper/2410.15226/citation-record.json","paper":"/paper/2410.15226"},"outbound":[],"paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T19:36:32.581033Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 19 inbound Pith citation observations for arXiv:2410.15226."}