{"as_of":"2026-08-08T23:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5d26c6059a1cdf93b9b709f6e35af66e5027e5ceb499361879b2fb652aa67791","coverage":[{"denominator":94,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":94,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T04:54:51.000155Z","state":"measured"},{"denominator":95,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":95,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T02:03:07.556469Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08512","snapshot_observed_at":"2026-08-04T02:03:07.556469Z","title":"arXiv preprint arXiv:2502.08512 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00024","last_updated":"2026-07-10T07:15:11Z","snapshot_observed_at":"2026-08-06T23:11:31.923109Z","submitted_at":"2026-07-10T07:15:11Z","title":"Exploring More to Solve More: Boosting Diversity in Text Diffusion Models via Entropy-Based Guidance","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T02:03:07.556469Z"},"links":{"cited_paper":"/paper/2502.08512","citing_paper":"/paper/2608.00024"},"observation_digest":"sha256:d030d58c06f0061f110a7bb8a30d732301f25f99f32e4e9b034305b1924e40f0","observation_id":"0992aabd-b0cc-4ad2-b68b-5e62031d4ca3","resolution":{"observed_at":"2026-08-04T02:03:07.556469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.08512/citation-record","integrity":"/paper/2502.08512/integrity","json":"/paper/2502.08512/citation-record.json","paper":"/paper/2502.08512"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.17461","last_updated":"2024-01-30T21:49:30Z","snapshot_observed_at":"2026-08-08T08:18:42.428522Z","submitted_at":"2024-01-30T21:49:30Z","title":"Synthetic Dialogue Dataset Generation using LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17461","snapshot_observed_at":"2026-08-08T04:54:50.557083Z","title":"Synthetic dialogue dataset generation using llm agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.557083Z"},"links":{"cited_paper":"/paper/2401.17461","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:d7aa2605c51616b7dfafa41accef8449718f5c564abdc120d76110eda1f3fc03","observation_id":"220944f6-2a3a-4268-b3af-10d298f7bd51","resolution":{"observed_at":"2026-08-08T04:54:50.557083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T04:54:50.563245Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.563245Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:8f549afea0b0eaf42c6313212f92a833e0bb8bb8f488b8ccd76b6ff505d7c449","observation_id":"33b37dff-0c70-4d11-bf3b-2ec8044925ce","resolution":{"observed_at":"2026-08-08T04:54:50.563245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.568004Z","title":"User's guide to correlation coefficients","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.568004Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:b3179a824b90b4f8f30f27aabdd446e1b268cd84773465f50c541dda5a5c71bb","observation_id":"ddd899f2-38a9-4b83-a2e7-155f92c4297b","resolution":{"observed_at":"2026-08-08T04:54:50.568004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.572633Z","title":"J., Kragic, D., and Kjellstrom, H","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.572633Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:18c98196497794bbd998b8c282e5aa63c4fe730fcac0a7deace326c4c64a64a9","observation_id":"b713cd28-5825-431d-b703-e46bd8d326f5","resolution":{"observed_at":"2026-08-08T04:54:50.572633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.02549","last_updated":"2020-02-19T22:44:37Z","snapshot_observed_at":"2026-08-04T12:55:07.027032Z","submitted_at":"2018-11-06T18:44:11Z","title":"Language GANs Falling Short","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.02549","snapshot_observed_at":"2026-08-08T04:54:50.577270Z","title":"Language gans falling short","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.577270Z"},"links":{"cited_paper":"/paper/1811.02549","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:d11e6050a9605ad5760db05ddd65b2101f541650ad3cc5eb3df9f77c6e5270d9","observation_id":"a1b16900-89c2-41e6-8d5d-7b610312a26b","resolution":{"observed_at":"2026-08-08T04:54:50.577270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06290","last_updated":"2024-07-26T18:09:11Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:37:31Z","title":"Instruction Mining: Instruction Data Selection for Tuning Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06290","snapshot_observed_at":"2026-08-08T04:54:50.582249Z","title":"Instruction mining: Instruction data selection for tuning large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.582249Z"},"links":{"cited_paper":"/paper/2307.06290","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:5dd1ace7c81891724136b91b2112f6ea15fe0ccdf0ca398ebf0786d35b93f599","observation_id":"ee8b96bc-0712-46a4-a494-6b2c784d719b","resolution":{"observed_at":"2026-08-08T04:54:50.582249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01580","last_updated":"2023-10-18T03:31:02Z","snapshot_observed_at":"2026-08-08T02:30:50.769786Z","submitted_at":"2023-03-02T21:13:56Z","title":"Mixture of Soft Prompts for Controllable Data Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01580","snapshot_observed_at":"2026-08-08T04:54:50.588175Z","title":"Mixture of soft prompts for controllable data generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.588175Z"},"links":{"cited_paper":"/paper/2303.01580","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:30d79cb5fe258ffc9a75b8a7d91dbe83e49cb8b14b2a30d15a27ba3408729f4f","observation_id":"1039d1ff-8d5c-444f-acab-dbdda528b7cd","resolution":{"observed_at":"2026-08-08T04:54:50.588175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04140","last_updated":"2023-06-07T04:27:09Z","snapshot_observed_at":"2026-08-04T18:50:11.343827Z","submitted_at":"2023-06-07T04:27:09Z","title":"Increasing Diversity While Maintaining Accuracy: Text Data Generation with Large Language Models and Human Interventions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04140","snapshot_observed_at":"2026-08-08T04:54:50.593096Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.593096Z"},"links":{"cited_paper":"/paper/2306.04140","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:df5e30ec7504985fb2cea518dd0bc38546812c584b2a0413b4e4122b37fac08b","observation_id":"4e65a109-73cf-4999-81e5-2b4fc6becbf0","resolution":{"observed_at":"2026-08-08T04:54:50.593096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07972","last_updated":"2018-10-30T20:29:16Z","snapshot_observed_at":"2026-08-02T13:20:24.395952Z","submitted_at":"2018-04-21T14:29:39Z","title":"Eval all, trust a few, do wrong to none: Comparing sentence generation models","version":2},"cited_work":{"arxiv_id":"1804.07972","doi":null,"metadata_source":"pith","pith_arxiv_id":"1804.07972","snapshot_observed_at":"2026-08-08T04:54:51.808687Z","title":"Eval all, trust a few, do wrong to none: Comparing sentence generation models","venue":"cs.CL","work_id":"8b775d2a-32eb-496a-8db4-cd3793b090c1","year":2018},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.598075Z"},"links":{"cited_paper":"/paper/1804.07972","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:6bea8ad685f5d2d7d02db7b128f8abbf7c5c9f45eefd3b960a7adc84df9a5513","observation_id":"22c18fa7-488b-44e3-8585-27edaebe1941","resolution":{"observed_at":"2026-08-08T04:54:51.814134Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.13719","last_updated":"2019-11-14T04:51:03Z","snapshot_observed_at":"2026-07-06T08:25:47.087616Z","submitted_at":"2019-09-30T14:05:14Z","title":"RandAugment: Practical automated data augmentation with a reduced search space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.13719","snapshot_observed_at":"2026-08-08T04:54:50.603017Z","title":"D., Zoph, B., Shlens, J., and Le, Q","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.603017Z"},"links":{"cited_paper":"/paper/1909.13719","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:8d57900db3c88040314672d7bda2e6216a768820b284c7657fc178cc7181cb6b","observation_id":"211c37db-37b3-4010-bbd9-b03727702b09","resolution":{"observed_at":"2026-08-08T04:54:50.603017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13007","last_updated":"2023-03-20T11:39:47Z","snapshot_observed_at":"2026-07-06T14:55:41.638936Z","submitted_at":"2023-02-25T06:58:16Z","title":"AugGPT: Leveraging ChatGPT for Text Data Augmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13007","snapshot_observed_at":"2026-08-08T04:54:50.607922Z","title":"Auggpt: Leveraging chatgpt for text data augmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.607922Z"},"links":{"cited_paper":"/paper/2302.13007","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:58308e53ee11cae91b83f1ea1d5f9eb35e5a1331cae0432d6d4afbd350934dcd","observation_id":"96a2b178-555d-48c2-b330-083355af2d2e","resolution":{"observed_at":"2026-08-08T04:54:50.607922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.612645Z","title":"and Dieng, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.612645Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:2523c39be4650b08acfbf1c6af2509e8bae40c61dba8fdacc3e2ab4a4b831893","observation_id":"fb61bb52-20ac-4cdd-a411-305a0b4102a8","resolution":{"observed_at":"2026-08-08T04:54:50.612645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.617269Z","title":"The mnist database of handwritten digit images for machine learning research [best of the web]","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.617269Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:69bdff4e420ad83049c2e27aafa2ed5cc5d418bab5561becba69f00c255236cd","observation_id":"55094d90-8963-49b9-acd4-b9aaf9212b41","resolution":{"observed_at":"2026-08-08T04:54:50.617269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.04302","last_updated":"2019-10-09T23:40:05Z","snapshot_observed_at":"2026-07-06T08:28:15.985260Z","submitted_at":"2019-10-09T23:40:05Z","title":"Prescribed Generative Adversarial Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.04302","snapshot_observed_at":"2026-08-08T04:54:50.621819Z","title":"B., Ruiz, F","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.621819Z"},"links":{"cited_paper":"/paper/1910.04302","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:44231e9b4381724aa28b847d06a68df13446260fb2514c3041bc60cc2b8e219e","observation_id":"ea37a12b-be95-45ef-b602-e714b715632c","resolution":{"observed_at":"2026-08-08T04:54:50.621819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10450","last_updated":"2023-06-14T16:11:50Z","snapshot_observed_at":"2026-07-06T14:33:03.656499Z","submitted_at":"2022-12-20T17:28:41Z","title":"Is GPT-3 a Good Data Annotator?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10450","snapshot_observed_at":"2026-08-08T04:54:50.626666Z","title":"K., Joty, S., Li, B., and Bing, L","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.626666Z"},"links":{"cited_paper":"/paper/2212.10450","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:c851166e247c084eb66b7545e718b437d4512f773de60a01d36f73dfbb8f3e65","observation_id":"8a45b919-42cd-47d5-bdfc-d37d4c40ef3c","resolution":{"observed_at":"2026-08-08T04:54:50.626666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02990","last_updated":"2024-07-02T07:59:40Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:11:54Z","title":"Data Augmentation using Large Language Models: Data Perspectives, Learning Paradigms and Challenges","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02990","snapshot_observed_at":"2026-08-08T04:54:50.631591Z","title":"T., and Joty, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.631591Z"},"links":{"cited_paper":"/paper/2403.02990","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:4ec2fb99ee286fde3e72feb474c36e133c8f9ba7789709bbc0f1be97e3434a9f","observation_id":"7d071908-c6e2-4c94-a979-3b36db85b412","resolution":{"observed_at":"2026-08-08T04:54:50.631591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.636392Z","title":"G., Santos, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.636392Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:bfbe63854b680b55e1aa037993207de50b9797aed13ada8cf85b10e6b7c5943c","observation_id":"2ee59089-5171-43f0-a8c9-ee723562319f","resolution":{"observed_at":"2026-08-08T04:54:50.636392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.641186Z","title":"and Black, A","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.641186Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:544162367dbf7104b6d3402470350145f566b4c9f9a6312604d82ca18f9c4172","observation_id":"9fa8936f-eca7-4e64-b27d-0062ec69e5d7","resolution":{"observed_at":"2026-08-08T04:54:50.641186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00415","last_updated":"2024-03-30T16:47:06Z","snapshot_observed_at":"2026-08-01T16:05:27.452059Z","submitted_at":"2024-03-30T16:47:06Z","title":"CoDa: Constrained Generation based Data Augmentation for Low-Resource NLP","version":1},"cited_work":{"arxiv_id":"2404.00415","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.00415","snapshot_observed_at":"2026-08-08T04:54:51.707402Z","title":"CoDa: Constrained Generation based Data Augmentation for Low-Resource NLP","venue":"cs.CL","work_id":"be701e27-8e73-4924-81a3-f472873070ff","year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.645619Z"},"links":{"cited_paper":"/paper/2404.00415","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:a38aa7cfcf1a7c42c21e21ee879ead387663dd81d7dcc5f5908def209a244d4d","observation_id":"a8a656e8-9f6a-4981-9034-7d86b5c7725a","resolution":{"observed_at":"2026-08-08T04:54:51.713193Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08821","last_updated":"2022-05-18T12:29:49Z","snapshot_observed_at":"2026-07-06T11:01:05.577957Z","submitted_at":"2021-04-18T11:27:08Z","title":"SimCSE: Simple Contrastive Learning of Sentence Embeddings","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08821","snapshot_observed_at":"2026-08-08T04:54:50.650403Z","title":"Simcse: Simple contrastive learning of sentence embeddings","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.650403Z"},"links":{"cited_paper":"/paper/2104.08821","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:5b78a6d9428f468b4f0f59b5b23f7dc390a4890e6818cacebe08ee9e6ae4fdcb","observation_id":"61899b9b-774b-4b2c-b2ad-2917f3493b17","resolution":{"observed_at":"2026-08-08T04:54:50.650403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.655497Z","title":"Chatgpt outperforms crowd workers for text-annotation tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.655497Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:ba94beb08d580380745f054dab3107f430ac382509d0b982ff8d49cbb2e628db","observation_id":"c1cd2522-4312-40ef-a3cd-8bdec0f9846e","resolution":{"observed_at":"2026-08-08T04:54:50.655497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08973","last_updated":"2020-06-04T19:04:48Z","snapshot_observed_at":"2026-08-07T10:57:50.967532Z","submitted_at":"2020-02-20T19:02:02Z","title":"Affinity and Diversity: Quantifying Mechanisms of Data Augmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08973","snapshot_observed_at":"2026-08-08T04:54:50.660033Z","title":"J., Cubuk, E","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.660033Z"},"links":{"cited_paper":"/paper/2002.08973","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:a85bcfde8542fb87d75dcb2c61a6cbb217902ba5b195d61bd283f1a21aa3f08e","observation_id":"084c08f0-a888-4ff8-90ae-1fd37e3d913d","resolution":{"observed_at":"2026-08-08T04:54:50.660033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.664900Z","title":"Generative adversarial networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.664900Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:b9615ba7e8d7dc3b32f01174d267db55c940892fb3536ceae47412a2ebb1adbc","observation_id":"8cd9f28b-0a3c-4fc1-b39e-74cad6da37cb","resolution":{"observed_at":"2026-08-08T04:54:50.664900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.669402Z","title":"Llm-based code generation method for golang compiler testing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.669402Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:16d5eb94abf05975fa98654a436a5c8a73480b33102bc7f66b27c9f0784c21b2","observation_id":"a48b1012-d602-4e85-9d11-5a42183aa614","resolution":{"observed_at":"2026-08-08T04:54:50.669402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17876","last_updated":"2024-08-08T06:32:00Z","snapshot_observed_at":"2026-08-03T20:39:10.958165Z","submitted_at":"2023-10-27T03:32:17Z","title":"TarGEN: Targeted Data Generation with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17876","snapshot_observed_at":"2026-08-08T04:54:50.673908Z","title":"A., Mishra, S., and Baral, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.673908Z"},"links":{"cited_paper":"/paper/2310.17876","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:1113ad134c396411d69d058cd79dcc56f23e59eed03877c4e1acc2babcc04f7d","observation_id":"3cc466e1-a7d5-4c7c-9688-b485cfe481aa","resolution":{"observed_at":"2026-08-08T04:54:50.673908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.678962Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.678962Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:6125bfc74fbf266e7b52c83ab7344bc782bab9d14a18551f61259b743760c310","observation_id":"6ff78ebf-fc4f-4f48-9253-fe023c4327e1","resolution":{"observed_at":"2026-08-08T04:54:50.678962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09751","last_updated":"2020-02-14T21:56:30Z","snapshot_observed_at":"2026-07-06T07:47:32.745963Z","submitted_at":"2019-04-22T07:17:18Z","title":"The Curious Case of Neural Text Degeneration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09751","snapshot_observed_at":"2026-08-08T04:54:50.683583Z","title":"The curious case of neural text degeneration","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.683583Z"},"links":{"cited_paper":"/paper/1904.09751","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:29e1ddbd8d245b7965ec1d6c66b45695e6be4c63a9e1056064abfee905f58b9d","observation_id":"ced880b2-55ff-43b1-a95e-ab19c090c027","resolution":{"observed_at":"2026-08-08T04:54:50.683583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-08T04:54:50.688523Z","title":"J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.688523Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:53721010cbfbe292b3185b82352404c026b6c7b5475f128bd3eee8a88eee3d1d","observation_id":"1eccecd3-c955-44ef-8cf5-3207bb0f7e76","resolution":{"observed_at":"2026-08-08T04:54:50.688523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.693432Z","title":"Learning preference model for llms via automatic preference data generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.693432Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:4fcf2e71af1ca2ed86543c818b24284dc5fd921a0ca82a0e082097fa7480e6cb","observation_id":"915adbf8-21d4-40ec-a665-d8ba59553642","resolution":{"observed_at":"2026-08-08T04:54:50.693432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.697995Z","title":"T., Boutros, F., Kuijper, A., and Damer, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.697995Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:207ab02494745ace540fae45ab8d36e7ec1a5d16fd696edd6821063582531f7e","observation_id":"a4504023-31d4-4aed-aeb8-3c8a7fd6ecba","resolution":{"observed_at":"2026-08-08T04:54:50.697995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.702558Z","title":"T., and Farnia, F","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.702558Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:9b769621d53db0f1a11d5a92ee0a16ee3c9544f5446f7d37d4809157d38a8ac1","observation_id":"346789cd-e5e3-4992-a165-e28b7292b4f0","resolution":{"observed_at":"2026-08-08T04:54:50.702558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.707148Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.707148Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:f920bbc54ae490eb0377069ef6b8e966f0220133ce65a4ca190d32a0a245eb88","observation_id":"628f6680-fc97-4ed4-aa59-f92dadd7ffdf","resolution":{"observed_at":"2026-08-08T04:54:50.707148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.337685Z","title":"Natural language processing: state of the art, current trends and challenges","venue":null,"work_id":"e775a622-f6be-4264-a6a7-dffe5271d067","year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.711846Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:f676da6685f936af55ad716cab7bb723e029188450bb3d58ccbed638c8b74319","observation_id":"651b66e6-6334-445d-ada8-afd0f68e56bd","resolution":{"observed_at":"2026-08-08T04:54:52.343645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.716687Z","title":"Improved precision and recall metric for assessing generative models","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.716687Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:999a2a011c6046027cb05b08310d886f560658f4cef5ddc3b4d4096a9eda37d1","observation_id":"cb944758-1731-4815-ac6e-bdb5fcb46e64","resolution":{"observed_at":"2026-08-08T04:54:50.716687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.08529","last_updated":"2020-03-19T00:48:32Z","snapshot_observed_at":"2026-08-08T19:19:08.806277Z","submitted_at":"2020-03-19T00:48:32Z","title":"Diversity, Density, and Homogeneity: Quantitative Characteristic Metrics for Text Collections","version":1},"cited_work":{"arxiv_id":"2003.08529","doi":null,"metadata_source":"pith","pith_arxiv_id":"2003.08529","snapshot_observed_at":"2026-08-08T04:54:51.606977Z","title":"Diversity, Density, and Homogeneity: Quantitative Characteristic Metrics for Text Collections","venue":"cs.CL","work_id":"d8d3fe73-e88c-4fcb-a1b6-161c1a888aec","year":2020},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.721169Z"},"links":{"cited_paper":"/paper/2003.08529","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:383d747ff0711e0dee83ba9b1bf532d03973a7682d74bcde395adb750b895c74","observation_id":"9d304498-f4ba-44eb-828d-51e78930e753","resolution":{"observed_at":"2026-08-08T04:54:51.612340Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.310285Z","title":"Exploring precision and recall to assess the quality and diversity of llms","venue":null,"work_id":"46fa151f-8357-4f84-8aec-5fedfb41b452","year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.726097Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:d15c53d23e197e66834edc5b20cc6c26f4da31a14ea41e1641f11f21e6fbdc5f","observation_id":"8484a75b-fa89-4073-97c1-e32949eb63f8","resolution":{"observed_at":"2026-08-08T04:54:52.315626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13840","last_updated":"2025-07-02T21:53:51Z","snapshot_observed_at":"2026-08-08T13:14:53.069676Z","submitted_at":"2023-06-24T02:25:56Z","title":"Beyond Scale: The Diversity Coefficient as a Data Quality Metric for Variability in Natural Language Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13840","snapshot_observed_at":"2026-08-08T04:54:50.730719Z","title":"Beyond scale: the diversity coefficient as a data quality metric demonstrates llms are pre-trained on formally diverse data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.730719Z"},"links":{"cited_paper":"/paper/2306.13840","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:c41cc469e3dc3ed98906a9a315db79c959c739e934f781c31a53a7c72a411c9b","observation_id":"f44d8e89-32e9-4eb4-b590-e5bac41db550","resolution":{"observed_at":"2026-08-08T04:54:50.730719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.293215Z","title":"Graddiv: Adversarial robustness of randomized neural networks via gradient diversity regularization","venue":null,"work_id":"b0d75d2d-ee92-43c6-9d8c-9636b92bd0c4","year":2022},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.735530Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:95599c1106850ec13a3d625f1f461cfd4707e6c404053fc85358197cc5300829","observation_id":"45235e71-9799-41c9-9693-2e61316d9e64","resolution":{"observed_at":"2026-08-08T04:54:52.298118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.277264Z","title":"and Cobbold, C","venue":null,"work_id":"1d24d845-2715-41d5-be96-19c873aafa63","year":2012},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.740094Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:9455d5b9880718ece62e4f4c56613799a6205524faadc88572b6bec15f5fdb61","observation_id":"804556e7-fc75-4fc8-907e-b6f0689e85e9","resolution":{"observed_at":"2026-08-08T04:54:52.282078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.261313Z","title":"Rich feature learning via diversification","venue":null,"work_id":"60c9ca8c-c392-4f87-9173-e6178827f2f1","year":2025},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.744642Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:147afe029e918bc74611bae49807b1ca4b88fcba711fcbd714edf9b4c65b98b3","observation_id":"578b16a5-6ed1-49ee-9417-6dab5b4b436f","resolution":{"observed_at":"2026-08-08T04:54:52.266525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.03055","last_updated":"2016-06-10T22:03:28Z","snapshot_observed_at":"2026-07-06T04:32:42.614338Z","submitted_at":"2015-10-11T14:04:57Z","title":"A Diversity-Promoting Objective Function for Neural Conversation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.03055","snapshot_observed_at":"2026-08-08T04:54:50.749027Z","title":"A diversity-promoting objective function for neural conversation models","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.749027Z"},"links":{"cited_paper":"/paper/1510.03055","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:fb906753452dd55f2f6a457d9a102cd4310f00d355a5b848dd208cfbd1e4ed2f","observation_id":"0fef96c9-0761-4ec1-a853-e6bc24548524","resolution":{"observed_at":"2026-08-08T04:54:50.749027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17642","last_updated":"2024-04-26T18:04:25Z","snapshot_observed_at":"2026-07-06T18:06:16.139203Z","submitted_at":"2024-04-26T18:04:25Z","title":"Empowering Large Language Models for Textual Data Augmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.17642","snapshot_observed_at":"2026-08-08T04:54:50.754071Z","title":"Empowering large language models for textual data augmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.754071Z"},"links":{"cited_paper":"/paper/2404.17642","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:4e1fb798d4e4cebe79e1c2eab4cab12d648d44395ad83eeca7fe085178d60a6d","observation_id":"29c9d34d-3fc1-4e14-bd16-94ef907260cd","resolution":{"observed_at":"2026-08-08T04:54:50.754071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07849","last_updated":"2023-10-13T01:31:59Z","snapshot_observed_at":"2026-07-06T16:31:29.379540Z","submitted_at":"2023-10-11T19:51:13Z","title":"Synthetic Data Generation with Large Language Models for Text Classification: Potential and Limitations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07849","snapshot_observed_at":"2026-08-08T04:54:50.759083Z","title":"Synthetic data generation with large language models for text classification: Potential and limitations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.759083Z"},"links":{"cited_paper":"/paper/2310.07849","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:64c9ac2d57b2c2a9c539a0c73bc1a4d89591d1ea6c062eb6807e021ee163e03b","observation_id":"c3141f0c-ebb9-45f5-aff6-ab04f5dbdf30","resolution":{"observed_at":"2026-08-08T04:54:50.759083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11971","last_updated":"2024-05-20T11:57:50Z","snapshot_observed_at":"2026-07-06T18:16:42.428308Z","submitted_at":"2024-05-20T11:57:50Z","title":"Data Augmentation for Text-based Person Retrieval Using Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11971","snapshot_observed_at":"2026-08-08T04:54:50.763914Z","title":"Data augmentation for text-based person retrieval using large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.763914Z"},"links":{"cited_paper":"/paper/2405.11971","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:a0a5240d277787cad75d2386a4431e50b8c8d97fc53aab6860932ca4180fd52d","observation_id":"f97ee35f-5256-4306-b469-6aef0515cf41","resolution":{"observed_at":"2026-08-08T04:54:50.763914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-01T19:14:56.803459Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-08T04:54:50.768611Z","title":"Holistic evaluation of language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.768611Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:5ac486e727d1478d6c49e86949bb4f97bd95f71500a88bf0d08979cf4e95138a","observation_id":"08eb5c24-8535-4b84-8652-abfed5201ad3","resolution":{"observed_at":"2026-08-08T04:54:50.768611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.245384Z","title":"Diverse image generation via self-conditioned gans","venue":null,"work_id":"131d90a9-d8db-458b-9ba5-563bb4c58d42","year":2020},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.773433Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:68b261a23fcfb710794ae67b106cd1f55276a8a3e96f6b06ab1f92d784f6fa25","observation_id":"891d3c4e-d9d6-4f37-a8b8-bc0cdcb861f7","resolution":{"observed_at":"2026-08-08T04:54:52.250478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-08T04:54:50.778032Z","title":"Roberta: A robustly optimized bert pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.778032Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:90a98e3cf608deeb00dbb7a06f5ab971072bf65dc3d6427d520376ab9dccf87d","observation_id":"c377feb5-181f-4ea6-9368-b55998c56af2","resolution":{"observed_at":"2026-08-08T04:54:50.778032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-07-06T18:34:51.641949Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-08T04:54:50.783032Z","title":"On llms-driven synthetic data generation, curation, and evaluation: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.783032Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:3a1d3c773f3522352413b4172bff389efbba5e1dfd3fa1aafe7e1fc7026dfeb2","observation_id":"47a8d6a7-e4ec-4d07-b961-9eb6cd52bc93","resolution":{"observed_at":"2026-08-08T04:54:50.783032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-08T04:54:50.787809Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.787809Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:b51ddced9bac31d38916ed8b4b5613aeb73c736eb677096fc5a8e44069240b54","observation_id":"51b4ad43-6ec9-49af-8b38-a22dfca35cad","resolution":{"observed_at":"2026-08-08T04:54:50.787809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.229836Z","title":"L., Daly, R","venue":null,"work_id":"de6f943b-359a-422f-840b-928af5768bd3","year":2011},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.792664Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:14ecbec9431ddac562dadbe452d01aed10d45bdb37e9ce74fe4e4ee0f2bd58c8","observation_id":"2a577f0d-9ae0-483f-89c5-00da8c9dfefc","resolution":{"observed_at":"2026-08-08T04:54:52.234749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11637","last_updated":"2024-05-19T17:58:26Z","snapshot_observed_at":"2026-07-06T18:16:29.163229Z","submitted_at":"2024-05-19T17:58:26Z","title":"Zero-Shot Stance Detection using Contextual Data Generation with LLMs","version":1},"cited_work":{"arxiv_id":"2405.11637","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.11637","snapshot_observed_at":"2026-08-08T04:54:51.437411Z","title":"Zero-Shot Stance Detection using Contextual Data Generation with LLMs","venue":"cs.CL","work_id":"6b7db869-05de-42af-861d-6996ef37cad6","year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.797120Z"},"links":{"cited_paper":"/paper/2405.11637","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:8bc4ca6921bd8400e4a0519daa55e60aad387f2b15010bc2281ebfc887d7f64d","observation_id":"b2722620-46bc-4702-b72f-264135027aea","resolution":{"observed_at":"2026-08-08T04:54:51.442517Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.02867","last_updated":"2018-07-28T06:51:27Z","snapshot_observed_at":"2026-07-06T06:37:55.065033Z","submitted_at":"2018-05-08T07:34:17Z","title":"Online normalizer calculation for softmax","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.02867","snapshot_observed_at":"2026-08-08T04:54:50.801735Z","title":"and Gimelshein, N","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.801735Z"},"links":{"cited_paper":"/paper/1805.02867","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:1753f9cd1a0d0135e7c2708d2b314962698e5dcfd60723bdf47c4a386721050c","observation_id":"3f562b54-5973-460e-8ce2-4eb8e0b8b603","resolution":{"observed_at":"2026-08-08T04:54:50.801735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00816","last_updated":"2020-05-02T12:34:17Z","snapshot_observed_at":"2026-07-06T09:17:05.116595Z","submitted_at":"2020-05-02T12:34:17Z","title":"DQI: Measuring Data Quality in NLP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00816","snapshot_observed_at":"2026-08-08T04:54:50.806461Z","title":"Dqi: Measuring data quality in nlp","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.806461Z"},"links":{"cited_paper":"/paper/2005.00816","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:f0bea3b63b4124b58f6e040508eed46b736f2b4c937f74b36a08b26677e40e3e","observation_id":"805fea4b-e9e7-4120-a3af-3544770927cb","resolution":{"observed_at":"2026-08-08T04:54:50.806461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.01696","last_updated":"2016-04-06T17:15:10Z","snapshot_observed_at":"2026-08-02T13:14:17.832691Z","submitted_at":"2016-04-06T17:15:10Z","title":"A Corpus and Evaluation Framework for Deeper Understanding of Commonsense Stories","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.01696","snapshot_observed_at":"2026-08-08T04:54:50.811177Z","title":"A corpus and evaluation framework for deeper understanding of commonsense stories","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.811177Z"},"links":{"cited_paper":"/paper/1604.01696","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:f6e33542c63877cf2377e596691f8ed0116ee5d4b1b9ec3aa710c7fb7e53f139","observation_id":"8d061d46-68a1-4e8d-bcd2-de6c802f0cf8","resolution":{"observed_at":"2026-08-08T04:54:50.811177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.815873Z","title":"F., Oh, S","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.815873Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:455bd517483e695250a6b08749acf5057dfe6a45915379ab19061ab96a584cf2","observation_id":"f30006b6-8d5d-4116-928a-e05759fb6821","resolution":{"observed_at":"2026-08-08T04:54:50.815873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02961","last_updated":"2024-11-05T18:16:21Z","snapshot_observed_at":"2026-08-03T16:01:00.807492Z","submitted_at":"2024-07-03T09:54:58Z","title":"Towards a Scalable Reference-Free Evaluation of Generative Models","version":2},"cited_work":{"arxiv_id":"2407.02961","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.02961","snapshot_observed_at":"2026-08-08T04:54:51.366115Z","title":"Towards a Scalable Reference-Free Evaluation of Generative Models","venue":"cs.LG","work_id":"eba5de9c-6a93-4138-92e1-c489a23b7a21","year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.820241Z"},"links":{"cited_paper":"/paper/2407.02961","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:bad9fc669cedec99ac14be25c514e7ff328a90a0a0c9eff911e275c048800b9c","observation_id":"d145c66b-c379-4127-bc57-5a43002e8588","resolution":{"observed_at":"2026-08-08T04:54:51.371491Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05196","last_updated":"2024-07-01T16:36:30Z","snapshot_observed_at":"2026-07-06T16:16:45.463211Z","submitted_at":"2023-09-11T02:16:47Z","title":"Does Writing with Language Models Reduce Content Diversity?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05196","snapshot_observed_at":"2026-08-08T04:54:50.824906Z","title":"and He, H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.824906Z"},"links":{"cited_paper":"/paper/2309.05196","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:b4fc153f6aa7b43fd2d201f0ba94fdae44f7e4149231b016baf17d5c4e89f28e","observation_id":"354c82d9-8399-46c0-bb0a-40064856b603","resolution":{"observed_at":"2026-08-08T04:54:50.824906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08779","last_updated":"2019-12-03T18:19:07Z","snapshot_observed_at":"2026-08-04T08:35:21.943076Z","submitted_at":"2019-04-18T17:53:38Z","title":"SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.08779","snapshot_observed_at":"2026-08-08T04:54:50.830221Z","title":"S., Chan, W., Zhang, Y., Chiu, C.-C., Zoph, B., Cubuk, E","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.830221Z"},"links":{"cited_paper":"/paper/1904.08779","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:7ca64ab6125bbdf8278906902b0f082dde732238656764c77555be47f8c658ca","observation_id":"2111c041-ac5b-4b68-afe0-8a2460f2ce45","resolution":{"observed_at":"2026-08-08T04:54:50.830221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.200272Z","title":"Mauve: Measuring the gap between neural text and human text using divergence frontiers","venue":null,"work_id":"98043a6f-5b50-4a01-9626-a67059cb72af","year":2021},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.834861Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:ff3803042fb5026695e77a0a783efb6cd437f43eda4968860edce1a42529f860","observation_id":"f7dd0437-fdb8-422c-bb14-4dc6a717b374","resolution":{"observed_at":"2026-08-08T04:54:52.206253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.182260Z","title":"unsup-simcse-bert-base-uncased, 2021","venue":null,"work_id":"fc23a244-4fed-45e3-b08f-c08e42aaf71b","year":2021},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.839404Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:732a141689d995e716c654f2cc1763cd9095f7650d3330947f451e75e409f9d8","observation_id":"ac6b8b22-79d9-42c1-8efb-bce621c7ee56","resolution":{"observed_at":"2026-08-08T04:54:52.187494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.166669Z","title":null,"venue":null,"work_id":"63425e37-0ed9-40df-b089-3f5c5e129a27","year":1969},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.844004Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:ec59460be222acb806a80cefc404de419a9688e864aad05e22d0d9b324ea4e40","observation_id":"2e4d732b-9b18-4896-acf7-1fbc98a19208","resolution":{"observed_at":"2026-08-08T04:54:52.171641Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-08T04:54:50.848669Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.848669Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:2629252a0a32da57d51dd01eeec220a4cb26b1888288a9c83d507a7c5a52a9c4","observation_id":"07a3c404-afc1-4a17-beb5-aebb845cb6e0","resolution":{"observed_at":"2026-08-08T04:54:50.848669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.04118","last_updated":"2020-05-08T15:48:31Z","snapshot_observed_at":"2026-07-06T09:18:47.555571Z","submitted_at":"2020-05-08T15:48:31Z","title":"Beyond Accuracy: Behavioral Testing of NLP models with CheckList","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.04118","snapshot_observed_at":"2026-08-08T04:54:50.853489Z","title":"T., Wu, T., Guestrin, C., and Singh, S","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.853489Z"},"links":{"cited_paper":"/paper/2005.04118","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:c1358943550e3efd40a2e437837ddcf8903fe9cbeceaed42c2b7a6e062cb47bf","observation_id":"c6fbf12b-d000-483f-9986-45df04151659","resolution":{"observed_at":"2026-08-08T04:54:50.853489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07341","last_updated":"2025-01-23T21:26:02Z","snapshot_observed_at":"2026-08-04T13:01:21.573144Z","submitted_at":"2024-07-10T03:25:47Z","title":"A Guide To Effectively Leveraging LLMs for Low-Resource Text Summarization: Data Augmentation and Semi-supervised Approaches","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07341","snapshot_observed_at":"2026-08-08T04:54:50.858371Z","title":"and Laradji, I","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.858371Z"},"links":{"cited_paper":"/paper/2407.07341","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:e1db7a5e21156ffce786f863c5ea170ab013f1ccaf8baee0e47c8636c9a82310","observation_id":"fb9834d8-84f6-4af4-82a7-d909508911db","resolution":{"observed_at":"2026-08-08T04:54:50.858371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12426","last_updated":"2024-07-10T00:35:17Z","snapshot_observed_at":"2026-07-06T16:22:01.657709Z","submitted_at":"2023-09-21T18:48:02Z","title":"Can LLMs Augment Low-Resource Reading Comprehension Datasets? Opportunities and Challenges","version":2},"cited_work":{"arxiv_id":"2309.12426","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.12426","snapshot_observed_at":"2026-08-08T04:54:51.262939Z","title":"Can LLMs Augment Low-Resource Reading Comprehension Datasets? Opportunities and Challenges","venue":"cs.CL","work_id":"39eb7df6-ed50-4469-ad07-60cd274bcf5b","year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.863005Z"},"links":{"cited_paper":"/paper/2309.12426","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:5101923ac5ad4898742a9b015cc63176053750193f7e3ea9e6377c6b20e0007b","observation_id":"cc3a21ae-79e5-4887-92d4-2d667e6a6ca4","resolution":{"observed_at":"2026-08-08T04:54:51.268156Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.150687Z","title":"Gaussian processes for machine learning","venue":null,"work_id":"c8a85190-2a06-42dc-a98a-03d72d01fbb2","year":2004},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.868046Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:d027cba43698a39958cd8639654b7492e035b726f9870c0f0caad6965f9e749f","observation_id":"a9439b37-f7ab-4139-8dcc-1787ffcb6881","resolution":{"observed_at":"2026-08-08T04:54:52.155689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.134731Z","title":"Svd-softmax: Fast softmax approximation on large vocabulary neural networks","venue":null,"work_id":"a2b562e5-6889-4947-9ae9-298becce846b","year":2017},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.872517Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:919a9ce5c140204ec185c293681ea053537944a107b69bc31714c94a296941c5","observation_id":"45baff46-d1eb-4867-b7ab-44538bfb9d78","resolution":{"observed_at":"2026-08-08T04:54:52.139912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.118751Z","title":"Generating diverse translations with sentence codes","venue":null,"work_id":"ca424ca8-0b2d-446d-a9b0-031129835796","year":2019},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.876925Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:6bc353987c7ff44f32f19d7c71c0b8ef334168eb17d367287c152478c5ddcdbf","observation_id":"2af6fa1c-a014-467f-9909-16861cea5fa6","resolution":{"observed_at":"2026-08-08T04:54:52.123971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.881499Z","title":"D., Ng, A","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.881499Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:65e7cb1368cd4e13802a13eedd1b936de25a667031a26cd788663ec6120d6635","observation_id":"2697c452-7575-4cf6-ba83-7ea9ee50d6a7","resolution":{"observed_at":"2026-08-08T04:54:50.881499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11124","last_updated":"2024-03-30T16:48:16Z","snapshot_observed_at":"2026-08-04T19:30:10.316827Z","submitted_at":"2024-03-17T07:08:55Z","title":"Scaling Data Diversity for Fine-Tuning Language Models in Human Alignment","version":2},"cited_work":{"arxiv_id":"2403.11124","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.11124","snapshot_observed_at":"2026-08-08T04:54:51.240972Z","title":"Scaling Data Diversity for Fine-Tuning Language Models in Human Alignment","venue":"cs.CL","work_id":"6b8ebfe6-8a0f-4ceb-91fd-be0ee57f3185","year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.886037Z"},"links":{"cited_paper":"/paper/2403.11124","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:368b9e4b0749bf6c069a1787746db322b254eedf74412017f188152316799e6f","observation_id":"c19e820d-7ad4-4522-96b7-789df23b3d95","resolution":{"observed_at":"2026-08-08T04:54:51.246391Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.890842Z","title":"The proof and measurement of association between two things","venue":null,"work_id":null,"year":1961},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.890842Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:b206ffca1c9e55fcc6c32af33a197117132f262666967c810cae1ac17e7cf510","observation_id":"688a2935-4735-40eb-9129-906b4577d04b","resolution":{"observed_at":"2026-08-08T04:54:50.890842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01497","last_updated":"2022-05-03T13:56:32Z","snapshot_observed_at":"2026-08-06T13:21:21.118150Z","submitted_at":"2022-05-03T13:56:32Z","title":"Semantic Diversity in Dialogue with Natural Language Inference","version":1},"cited_work":{"arxiv_id":"2205.01497","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.01497","snapshot_observed_at":"2026-08-08T04:54:51.215304Z","title":"Semantic Diversity in Dialogue with Natural Language Inference","venue":"cs.CL","work_id":"09d1be2a-33ca-444b-9e46-e456a120025f","year":2022},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.895206Z"},"links":{"cited_paper":"/paper/2205.01497","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:8e0149e59e229e65014e5dda7a3be4feee4b84d202302292ae25eb61e3b7a2cc","observation_id":"edf9532e-a26c-4dac-9975-5af9f6e6d979","resolution":{"observed_at":"2026-08-08T04:54:51.222877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13446","last_updated":"2024-12-02T20:55:15Z","snapshot_observed_at":"2026-07-06T17:33:08.817655Z","submitted_at":"2024-02-21T00:44:04Z","title":"Large Language Models for Data Annotation and Synthesis: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13446","snapshot_observed_at":"2026-08-08T04:54:50.899877Z","title":"Large language models for data annotation: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.899877Z"},"links":{"cited_paper":"/paper/2402.13446","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:61630239c19a560b4ff679f19f62f068f8e83310ef03947bc8aadbadd3334ca5","observation_id":"ea70da3b-b42c-4fa6-baf4-943670a7bdbf","resolution":{"observed_at":"2026-08-08T04:54:50.899877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.081672Z","title":"Alpacaeval : An automatic evaluator for instruction-following language models, 2023","venue":null,"work_id":"78f8d620-23bd-434c-a716-0b5d53e22782","year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.905481Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:5d157dec551a19bc86477f3d448895d2ef472d41b595278d6897d5f188265783","observation_id":"a699ce9e-52f9-46ce-819f-6c8aecf959bc","resolution":{"observed_at":"2026-08-08T04:54:52.087061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.02990","last_updated":"2021-01-24T09:49:19Z","snapshot_observed_at":"2026-08-05T20:29:03.208508Z","submitted_at":"2020-04-06T20:44:10Z","title":"Evaluating the Evaluation of Diversity in Natural Language Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.02990","snapshot_observed_at":"2026-08-08T04:54:50.910077Z","title":"and Berant, J","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.910077Z"},"links":{"cited_paper":"/paper/2004.02990","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:2f59ceab9db69e33ba81b268614f61de6686fa63735f81c6f74642deb86adabe","observation_id":"629a0c19-c58a-4db8-aadd-f2f2f2dd353a","resolution":{"observed_at":"2026-08-08T04:54:50.910077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-08T04:54:50.914807Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.914807Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:29710d0420429e0d7a8e262a039d503adfaa49919fee862e3ba33c30a842db5b","observation_id":"a6e1cf4b-9756-47ce-a475-3a0c3c18005c","resolution":{"observed_at":"2026-08-08T04:54:50.914807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10560","last_updated":"2023-05-25T23:50:07Z","snapshot_observed_at":"2026-07-06T14:33:11.945106Z","submitted_at":"2022-12-20T18:59:19Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10560","snapshot_observed_at":"2026-08-08T04:54:50.919460Z","title":"A., Khashabi, D., and Hajishirzi, H","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.919460Z"},"links":{"cited_paper":"/paper/2212.10560","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:464eb45ce82fe2297e890ada1e817a0d2253c6137c993d44ba8bb814f6709b3b","observation_id":"59281473-afc1-4104-a287-32a7b580bdf8","resolution":{"observed_at":"2026-08-08T04:54:50.919460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.064804Z","title":"J., and Sch \\\"o lkopf, B","venue":null,"work_id":"2de068fe-8384-4f7b-9ba5-1f0fa4f6eb96","year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.924144Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:c78d5698f752f88dafeadc7017aee28cf95214be83d2c0676a79ecbe4aeebf38","observation_id":"6a9e1682-7dba-4b27-a969-7c416a361088","resolution":{"observed_at":"2026-08-08T04:54:52.070244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11382","last_updated":"2023-02-21T12:42:44Z","snapshot_observed_at":"2026-07-06T14:54:37.559648Z","submitted_at":"2023-02-21T12:42:44Z","title":"A Prompt Pattern Catalog to Enhance Prompt Engineering with ChatGPT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11382","snapshot_observed_at":"2026-08-08T04:54:50.929615Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.929615Z"},"links":{"cited_paper":"/paper/2302.11382","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:7e3dc0eeea4a6add3d4bd20e10b0a41122677891d4423d2a232704835618811c","observation_id":"bcf63371-685d-4431-83c7-13ada72e12e3","resolution":{"observed_at":"2026-08-08T04:54:50.929615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.047653Z","title":"Investigating the effectiveness of data augmentation from similarity and diversity: An empirical study","venue":null,"work_id":"49441183-7c50-483f-a753-d9f8ae620a8e","year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.934701Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:379e2e043db7fcbc336e200427b7114c14dda767a7f91bc7cd89a9f1174980dc","observation_id":"94a79fb1-0db3-49d0-a84b-4974bbcf0e3c","resolution":{"observed_at":"2026-08-08T04:54:52.052711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.030886Z","title":"Mini-da: Improving your model performance through minimal data augmentation using llm","venue":null,"work_id":"e7017765-664e-4761-9cc5-ca113003b1ae","year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.939489Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:ef222317d24ff441ab2bb662017c8a9c10c3d5588a6664a9481ae7628c6c69df","observation_id":"880b9266-a922-4e8b-aac1-b01015cfcb49","resolution":{"observed_at":"2026-08-08T04:54:52.036032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07922","last_updated":"2022-10-22T01:32:03Z","snapshot_observed_at":"2026-08-07T11:18:43.093334Z","submitted_at":"2022-02-16T08:18:02Z","title":"ZeroGen: Efficient Zero-shot Learning via Dataset Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07922","snapshot_observed_at":"2026-08-08T04:54:50.944354Z","title":"Zerogen: Efficient zero-shot learning via dataset generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.944354Z"},"links":{"cited_paper":"/paper/2202.07922","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:6221bddfd648577bef256548f472c10cfb977becaada45d8c2f0e6db9465a102","observation_id":"4dcc5eaf-4c49-46da-b656-b0dbfaeca161","resolution":{"observed_at":"2026-08-08T04:54:50.944354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14568","last_updated":"2024-02-22T14:19:56Z","snapshot_observed_at":"2026-08-05T15:00:18.918436Z","submitted_at":"2024-02-22T14:19:56Z","title":"LLM-DA: Data Augmentation via Large Language Models for Few-Shot Named Entity Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14568","snapshot_observed_at":"2026-08-08T04:54:50.949266Z","title":"Llm-da: Data augmentation via large language models for few-shot named entity recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.949266Z"},"links":{"cited_paper":"/paper/2402.14568","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:802f0bb818822aafeb0b0d607b796338ba3880dfbe0489b6cf9ba3383ac63755","observation_id":"3b8dba37-0569-4a98-a88e-6db513a20450","resolution":{"observed_at":"2026-08-08T04:54:50.949266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08826","last_updated":"2021-11-18T07:56:58Z","snapshot_observed_at":"2026-07-06T11:01:05.577957Z","submitted_at":"2021-04-18T11:39:33Z","title":"GPT3Mix: Leveraging Large-scale Language Models for Text Augmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08826","snapshot_observed_at":"2026-08-08T04:54:50.954005Z","title":"M., Park, D., Kang, J., Lee, S.-W., and Park, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.954005Z"},"links":{"cited_paper":"/paper/2104.08826","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:986fe44bb35e8cd128285ef9dfa3d749304ac063d96254b63486a12f307c6b14","observation_id":"cd503249-e67f-4711-b802-1776c985488d","resolution":{"observed_at":"2026-08-08T04:54:50.954005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:52.014383Z","title":"Seqgan: Sequence generative adversarial nets with policy gradient","venue":null,"work_id":"9d491b3b-0ace-4858-8aa9-5cbd1ea4af31","year":2017},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.958803Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:0067a0038912cf6275d7b35511827c8226caa511ee9e750ccd070e7c7195f7d7","observation_id":"69c113c1-d05b-4243-a9dc-b25ffc8b27c0","resolution":{"observed_at":"2026-08-08T04:54:52.019673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:51.997832Z","title":"J., Krishna, R., Shen, J., and Zhang, C","venue":null,"work_id":"b5151dcf-1f1d-4500-b213-3211f9e7fb73","year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.963582Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:596a7683aa9bb8977203a3b3cc4e9be32b59d0d6881c6f056b46f128b3940d47","observation_id":"31a7f6a2-08bc-4d0b-a2ab-688396fce563","resolution":{"observed_at":"2026-08-08T04:54:52.002941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:51.981275Z","title":"Large language models for healthcare data augmentation: An example on patient-trial matching","venue":null,"work_id":"246f6c6c-948e-4e0d-bf96-25092d1a5677","year":2023},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.968074Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:65da3e05065b911592c955458d9da6eca0e0a9f67f98133d0ea212590950878f","observation_id":"a8947880-ad2f-4cd3-a15c-9386aa3be716","resolution":{"observed_at":"2026-08-08T04:54:51.986380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-07-06T17:54:39.685251Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-08-08T04:54:50.972531Z","title":"Advancing llm reasoning generalists with preference trees","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.972531Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:d0ec9e94b8bd81f75d89c3006d72ff21d313dfd13ec7bb5b282c0b8a2c75561a","observation_id":"165f613f-8b50-463b-87c7-d8edfa19b879","resolution":{"observed_at":"2026-08-08T04:54:50.972531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.09412","last_updated":"2018-04-27T21:39:25Z","snapshot_observed_at":"2026-08-08T10:28:19.597631Z","submitted_at":"2017-10-25T18:30:49Z","title":"mixup: Beyond Empirical Risk Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.09412","snapshot_observed_at":"2026-08-08T04:54:50.977285Z","title":"mixup: Beyond empirical risk minimization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.977285Z"},"links":{"cited_paper":"/paper/1710.09412","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:77bd07a3e9f2ab134a383e3b9483aef9ede437f08c218544f94d89a14dcad621","observation_id":"42718af5-05cf-4a99-acc0-3ac70493bd96","resolution":{"observed_at":"2026-08-08T04:54:50.977285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16807","last_updated":"2024-09-27T14:50:59Z","snapshot_observed_at":"2026-08-07T18:18:04.350975Z","submitted_at":"2024-04-25T17:52:39Z","title":"Improving Diversity of Commonsense Generation by Large Language Models via In-Context Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16807","snapshot_observed_at":"2026-08-08T04:54:50.982220Z","title":"Improving diversity of commonsense generation by large language models via in-context learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.982220Z"},"links":{"cited_paper":"/paper/2404.16807","citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:e53824ba2415a36af96577b6171639348919317b9811c579b2a45620bff6e4ac","observation_id":"12b56394-359d-4ae8-9b6c-c062538ba17e","resolution":{"observed_at":"2026-08-08T04:54:50.982220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:50.986785Z","title":"Character-level convolutional networks for text classification","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.986785Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:41a777d35c88c7fc1cbf67dac33825b9b04a68d9119d0b7ff959456144d3202e","observation_id":"8f7c0f15-f21a-48c9-8168-8846f4aa3635","resolution":{"observed_at":"2026-08-08T04:54:50.986785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:51.953547Z","title":"Bootstrapped unsupervised sentence representation learning","venue":null,"work_id":"c4967a46-f1c3-4b3e-88c7-18f66192d49d","year":2021},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.991232Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:30f51d848130c76892b690d0c86ec26e7b0510fa6d4fc2891eb3997330d1bd34","observation_id":"137d54a6-ebf9-4298-a731-caee5ee8c2eb","resolution":{"observed_at":"2026-08-08T04:54:51.959354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:51.936616Z","title":"Texygen: A benchmarking platform for text generation models","venue":null,"work_id":"dfc1f734-9573-47fa-8055-83ae99f7e4cf","year":2018},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:50.995658Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:eebb1d4e95990dc0b08a0ae8a6bce47ba3bcda95ed3dbccb6131c8b43c2cab67","observation_id":"d2aa0cc3-244a-4a9b-94bf-f00bdbaaf93b","resolution":{"observed_at":"2026-08-08T04:54:51.942160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:54:51.000155Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets","version":3},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-08T04:54:51.000155Z"},"links":{"citing_paper":"/paper/2502.08512"},"observation_digest":"sha256:8691f74dca9ed23d40801ad1d258d793ea1f8ac705cf99bf3a1ac5f4495e652c","observation_id":"9d0ced15-e46a-4bab-8035-e1c0c9b1adbd","resolution":{"observed_at":"2026-08-08T04:54:51.000155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.08512","last_updated":"2025-08-14T07:15:48Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T04:46:02.235147Z","submitted_at":"2025-02-12T15:46:34Z","title":"Measuring Diversity in Synthetic Datasets"},"reference_resolution":{"displayed":94,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":65,"verified_exact":8,"verified_fuzzy":21},"total_outbound_references":94},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 94 of 94 outbound references and 1 inbound Pith citation observation for arXiv:2502.08512."}