{"as_of":"2026-08-18T09:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:77b1f2275028e3b88c415d34127f0eb806373da0681362311b99dfa357040233","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:51:08.173184Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.14508/citation-record","integrity":"/paper/2504.14508/integrity","json":"/paper/2504.14508/citation-record.json","paper":"/paper/2504.14508"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T11:51:07.953645Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:07.953645Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:efd12e613db5cff20ee7317f2aaa9ba07f0ea3d27bb1e627d45cec7767376804","observation_id":"7b5b5225-59fc-49b9-85e0-ce62df844a8f","resolution":{"observed_at":"2026-08-16T11:51:07.953645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16827","last_updated":"2024-08-02T17:59:31Z","snapshot_observed_at":"2026-08-16T14:15:11.706978Z","submitted_at":"2024-02-26T18:54:35Z","title":"A Survey on Data Selection for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16827","snapshot_observed_at":"2026-08-16T11:51:07.958791Z","title":"M., Longpre, S., Lambert, N., W ang, X., Muennighoff, N., Hou, B., Pan, L., Jeong, H., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:07.958791Z"},"links":{"cited_paper":"/paper/2402.16827","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:3f691a09d4a27c871a5ded49d4f3b7d3c5fc358807fac0c443fd6e97f2303aa7","observation_id":"a190d634-5a69-457a-91aa-8529500d2f14","resolution":{"observed_at":"2026-08-16T11:51:07.958791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-16T11:51:07.963257Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:07.963257Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:770c362519024a819da1c903bb005cd9cebe91e0daa1ab7bd5f7f4a29d23982d","observation_id":"0fbc250d-2f94-43a7-860b-2e8883912d14","resolution":{"observed_at":"2026-08-16T11:51:07.963257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.787164Z","title":"Why it is hard to find ai in smes: A survey from the practice and how to promote it","venue":null,"work_id":"de98e6b4-f744-41b6-9463-5af40a7935d8","year":2021},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:07.967101Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:0cfc3742a301315adfd3ea8bfc11d696601f65b8ed7c76267ca19a5bc40c48f2","observation_id":"8174cfde-dca2-45d3-acf1-aedbd9aebf54","resolution":{"observed_at":"2026-08-16T11:51:08.790582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.776159Z","title":"Stars: Tera-scale graph building for clustering and learning.Advances in Neural Information Processing Systems 35 (2022), 21470–21481","venue":null,"work_id":"aa154cff-213a-4f54-a073-5c25f9c731b4","year":2022},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:07.970921Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:255a9918f159393efab6ceb1d0976be71e3beebd89aa5e6798948634c4076023","observation_id":"4d9ed737-f3f8-4a26-bae3-d1621ee62370","resolution":{"observed_at":"2026-08-16T11:51:08.780175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08701","last_updated":"2024-02-13T18:37:25Z","snapshot_observed_at":"2026-08-16T15:15:35.760076Z","submitted_at":"2023-07-17T17:59:40Z","title":"AlpaGasus: Training A Better Alpaca with Fewer Data","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08701","snapshot_observed_at":"2026-08-16T11:51:07.974904Z","title":"Alpagasus: Training a better alpaca with fewer data.arXiv preprint arXiv:2307.08701 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:07.974904Z"},"links":{"cited_paper":"/paper/2307.08701","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:b6cb221116a8d0db05e9fbe406b7503b297548690a9a1f0c1cbf5de74908c587","observation_id":"6e2926f9-6ca6-4831-b9ea-b28eb3bb28c7","resolution":{"observed_at":"2026-08-16T11:51:07.974904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.11829","last_updated":"2020-10-27T00:52:20Z","snapshot_observed_at":"2026-08-15T14:35:34.584882Z","submitted_at":"2019-06-26T23:01:47Z","title":"Selection via Proxy: Efficient Data Selection for Deep Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.11829","snapshot_observed_at":"2026-08-16T11:51:07.979544Z","title":"Selection via proxy: Efficient data selection for deep learning.arXiv preprint arXiv:1906.11829 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:07.979544Z"},"links":{"cited_paper":"/paper/1906.11829","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:dda12f7a16cc5dc21e4e3ee119ec8979096dcfc323f350b18c8815fdc0fdbc17","observation_id":"ea33a409-b6b2-44fb-810a-129490e80e7e","resolution":{"observed_at":"2026-08-16T11:51:07.979544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.764492Z","title":"When low resource nlp meets unsupervised language model: Meta-pretraining then meta-learning for few-shot text classification (student abstract)","venue":null,"work_id":"79cf4e56-1f4e-4ebf-beb1-3b374c36e224","year":2020},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:07.983367Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:29646679e7f7be038dd9a7fabe1fe1d6ef396c7d66569a8b5b1a05427d25534f","observation_id":"f5723806-0220-4bfd-8e28-c494a745b050","resolution":{"observed_at":"2026-08-16T11:51:08.768238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-16T11:51:07.988106Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding.arXiv preprint arXiv:1810.04805 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:07.988106Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:a80851160d80e1a596e29b38fefff994eb81bbce8c5e627cf6e563c6f0463f3e","observation_id":"bc9e3980-9323-4795-a86f-034d63cd43b7","resolution":{"observed_at":"2026-08-16T11:51:07.988106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01549","last_updated":"2020-11-03T07:49:15Z","snapshot_observed_at":"2026-08-16T19:08:31.154781Z","submitted_at":"2020-11-03T07:49:15Z","title":"DAGA: Data Augmentation with a Generation Approach for Low-resource Tagging Tasks","version":1},"cited_work":{"arxiv_id":"2011.01549","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.01549","snapshot_observed_at":"2026-08-16T11:51:08.391916Z","title":"DAGA: Data Augmentation with a Generation Approach for Low-resource Tagging Tasks","venue":"cs.CL","work_id":"061be12a-e13e-481d-9d3b-2d21a4d742d2","year":2020},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:07.991586Z"},"links":{"cited_paper":"/paper/2011.01549","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:8ff87d86c1af1bd8f2e544671c647b45ef8d8314572bd1f56c5fbbfe7929124a","observation_id":"1b9957e8-a81a-4729-aa93-763416343d34","resolution":{"observed_at":"2026-08-16T11:51:08.397654Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10450","last_updated":"2023-06-14T16:11:50Z","snapshot_observed_at":"2026-08-18T08:12:27.255968Z","submitted_at":"2022-12-20T17:28:41Z","title":"Is GPT-3 a Good Data Annotator?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10450","snapshot_observed_at":"2026-08-16T11:51:07.995216Z","title":"K., Joty, S., Li, B., and Bing, L","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:07.995216Z"},"links":{"cited_paper":"/paper/2212.10450","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:412499b4ae0126decff937cbd278c8606dc0d2fa249fc0b1ad95833dd195c5c6","observation_id":"196dd62c-c81e-4bfe-9c82-843e86eed898","resolution":{"observed_at":"2026-08-16T11:51:07.995216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06305","last_updated":"2020-02-15T02:40:10Z","snapshot_observed_at":"2026-08-12T00:45:25.809655Z","submitted_at":"2020-02-15T02:40:10Z","title":"Fine-Tuning Pretrained Language Models: Weight Initializations, Data Orders, and Early Stopping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06305","snapshot_observed_at":"2026-08-16T11:51:07.998772Z","title":"Fine-tuning pretrained language models: Weight initializations, data orders, and early stopping.arXiv preprint arXiv:2002.06305 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:07.998772Z"},"links":{"cited_paper":"/paper/2002.06305","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:6be093ecb9cc5d95322b0313a2c500809c4595720684200091dbf4bc40f829c8","observation_id":"fd744923-eb6d-4517-9392-ba6a0a9c2593","resolution":{"observed_at":"2026-08-16T11:51:07.998772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.752774Z","title":"Clustering for private interest-based advertising","venue":null,"work_id":"62de79aa-4a3e-4659-9f25-80edf62ad94a","year":2021},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.002387Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:2347a7da82fe9aa5abfb0e7002bf03cef44212c0b9a87eef6f2e0ab75373d33a","observation_id":"e29ea948-0d18-4662-9548-32565161da42","resolution":{"observed_at":"2026-08-16T11:51:08.757918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.742735Z","title":"A threshold of ln n for approximating set cover.Journal of the ACM (JACM) 45, 4 (1998), 634–652","venue":null,"work_id":"e9a5eb04-01d1-4d5b-912d-5d5a45e75f89","year":1998},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.005601Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:14c64ea7d5c2b15dc80e132dc5783e181b8d3f9b429f2089e5631bdadbea8ef0","observation_id":"b4729c0c-1468-4e3b-ae9e-ba8fa4fc3624","resolution":{"observed_at":"2026-08-16T11:51:08.746507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14361","last_updated":"2024-04-26T19:02:23Z","snapshot_observed_at":"2026-08-16T13:58:48.463257Z","submitted_at":"2024-04-22T17:15:32Z","title":"Better Synthetic Data by Retrieving and Transforming Existing Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14361","snapshot_observed_at":"2026-08-16T11:51:08.008926Z","title":"Better synthetic data by retrieving and transforming existing datasets.arXiv preprint arXiv:2404.14361(2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.008926Z"},"links":{"cited_paper":"/paper/2404.14361","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:4f6fdc98ca71701d3f175dc2d84fe2f7ff663150f7268ecba460fee2a06c5c98","observation_id":"b4e186af-f061-4650-9ed3-4f513cb397d6","resolution":{"observed_at":"2026-08-16T11:51:08.008926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.732382Z","title":"Chatgpt outperforms crowd workers for text-annotation tasks","venue":null,"work_id":"521c47bc-7f1a-4a30-973e-c94c56b5cb86","year":2023},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.012100Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:9e8e4ea8810ecb943410da665699242a74be3784e479819a535a2ddd2224101a","observation_id":"6ae11299-c285-4544-888c-ed44f68efbd6","resolution":{"observed_at":"2026-08-16T11:51:08.735806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.722437Z","title":"Domain adaptation for large-scale sentiment classification: A deep learning approach","venue":null,"work_id":"2b01b09f-caec-4a54-b230-fbb965f34940","year":2011},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.015350Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:6c3e39ecf0a4524c0a71e88c72d2375d9ad5f9bb524d070f848d26b2f63ff6ae","observation_id":"fc25bfe9-4928-4d9e-871f-aa3b30e9712b","resolution":{"observed_at":"2026-08-16T11:51:08.725898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.711623Z","title":"Deepcore: A comprehensive library for coreset selection in deep learning","venue":null,"work_id":"8e1c20c3-21af-4227-985b-eefedb073f2a","year":2022},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.018613Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:b6785a8d6e637a09fcf517e7e118addae2bce98e007f7a0aac5d9f9601b53f65","observation_id":"86ffc323-3185-40b9-bd8f-74d7cb621175","resolution":{"observed_at":"2026-08-16T11:51:08.715071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.701190Z","title":"Grale: Designing networks for graph learning","venue":null,"work_id":"e6405e5d-d104-4ec8-a345-d030d1e90abc","year":2020},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.021703Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:6a2e67cdfa80dfe15ef1cffefe04fcd3bdc70338b3bf858371db264bcc565e9f","observation_id":"93c6b446-ae50-40b5-986d-9757ae8838ba","resolution":{"observed_at":"2026-08-16T11:51:08.704961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.10147","last_updated":"2018-10-26T21:41:46Z","snapshot_observed_at":"2026-08-14T18:10:14.248822Z","submitted_at":"2018-10-24T01:18:08Z","title":"FewRel: A Large-Scale Supervised Few-Shot Relation Classification Dataset with State-of-the-Art Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.10147","snapshot_observed_at":"2026-08-16T11:51:08.025084Z","title":"Fewrel: A large-scale supervised few-shot relation classification dataset with state-of-the-art evaluation.arXiv preprint arXiv:1810.10147 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.025084Z"},"links":{"cited_paper":"/paper/1810.10147","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:a5ecd4e732dea93df0c3710400dc68d1c89eece785ae1f3f0942076d7dd903e5","observation_id":"9715d686-5095-4e67-bcf7-d953ecc62cc1","resolution":{"observed_at":"2026-08-16T11:51:08.025084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01629","last_updated":"2024-01-03T09:03:30Z","snapshot_observed_at":"2026-08-16T14:30:09.132560Z","submitted_at":"2024-01-03T09:03:30Z","title":"Synthetic Data in AI: Challenges, Applications, and Ethical Implications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01629","snapshot_observed_at":"2026-08-16T11:51:08.029152Z","title":"Synthetic data in ai: Challenges, applications, and ethical implications.arXiv preprint arXiv:2401.01629(2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.029152Z"},"links":{"cited_paper":"/paper/2401.01629","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:d1de05e1198448c1b8e6646a8ff0e92dfb96038b9a2a4cfad89bae1095b1263f","observation_id":"4391a698-73e7-425e-8d53-00b2d3cfc903","resolution":{"observed_at":"2026-08-16T11:51:08.029152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.689528Z","title":"Toxigen: A large-scale machine-generated dataset for adversarial and implicit hate speech detection","venue":null,"work_id":"7ef95726-4df3-45b4-a61b-43b902713ffb","year":2022},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.033491Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:9e9d3e8425066eb7b97528d48e5389ac4e63c5ab62df8ce57136e24a3f0a231c","observation_id":"76786112-a3e3-416b-a732-acd39dbd7c0b","resolution":{"observed_at":"2026-08-16T11:51:08.694252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03164","last_updated":"2021-06-06T16:10:12Z","snapshot_observed_at":"2026-08-16T18:19:19.019925Z","submitted_at":"2021-06-06T16:10:12Z","title":"On the Effectiveness of Adapter-based Tuning for Pretrained Language Model Adaptation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.03164","snapshot_observed_at":"2026-08-16T11:51:08.037033Z","title":"On the effectiveness of adapter-based tuning for pretrained language model adaptation.arXiv preprint arXiv:2106.03164 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.037033Z"},"links":{"cited_paper":"/paper/2106.03164","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:88a417be6fd3070509e56e2afc41da9e07e447e181862ee847d0755a1159325a","observation_id":"9b7dc751-04cf-4ab2-b7bf-94b97c0ba3a6","resolution":{"observed_at":"2026-08-16T11:51:08.037033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.678352Z","title":null,"venue":null,"work_id":"4fe92485-cc72-46e3-a124-db94042d4fa9","year":1996},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.041256Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:7072849ac241c70dbceafe681418735a0f15c42ed22f4c03cdc5ed740bb670d6","observation_id":"d6182c96-a203-47e2-b3c2-1f4be4187eff","resolution":{"observed_at":"2026-08-16T11:51:08.681672Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.668383Z","title":"Human feedback is not gold standard","venue":null,"work_id":"1964e86f-b0e7-4e80-88ee-99afa20690fa","year":null},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.045093Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:6b177b6bd0ddf331cb043b719df0255d1192d899fa5965cc48bcadec8ae9d9b8","observation_id":"917dd301-a410-4675-866d-dba371ff1f45","resolution":{"observed_at":"2026-08-16T11:51:08.671778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.659057Z","title":"W., and Liang, P","venue":null,"work_id":"c5b4cb7f-9ffb-41be-8c54-8c868af4c241","year":2017},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.049007Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:d894e3991a2d170d25f4af779195914186630925a3d9444aba4eee4b9523ba33","observation_id":"8cc7799e-f13c-4441-b69d-840580e329dd","resolution":{"observed_at":"2026-08-16T11:51:08.662473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01684","last_updated":"2024-01-11T00:17:43Z","snapshot_observed_at":"2026-08-16T15:27:03.575086Z","submitted_at":"2023-06-02T16:59:36Z","title":"Harnessing large-language models to generate private synthetic text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01684","snapshot_observed_at":"2026-08-16T11:51:08.052639Z","title":"Harnessing large- language models to generate private synthetic text.arXiv preprint arXiv:2306.01684(2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.052639Z"},"links":{"cited_paper":"/paper/2306.01684","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:538673f636a552d7bf1aaa4778ce24267f959fa706baf717b4acdf5ae8da3035","observation_id":"09f08d13-b70d-4560-b0a0-7b0baf288986","resolution":{"observed_at":"2026-08-16T11:51:08.052639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11942","last_updated":"2020-02-09T03:00:18Z","snapshot_observed_at":"2026-08-18T01:27:11.590348Z","submitted_at":"2019-09-26T07:06:13Z","title":"ALBERT: A Lite BERT for Self-supervised Learning of Language Representations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11942","snapshot_observed_at":"2026-08-16T11:51:08.056235Z","title":"Albert: A lite bert for self-supervised learning of language representations.arXiv preprint arXiv:1909.11942 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.056235Z"},"links":{"cited_paper":"/paper/1909.11942","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:cd78bcc188e853a02740d875af3d77478f3419a7183355457b36f8675449b2b2","observation_id":"27e5dcaa-f6fc-487d-a0ad-857a1a8da66a","resolution":{"observed_at":"2026-08-16T11:51:08.056235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20327","last_updated":"2024-03-29T17:56:40Z","snapshot_observed_at":"2026-08-16T14:05:08.120962Z","submitted_at":"2024-03-29T17:56:40Z","title":"Gecko: Versatile Text Embeddings Distilled from Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20327","snapshot_observed_at":"2026-08-16T11:51:08.061000Z","title":"R., Hui, K., Boratko, M., Kapadia, R., Ding, W., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.061000Z"},"links":{"cited_paper":"/paper/2403.20327","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:eaadead51ffec17f2c3c320dbc10553e207a0028b005c53b2a7eff2054f8c686","observation_id":"8aef0bdb-7a5e-4b00-a1f6-04fb1fbd1096","resolution":{"observed_at":"2026-08-16T11:51:08.061000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07849","last_updated":"2023-10-13T01:31:59Z","snapshot_observed_at":"2026-08-18T07:57:38.113550Z","submitted_at":"2023-10-11T19:51:13Z","title":"Synthetic Data Generation with Large Language Models for Text Classification: Potential and Limitations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07849","snapshot_observed_at":"2026-08-16T11:51:08.066294Z","title":"Synthetic data generation with large language models for text classification: Potential and limitations.arXiv preprint arXiv:2310.07849(2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.066294Z"},"links":{"cited_paper":"/paper/2310.07849","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:4285c942c036c419244eb627107d5032f8a8ab82649db1f22c01557b19c68e86","observation_id":"fcbc8854-dad3-417b-8633-c45af8b1cde5","resolution":{"observed_at":"2026-08-16T11:51:08.066294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.649823Z","title":"Best practices and lessons learned on synthetic data","venue":null,"work_id":"f42383b4-18e0-49a5-a72e-f6509536655d","year":2024},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.071498Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:183980742bba534417791a3fd21d05d1e66f45f349f5d56acc55f12cca953511","observation_id":"56efb995-3ead-4f7c-9d6d-843d381b89d5","resolution":{"observed_at":"2026-08-16T11:51:08.653155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-16T11:51:08.075229Z","title":"Roberta: A robustly optimized bert pretraining approach.arXiv preprint arXiv:1907.11692 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.075229Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:d032f581c2043a8611cfd0bef8ee35b651461d0a57e2b051fd649a849130ab98","observation_id":"85cb27ac-bc12-4aa4-ba5f-1475661b7ced","resolution":{"observed_at":"2026-08-16T11:51:08.075229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.639930Z","title":"Crossner: Evaluating cross-domain named entity recognition","venue":null,"work_id":"d5c08e5c-c75a-4ba8-a8c7-91083c0e6e5b","year":2021},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.079435Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:2d7254d6d146f73dc95bc7371ba96e72b3d29abdc3c218e34c915b9d0569447e","observation_id":"72e3640a-99cc-4244-9384-b3c27f2a477b","resolution":{"observed_at":"2026-08-16T11:51:08.643372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15126","last_updated":"2024-06-14T07:47:09Z","snapshot_observed_at":"2026-08-18T08:00:35.964338Z","submitted_at":"2024-06-14T07:47:09Z","title":"On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15126","snapshot_observed_at":"2026-08-16T11:51:08.083171Z","title":"On llms-driven synthetic data generation, curation, and evaluation: A survey.arXiv preprint arXiv:2406.15126(2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.083171Z"},"links":{"cited_paper":"/paper/2406.15126","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:e65d56687ab313d38133cfad2fd4997b256a448cd03ac4d12fe986ebaa2a07a1","observation_id":"0df133c0-b627-4e3e-a31b-c5d7a15dd2a5","resolution":{"observed_at":"2026-08-16T11:51:08.083171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07931","last_updated":"2023-10-11T23:01:29Z","snapshot_observed_at":"2026-08-16T14:52:53.339262Z","submitted_at":"2023-10-11T23:01:29Z","title":"D2 Pruning: Message Passing for Balancing Diversity and Difficulty in Data Pruning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07931","snapshot_observed_at":"2026-08-16T11:51:08.086908Z","title":"D2 pruning: Message passing for balancing diversity and difficulty in data pruning.arXiv preprint arXiv:2310.07931(2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.086908Z"},"links":{"cited_paper":"/paper/2310.07931","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:bb8b1861a6c9c2a4754dcb08692ccc6e584f2342f3f63720f061d7cdbbc2392a","observation_id":"6c09618b-ff0e-4201-b6f6-6dc0bce9380b","resolution":{"observed_at":"2026-08-16T11:51:08.086908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.629407Z","title":"Generating training data with language models: Towards zero-shot language understanding.Advances in Neural Information Processing Systems 35 (2022), 462–477","venue":null,"work_id":"32ddb8fd-1574-4683-b3c2-4d92b006b89e","year":2022},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.090329Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:05f65290f6b0f02c3fa20dc8da61ab48df00697506795c6ec967d2206df4c2e8","observation_id":"669aee43-6090-41af-adad-b006da5ba596","resolution":{"observed_at":"2026-08-16T11:51:08.632797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1605.07725","last_updated":"2021-11-16T07:16:21Z","snapshot_observed_at":"2026-08-14T21:55:51.503935Z","submitted_at":"2016-05-25T04:25:45Z","title":"Adversarial Training Methods for Semi-Supervised Text Classification","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1605.07725","snapshot_observed_at":"2026-08-16T11:51:08.095357Z","title":"M., and Goodfellow, I","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.095357Z"},"links":{"cited_paper":"/paper/1605.07725","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:ed6e0a5981eef71840442af307df9172cd3e2886533d30ed6b2105a3d0aeb15a","observation_id":"41136fc9-8b1e-41f8-896a-721d62b72302","resolution":{"observed_at":"2026-08-16T11:51:08.095357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.618699Z","title":null,"venue":null,"work_id":"6db7ae28-5fd8-4e4f-8d5f-c84928c99484","year":2021},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.099008Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:e5e1d896fb13c9efa7a98e23b6aa3621556ab72986a815b49eaae134c59b9f9d","observation_id":"8bd8a733-d572-46af-bfc7-45b11a7119ce","resolution":{"observed_at":"2026-08-16T11:51:08.622714Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.609045Z","title":null,"venue":null,"work_id":"de03071c-8c4c-4188-9253-3bee78c92583","year":2020},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.102258Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:de6a12fa0ef67ad132357c08d763430862d0a2c6288502157fc818cdedd56223","observation_id":"d9b190b5-6c10-4934-a55d-a5cca7572fc1","resolution":{"observed_at":"2026-08-16T11:51:08.612386Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-08-09T14:52:01.161814Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-16T11:51:08.105722Z","title":"W., Borgeaud, S., Cai, T., Millican, K., Hoffmann, J., Song, F., Aslanides, J., Henderson, S., Ring, R., Young, S., et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.105722Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:2fbf06e5aedc14f4ebce42b66867d9eed447ec3cbd9f26f919d2904c5b0db6d7","observation_id":"1ec5d887-7e83-4b0e-97e3-5a99cdcfebcd","resolution":{"observed_at":"2026-08-16T11:51:08.105722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.598828Z","title":null,"venue":null,"work_id":"98a552c0-7805-4105-a903-245118f000e5","year":2020},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.109847Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:1ffc814ce81ce49a0a97bc6080ca960ccc618cc9ca1ea2d6f62cc25dd9338883","observation_id":"c68c4e5b-9d30-4ebd-a0b0-e49d91edb7e3","resolution":{"observed_at":"2026-08-16T11:51:08.602043Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.589001Z","title":"C., Yates, A., and de Rijke, M","venue":null,"work_id":"80606467-06a6-4279-b10c-ff0fef5f6b5c","year":2024},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.113362Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:7d80be44c6745b5928b1e41e41e12589986e4fd6abe66c174c83b579dd59d37a","observation_id":"c0facdb5-31c6-4bfd-ab7f-3a57ff010f28","resolution":{"observed_at":"2026-08-16T11:51:08.592315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.577979Z","title":"Data augmentation for intent classification with off-the-shelf large language models","venue":null,"work_id":"653c3d76-3e88-4301-8af6-2b5f9b59ad2c","year":2022},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.117280Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:8fd0ab4e76de31bb08f1a6289d577331e423e15f483bbeb91d698b3e3f59ff22","observation_id":"8f0aa3c1-cbd5-41ca-be46-58a8d2e5bb78","resolution":{"observed_at":"2026-08-16T11:51:08.581849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.567962Z","title":"Data sampling using locality sensitive hashing for large scale graph learning","venue":null,"work_id":"1424b71f-bfca-4a03-bbbe-e1e2f95c15d6","year":null},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.120594Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:7c3384db8738ab08268c003b93c2e8331d299c375fca7d81db10d478fb11db93","observation_id":"3c4dee17-4f95-445a-8f4e-5d330bc06f7a","resolution":{"observed_at":"2026-08-16T11:51:08.571528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.557227Z","title":"D., Agar w al, R., Anand, A., Patil, P., Garcia, X., Liu, P","venue":null,"work_id":"789a5e5d-f47a-4540-8324-678db4fb6e87","year":null},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.124500Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:9172ce8d29e5e4123dbce71dec54e282927e16962317357eb509b9568cbebbfa","observation_id":"57d61d7c-fe83-4a21-8c0d-7dce603f6c5b","resolution":{"observed_at":"2026-08-16T11:51:08.560940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.547519Z","title":"D., Ng, A","venue":null,"work_id":"f6292ae7-69c1-4cbb-bfde-8f06d5b42375","year":2013},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.128386Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:22ef31ecdcfab361febaf9c79fc683f01a14510c14f44808eadaa22b847f96f0","observation_id":"b77755a1-f023-4b12-b153-6053fbd5e54e","resolution":{"observed_at":"2026-08-16T11:51:08.550744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.535480Z","title":"Beyond neural scaling laws: beating power law scaling via data pruning.Advances in Neural Information Processing Systems 35 (2022), 19523–19536","venue":null,"work_id":"3e2f5c20-555c-4103-9239-2ad6693dbfd2","year":2022},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.131845Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:5cffc86557341b632db1d1414fb3b1a5b2ba927f66caa49a7c020e37673b1552","observation_id":"06faf962-7049-49a0-bc6f-ba494fad6058","resolution":{"observed_at":"2026-08-16T11:51:08.540406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.523669Z","title":"A., and Choi, Y","venue":null,"work_id":"f0ff4454-a132-4a3c-9106-c0ea3249ba98","year":2020},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.135437Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:3a86119754938ea014ce3c137c5609d8dff66426909f34052913ee774754395e","observation_id":"a96c1366-ad2d-450e-b0ad-0d3cfd38ba9e","resolution":{"observed_at":"2026-08-16T11:51:08.527042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04360","last_updated":"2023-04-10T18:47:51Z","snapshot_observed_at":"2026-08-16T15:49:55.918347Z","submitted_at":"2023-03-08T03:56:31Z","title":"Does Synthetic Data Generation of LLMs Help Clinical Text Mining?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04360","snapshot_observed_at":"2026-08-16T11:51:08.139093Z","title":"Does synthetic data generation of llms help clinical text mining? arXiv preprint arXiv:2303.04360(2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.139093Z"},"links":{"cited_paper":"/paper/2303.04360","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:32185129522e91baa895566e19ba2b121beaf55e5e9268870cf30d6d9c2e9742","observation_id":"a5659459-1dec-4c59-a7a7-8baf72d08f6f","resolution":{"observed_at":"2026-08-16T11:51:08.139093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09085","last_updated":"2022-11-16T18:06:33Z","snapshot_observed_at":"2026-08-17T08:35:32.078396Z","submitted_at":"2022-11-16T18:06:33Z","title":"Galactica: A Large Language Model for Science","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09085","snapshot_observed_at":"2026-08-16T11:51:08.142767Z","title":"Galactica: A large language model for science.arXiv preprint arXiv:2211.09085 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.142767Z"},"links":{"cited_paper":"/paper/2211.09085","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:25abccb73138f183f301bd2afd87999171fb7e7b04c23eb55fed56c885b48268","observation_id":"ffc2d71d-a451-4a42-adb6-e97f9494d257","resolution":{"observed_at":"2026-08-16T11:51:08.142767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-16T11:51:08.146552Z","title":"S., Love, J., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.146552Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:0e577010a4f0ff69183a0231a268d6d3d7abaafc5fc2ce7d351bebe457921735","observation_id":"bf97eb36-61a2-4330-a309-5b80212aba71","resolution":{"observed_at":"2026-08-16T11:51:08.146552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05159","last_updated":"2019-11-15T17:08:30Z","snapshot_observed_at":"2026-08-16T19:44:25.767623Z","submitted_at":"2018-12-12T21:24:15Z","title":"An Empirical Study of Example Forgetting during Deep Neural Network Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05159","snapshot_observed_at":"2026-08-16T11:51:08.150941Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.150941Z"},"links":{"cited_paper":"/paper/1812.05159","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:8b2cfa963b3018148b5be00d043fcc9e05698abb0bd39ffe639bd111f6a38e6a","observation_id":"62f3b55a-298d-487e-b64e-370fcb4a8bc5","resolution":{"observed_at":"2026-08-16T11:51:08.150941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.512120Z","title":null,"venue":null,"work_id":"fa3280a6-2242-4617-ba04-9fa228ea25ab","year":2017},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.155145Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:5004c32910edb28c1d0a8db7c9e235cc74db1e191cc951bdfa26f63b294db417","observation_id":"bc3956b4-e7b6-432f-9376-9648279bdcbc","resolution":{"observed_at":"2026-08-16T11:51:08.515861Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.11196","last_updated":"2019-08-25T23:11:07Z","snapshot_observed_at":"2026-08-14T17:23:13.764826Z","submitted_at":"2019-01-31T03:20:52Z","title":"EDA: Easy Data Augmentation Techniques for Boosting Performance on Text Classification Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.11196","snapshot_observed_at":"2026-08-16T11:51:08.158794Z","title":"Eda: Easy data augmentation techniques for boosting performance on text classification tasks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.158794Z"},"links":{"cited_paper":"/paper/1901.11196","citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:044507ff863af1cc669b2313008c895f033567b85ad70d2aa7f3a18283489b16","observation_id":"ae77f300-536b-4e93-8141-8eb35c251e3a","resolution":{"observed_at":"2026-08-16T11:51:08.158794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.500375Z","title":"Moderate coreset: A universal method of data selection for real-world data-efficient deep learning","venue":null,"work_id":"89302d06-d817-4de0-9af0-06d49215b800","year":2022},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.162524Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:1dba0a97863efc6825d5d8154fc8e1d017985667700ac9c2ab07a79950582fa0","observation_id":"95e5bd59-8602-4289-8c55-3bb83c2a223c","resolution":{"observed_at":"2026-08-16T11:51:08.504293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.489196Z","title":"Zerogen: Efficient zero-shot learning via dataset generation","venue":null,"work_id":"2200f5ae-10b0-48e4-a96b-45cddf4b34bd","year":2022},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.165769Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:aea7c59d2c623a1d89d7ee44372427d457e78096f9204690aef9e23a53f8ce21","observation_id":"f6f887e8-bde1-4530-aa0c-4178b7753cb1","resolution":{"observed_at":"2026-08-16T11:51:08.492913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.478243Z","title":"Coverage-centric coreset selection for high pruning rates","venue":null,"work_id":"b588b92a-6173-4af4-83db-c9578468a832","year":null},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.169240Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:6f400e4e4cf8e68c1e8b9fa78b8ed96a17b65d49bc17a2ab4a0d3ae875660c22","observation_id":"2a314016-d262-42a1-bb2a-1936e22a57d7","resolution":{"observed_at":"2026-08-16T11:51:08.481976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:51:08.466689Z","title":"Texygen: A benchmarking platform for text generation models","venue":null,"work_id":"7688041f-1ba2-43a5-9fd6-0e0d7938e380","year":2018},"citing_paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T11:51:08.173184Z"},"links":{"citing_paper":"/paper/2504.14508"},"observation_digest":"sha256:8d29a11ec9ae108a10c59fa719b7975d5ac0c2816f008a58e0d8a6832b2dd81d","observation_id":"9594c818-2160-41dd-a8c0-67582fb15c76","resolution":{"observed_at":"2026-08-16T11:51:08.470708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.14508","last_updated":"2025-07-24T18:36:49Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T07:58:09.346485Z","submitted_at":"2025-04-20T06:45:16Z","title":"Less is More: Adaptive Coverage for Synthetic Training Data"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2504.14508."}