{"as_of":"2026-08-06T01:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1048acf7a77285e76612f6c60e7d78b34d3838ed73091a4b093aed0378cf04ea","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T02:43:30.851915Z","state":"measured"},{"denominator":97,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":97,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":55,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:49:28.053975Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T03:05:54.898931Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2309.16671","last_updated":"2025-11-23T00:34:43Z","snapshot_observed_at":"2026-08-02T18:24:11.208164Z","submitted_at":"2023-09-28T17:59:56Z","title":"Demystifying CLIP Data","version":6},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-16T09:20:20.143143Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2309.16671"},"observation_digest":"sha256:87322a2fec29057a5ab66caa42af4c5b1dd5e5f98bc9ca3e2dba35441e3eee8a","observation_id":"7a654118-a066-45ff-801b-85b2abf1a3ce","resolution":{"observed_at":"2026-05-18T02:43:31.136179Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2311.05232","last_updated":"2024-11-19T12:42:45Z","snapshot_observed_at":"2026-07-06T16:45:07.733095Z","submitted_at":"2023-11-09T09:25:37Z","title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T02:46:26.957539Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2311.05232"},"observation_digest":"sha256:6316a64f5eef9f471dd6bbdeabd62039c506818090c18fb1d69de34c8672c0c7","observation_id":"56603f20-79b0-4fbe-825b-073ce33b7e26","resolution":{"observed_at":"2026-05-18T02:43:31.136179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T22:58:16.523267Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2406.11794"},"observation_digest":"sha256:e4d15e744797f1deb7b144730d5a744c850c8607b0d8efafd7eb3e1aa47c7e27","observation_id":"eb1926ce-29fb-4140-9034-5f0997793082","resolution":{"observed_at":"2026-05-18T02:43:31.136179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:8317afe0ffdf0dfb733a5ebd1ebdc8c9f74834eb7c6aa7f149c12e04d2d66148","observation_id":"0e70f842-e46f-40ce-ba63-ef807efa0db2","resolution":{"observed_at":"2026-05-23T07:42:43.028054Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T23:38:44.933410Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2501.03575"},"observation_digest":"sha256:be2f13bbb8a3236ee8d6cf63a823cf52f3124083595eb89e6de140e7ad369964","observation_id":"b9eddad2-76cb-4889-99c8-a678007a23f1","resolution":{"observed_at":"2026-05-18T02:43:31.136179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2504.21850","last_updated":"2026-05-14T18:32:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-30T17:57:22Z","title":"Visual Compositional Tuning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T17:39:09.890605Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2504.21850"},"observation_digest":"sha256:d707a0b2517e0795b5bd0ef6c0646e18bd30df9f08632d0fdf9f795c1dc6da90","observation_id":"e0795f52-1851-4ac4-af42-a314ead5094a","resolution":{"observed_at":"2026-05-22T17:41:53.217487Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-05T22:45:13.273853Z","title":"Abbas, K","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06464","last_updated":"2025-08-08T17:13:00Z","snapshot_observed_at":"2026-08-05T22:45:10.445034Z","submitted_at":"2025-08-08T17:13:00Z","title":"Observation of momentum dependent charge density wave gap in EuTe4","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T22:45:13.273853Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2508.06464"},"observation_digest":"sha256:a1f5d1bd3b3146b9f434b49985c1249ae81d7cfbf2c65ce69361fb9f8d7fe407","observation_id":"d5708344-a6f6-4b26-bc61-e7994cb237fd","resolution":{"observed_at":"2026-08-05T22:45:13.273853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2508.06471","last_updated":"2025-08-08T17:21:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-08T17:21:06Z","title":"GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T17:50:08.399160Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2508.06471"},"observation_digest":"sha256:882f2c1c097c6260b031d822ea81d7cbaffaa2337f082ec96199c7938887fc44","observation_id":"7ceb9955-1eff-422b-bdc5-bdbbd660508a","resolution":{"observed_at":"2026-05-18T02:43:31.136179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-05T20:20:18.864970Z","title":"Semd- edup: Data-efficient learning at web-scale through semantic deduplication.arXiv preprint arXiv:2303.09540, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-05T20:20:17.745021Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:18.864970Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:e95ac2dfe06a367c88b174b64c51920e61cd62bc84ded4a1be09761c57591ab1","observation_id":"abf23093-d4ad-4e32-b2da-982c4241e377","resolution":{"observed_at":"2026-08-05T20:20:18.864970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-05T20:17:43.197057Z","title":"Semd- edup: Data-efficient learning at web-scale through semantic deduplication.arXiv preprint arXiv:2303.09540, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10860","last_updated":"2025-08-14T17:31:18Z","snapshot_observed_at":"2026-08-05T20:17:37.670071Z","submitted_at":"2025-08-14T17:31:18Z","title":"From Black Box to Transparency: Enhancing Automated Interpreting Assessment with Explainable AI in College Classrooms","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T20:17:43.197057Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2508.10860"},"observation_digest":"sha256:9cb05c47d8fcc4d2904358513d6ffd3d89096ea67fb0d352aae6cd39ab1c51d7","observation_id":"bda9249e-cc91-4adf-8d95-7b7126f08580","resolution":{"observed_at":"2026-08-05T20:17:43.197057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-05T20:00:05.141967Z","title":"Amro Abbas, Kushal Tirumala, Dániel Simig, Surya Ganguli, and Ari S Morcos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11551","last_updated":"2025-08-18T06:38:38Z","snapshot_observed_at":"2026-08-05T19:58:29.896587Z","submitted_at":"2025-08-15T15:53:09Z","title":"ADMIRE-BayesOpt: Accelerated Data MIxture RE-weighting for Language Models with Bayesian Optimization","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T20:00:05.141967Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2508.11551"},"observation_digest":"sha256:ecc39ca9e949ffdd90d8f879fe3ee68622ad423b3cadc2a247e3c8732134d537","observation_id":"22f8f90b-1709-44f4-ae2e-c6d3cb420cde","resolution":{"observed_at":"2026-08-05T20:00:05.141967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2509.07177","last_updated":"2026-04-14T15:07:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-08T19:48:52Z","title":"Towards EnergyGPT: A Large Language Model Specialized for the Energy Sector","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-18T17:39:17.456350Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2509.07177"},"observation_digest":"sha256:96915d84cd5eeacfffb226a9015fb58fdc5dc79744426605a9c70c3c3a991c1b","observation_id":"7b1d06e5-1a62-44b3-9566-c19ce246a926","resolution":{"observed_at":"2026-05-18T17:42:47.531586Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-04T11:16:07.290510Z","title":"Semdedup: Data-efficient learning at web-scale through semantic deduplication","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.06048","last_updated":"2026-06-18T04:28:50Z","snapshot_observed_at":"2026-08-04T11:16:05.008855Z","submitted_at":"2025-10-07T15:42:33Z","title":"BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining","version":5},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T11:16:07.290510Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2510.06048"},"observation_digest":"sha256:ac36664e8c50192c1759a048165687a105f8ae21deb1d7a58d4ccd23d9ca41b1","observation_id":"a578da8f-7bdf-432b-b468-a9c935287318","resolution":{"observed_at":"2026-08-04T11:16:07.290510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-02T21:05:24.115917Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.21492","last_updated":"2026-07-18T04:56:29Z","snapshot_observed_at":"2026-08-04T06:06:14.689327Z","submitted_at":"2026-02-25T01:54:50Z","title":"GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T21:05:24.115917Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2602.21492"},"observation_digest":"sha256:bb598e5ffd4b671042fd752062ab1ecac5e192a852e2d7b639a44f1d21192196","observation_id":"db87846b-ce37-4318-8e2e-29ac50f1256c","resolution":{"observed_at":"2026-08-02T21:05:24.115917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-03T02:34:18.469510Z","title":"Semd- edup: Data-efficient learning at web-scale through semantic deduplication.arXiv preprint arXiv:2303.09540,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.17205","last_updated":"2026-07-30T22:57:15Z","snapshot_observed_at":"2026-08-05T23:10:24.761664Z","submitted_at":"2026-03-17T23:11:45Z","title":"OPERA: Online Data Pruning for Efficient Retrieval Model Adaptation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T02:34:18.469510Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2603.17205"},"observation_digest":"sha256:7ec262adaf7c7e388b815b49ac4fe4e1cd75939c3f6d14c00d99f67ca53d8682","observation_id":"6a076bfc-d7e4-4297-9cae-ce3c43c2bed7","resolution":{"observed_at":"2026-08-03T02:34:18.469510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2604.02852","last_updated":"2026-06-02T07:24:24Z","snapshot_observed_at":"2026-07-13T13:44:33.559220Z","submitted_at":"2026-04-03T08:13:42Z","title":"Dependency-Guided Repository-Level C-to-Rust Translation with Reinforcement Alignment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T20:11:37.809779Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2604.02852"},"observation_digest":"sha256:b463e7e49f9ea04c3c936c877f05b647d6f43ab1ba757e5b47bae5457a877a16","observation_id":"a5ceac82-a63d-4ee4-b4d7-01ff14cf9f1f","resolution":{"observed_at":"2026-05-18T02:43:31.136179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2604.08366","last_updated":"2026-04-09T15:33:00Z","snapshot_observed_at":"2026-07-06T22:57:26.678728Z","submitted_at":"2026-04-09T15:33:00Z","title":"Scaling-Aware Data Selection for End-to-End Autonomous Driving Systems","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T17:22:25.943097Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2604.08366"},"observation_digest":"sha256:9db34e448aa14ed711dc48c7ecbaa11b8d4ec2686a239e1596eae7eda6b6ca15","observation_id":"c0043179-7b28-40b5-a8d4-f1c3219614ee","resolution":{"observed_at":"2026-05-18T02:43:31.136179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2604.16197","last_updated":"2026-07-19T20:58:40Z","snapshot_observed_at":"2026-08-02T16:12:05.608942Z","submitted_at":"2026-04-17T16:07:11Z","title":"Sketching the Readout of Large Language Models for Scalable Data Attribution and Valuation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T08:47:36.122054Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2604.16197"},"observation_digest":"sha256:c075b0c04294c741660ce1bc5f6f59e347f280a085035051b01f474277a0732f","observation_id":"bbdaaea8-69c8-46ff-8bf7-fc72cb93678f","resolution":{"observed_at":"2026-05-18T02:43:31.136179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-02T16:12:07.050501Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.16197","last_updated":"2026-07-19T20:58:40Z","snapshot_observed_at":"2026-08-02T16:12:05.608942Z","submitted_at":"2026-04-17T16:07:11Z","title":"Sketching the Readout of Large Language Models for Scalable Data Attribution and Valuation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T16:12:07.050501Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2604.16197"},"observation_digest":"sha256:4a3c0895d2b5893e33ef27a389c2213fdabc498ea5974e1760aed330b6c67a9f","observation_id":"7c133f93-81b5-47d2-baea-1979faef2fcf","resolution":{"observed_at":"2026-08-02T16:12:07.050501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2604.24762","last_updated":"2026-04-27T17:59:19Z","snapshot_observed_at":"2026-08-04T10:58:19.065767Z","submitted_at":"2026-04-27T17:59:19Z","title":"OmniShotCut: Holistic Relational Shot Boundary Detection with Shot-Query Transformer","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T04:15:20.045060Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2604.24762"},"observation_digest":"sha256:4bd59d823a00733d817e7fff67cad3382cad407f9ef90f32f3baa10e88143db1","observation_id":"8f10cd03-abb9-42b5-80e8-66aa52fc159f","resolution":{"observed_at":"2026-05-18T02:43:31.136179Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2604.27932","last_updated":"2026-07-06T18:35:13Z","snapshot_observed_at":"2026-08-03T15:17:09.790227Z","submitted_at":"2026-04-30T14:33:23Z","title":"Dynamic Cluster Data Sampling for Efficient and Long-Tail-Aware Vision-Language Pre-training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-07T07:38:06.792354Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2604.27932"},"observation_digest":"sha256:05ff91ca052145973cc26e3b43d23e41ac1e2897e8c9c991756d95e69a2f74b5","observation_id":"1c4321e5-fa04-4f6d-9cc4-11c37ca767b4","resolution":{"observed_at":"2026-05-18T02:43:31.136179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-12T17:58:20.310804Z","title":"SemDeDup: Data-Efficient Learning at Web-Scale through Semantic Deduplication.CoRR, abs/2303.09540, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.27932","last_updated":"2026-07-06T18:35:13Z","snapshot_observed_at":"2026-08-03T15:17:09.790227Z","submitted_at":"2026-04-30T14:33:23Z","title":"Dynamic Cluster Data Sampling for Efficient and Long-Tail-Aware Vision-Language Pre-training","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T17:58:20.310804Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2604.27932"},"observation_digest":"sha256:3e78aebc0fa60ce75ed6f72474079fe27464d3714805c4b63bc4e65f0a1360d6","observation_id":"a6e2f7e2-49a6-48d9-8a63-e0936aca0c7d","resolution":{"observed_at":"2026-07-12T17:58:20.310804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2605.02757","last_updated":"2026-05-04T15:57:07Z","snapshot_observed_at":"2026-07-06T23:15:46.390406Z","submitted_at":"2026-05-04T15:57:07Z","title":"Seeing Realism from Simulation: Efficient Video Transfer for Vision-Language-Action Data Augmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T18:21:00.089755Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2605.02757"},"observation_digest":"sha256:1e0d0564bb8f1760cf7daf798fcab52f768f38f0812494fdd2f550146bc41028","observation_id":"52482ce6-60e6-4f05-ae26-7fb125db894b","resolution":{"observed_at":"2026-05-18T02:43:31.136179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2605.05807","last_updated":"2026-05-07T07:44:32Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:44:32Z","title":"LCC-LLM: Leveraging Code-Centric Large Language Models for Malware Attribution","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-08T09:34:17.991210Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2605.05807"},"observation_digest":"sha256:2776a4b220fc3485a1b7127dfca0043ade8894fb8616ff495f3d5bbcef2dd6aa","observation_id":"e739ec78-41bb-458d-af55-dcea0c82baad","resolution":{"observed_at":"2026-05-18T02:43:31.136179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2605.09611","last_updated":"2026-05-10T15:48:38Z","snapshot_observed_at":"2026-07-06T23:21:39.966502Z","submitted_at":"2026-05-10T15:48:38Z","title":"Byte-Exact Deduplication in Retrieval-Augmented Generation: A Three-Regime Empirical Analysis Across Public Benchmarks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T04:18:11.836537Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2605.09611"},"observation_digest":"sha256:cbf0a59acf075b2db17efb988c691eeb503b48ac6c2c6a99c7dac789b365b12b","observation_id":"882241d9-2a3a-442a-b73f-d76712b90320","resolution":{"observed_at":"2026-05-18T02:43:31.136179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2605.09990","last_updated":"2026-05-11T05:06:59Z","snapshot_observed_at":"2026-07-06T23:21:59.096464Z","submitted_at":"2026-05-11T05:06:59Z","title":"Merlin: Deterministic Byte-Exact Deduplication for Lossless Context Optimization in Large Language Model Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T04:11:02.387702Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2605.09990"},"observation_digest":"sha256:85291e837f090669d8eab4ca19b771147a574bcbc9a9b731a20bf694eefd0bc6","observation_id":"98168528-4398-4209-bf99-3e97ed42533e","resolution":{"observed_at":"2026-05-18T02:43:31.136179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2605.11405","last_updated":"2026-05-13T01:55:26Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T01:51:03Z","title":"20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T02:52:43.674969Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2605.11405"},"observation_digest":"sha256:1fed4379fc8442622b20283108f7ec6bdf4d9996204d18c2c3424d18a6071d21","observation_id":"c020a851-11bd-4fae-b922-8f8a56233559","resolution":{"observed_at":"2026-05-18T02:43:31.136179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2605.11405","last_updated":"2026-05-13T01:55:26Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T01:51:03Z","title":"20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T21:28:37.680681Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2605.11405"},"observation_digest":"sha256:d6e2cfbb5de51dce8c1e855ddc8efac191889d1fcdcde52f38d3c3a8f726b55a","observation_id":"cf391306-1819-4edd-a43c-fff9af88bcfe","resolution":{"observed_at":"2026-05-18T02:43:31.136179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2605.12944","last_updated":"2026-05-13T03:27:21Z","snapshot_observed_at":"2026-07-06T23:24:32.412966Z","submitted_at":"2026-05-13T03:27:21Z","title":"From Instance Selection to Fixed-Pool Data Recipe Search for Supervised Fine-Tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-14T20:37:55.057366Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2605.12944"},"observation_digest":"sha256:e5f85c326fcf3a79979f5009acb5bfb8a4eeba88950ace98c38fb28a28311cd4","observation_id":"d0531286-0e3e-4904-8937-38e1a997ae38","resolution":{"observed_at":"2026-05-18T02:43:31.136179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2605.15691","last_updated":"2026-05-15T07:26:54Z","snapshot_observed_at":"2026-07-06T23:26:56.013191Z","submitted_at":"2026-05-15T07:26:54Z","title":"SEED: Targeted Data Selection by Weighted Independent Set","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T20:30:26.760966Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2605.15691"},"observation_digest":"sha256:1b596bd90dff08040cfdf9f05a02f084b19f244f1a1b45b7e842838b96ce17c6","observation_id":"33138ea3-0324-430c-bd94-425776252452","resolution":{"observed_at":"2026-05-20T20:33:43.425550Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2605.17003","last_updated":"2026-05-19T05:34:27Z","snapshot_observed_at":"2026-08-02T04:36:32.238740Z","submitted_at":"2026-05-16T14:01:12Z","title":"Learning-Zone Energy: Online Data Selection for Efficient RL Post-Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T20:43:30.568426Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2605.17003"},"observation_digest":"sha256:0a4113a2b39ed0e51a6032c9f53e24459be5078b5ca79c51c2685052c0f32977","observation_id":"4f95897e-e80e-49dd-a12b-95bcd04d0e16","resolution":{"observed_at":"2026-05-19T20:47:45.940371Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2605.17003","last_updated":"2026-05-19T05:34:27Z","snapshot_observed_at":"2026-08-02T04:36:32.238740Z","submitted_at":"2026-05-16T14:01:12Z","title":"Learning-Zone Energy: Online Data Selection for Efficient RL Post-Training","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T15:50:07.539126Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2605.17003"},"observation_digest":"sha256:1cd9a56edea82110e09b8c4d169f49b83526f2a088122ba95e7e776d983c3b35","observation_id":"4c86244a-8bc4-4c27-ac94-d3f2b5c137e0","resolution":{"observed_at":"2026-05-20T15:53:34.051859Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2605.30337","last_updated":"2026-05-28T17:59:01Z","snapshot_observed_at":"2026-07-06T23:39:38.845840Z","submitted_at":"2026-05-28T17:59:01Z","title":"Efficient Test-Time Finetuning of LLMs via Convex Reconstruction and Gradient Caching","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T08:58:52.511363Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2605.30337"},"observation_digest":"sha256:24b1274f834792b73435a1dcaffaa39c29a52530de82671c6c61e598cf4a3332","observation_id":"9c6d314d-864c-4065-b193-0b4734d71f3d","resolution":{"observed_at":"2026-06-29T09:03:15.952192Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2606.03001","last_updated":"2026-06-11T15:51:58Z","snapshot_observed_at":"2026-07-06T23:43:17.879245Z","submitted_at":"2026-06-02T01:16:26Z","title":"FOLD: Fuzzy Online Deduplication for Very Large Evolving Datasets via Approximate Nearest Neighbor Search","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T08:47:10.776607Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2606.03001"},"observation_digest":"sha256:440ffe8cb6775fec1ef52fbc99a8019d8faa1ad90bce5b66fe32d5bbc975802a","observation_id":"ab06eb7a-cf7b-4681-9a08-ada2a9a0f2d0","resolution":{"observed_at":"2026-07-02T04:56:38.516269Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2606.09393","last_updated":"2026-06-08T12:09:20Z","snapshot_observed_at":"2026-07-06T23:48:44.159537Z","submitted_at":"2026-06-08T12:09:20Z","title":"CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T17:21:38.543724Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2606.09393"},"observation_digest":"sha256:5b6613be551146263cae08d96c585eda1f7ee6186402604184aa2c88e7f3ec51","observation_id":"27be32af-fdc8-4748-aee9-1921639968fc","resolution":{"observed_at":"2026-07-03T00:17:29.045891Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2606.19411","last_updated":"2026-07-22T05:04:50Z","snapshot_observed_at":"2026-08-05T15:18:52.281424Z","submitted_at":"2026-06-17T15:40:25Z","title":"Spectral DPPs via NEPv: A Scalable Continuous Relaxation of Determinantal MAP for Diversity-Aware Data Selection","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-26T21:24:19.251394Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2606.19411"},"observation_digest":"sha256:02272a61b278d2598507950f87a3937c9709d7e647be3de4f52c0a49db23117f","observation_id":"e1264c3d-cdd0-4af4-83f9-8a2e5250c371","resolution":{"observed_at":"2026-07-04T00:09:15.452495Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-02T11:03:31.117996Z","title":"Abbas, K","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.19411","last_updated":"2026-07-22T05:04:50Z","snapshot_observed_at":"2026-08-05T15:18:52.281424Z","submitted_at":"2026-06-17T15:40:25Z","title":"Spectral DPPs via NEPv: A Scalable Continuous Relaxation of Determinantal MAP for Diversity-Aware Data Selection","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-02T11:03:31.117996Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2606.19411"},"observation_digest":"sha256:342a7dbd0abc0d470e84cad7b4b2e977e2bdd485888797cc4a2486990c68de98","observation_id":"37c3e924-37df-4d94-8be3-fe6c85b4240d","resolution":{"observed_at":"2026-08-02T11:03:31.117996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2606.23611","last_updated":"2026-06-22T17:11:15Z","snapshot_observed_at":"2026-07-06T23:58:20.975630Z","submitted_at":"2026-06-22T17:11:15Z","title":"Data Selection Through Iterative Self-Filtering for Vision-Language Settings","version":1},"reference_index":198,"source":"arxiv_source","source_observed_at":"2026-06-26T09:22:47.537137Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2606.23611"},"observation_digest":"sha256:ae512ce522b090de4830ed256550ec8cd69f2061ec8fed948a11bdd36b7c6383","observation_id":"fc999ce1-5ff3-4498-acad-934b39329afa","resolution":{"observed_at":"2026-07-04T09:49:44.939906Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2606.24998","last_updated":"2026-06-23T16:02:40Z","snapshot_observed_at":"2026-07-31T12:51:11.444875Z","submitted_at":"2026-06-23T16:02:40Z","title":"Internal Data Repetition Destroys Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T00:12:56.745617Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2606.24998"},"observation_digest":"sha256:48229400081ef34c11878e58576c47b018e7aaa60598893ba74397c84382b405","observation_id":"343c1e77-656d-4b42-b7c4-be5481a6c922","resolution":{"observed_at":"2026-07-04T16:49:57.920684Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2606.26091","last_updated":"2026-06-24T17:59:02Z","snapshot_observed_at":"2026-08-02T03:35:37.854415Z","submitted_at":"2026-06-24T17:59:02Z","title":"On-Policy Self-Distillation with Sampled Demonstrations Reduces Output Diversity","version":1},"reference_index":219,"source":"arxiv_source","source_observed_at":"2026-06-25T19:23:56.452083Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2606.26091"},"observation_digest":"sha256:cb9fbd7f43e9236ba6253d1cfe7d4bf5439fcbb747334c2ad03969deaeb4e43c","observation_id":"fc002790-8709-48f1-a8be-0407e7d4a515","resolution":{"observed_at":"2026-07-04T20:50:12.672694Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-06-30T20:49:34Z","snapshot_observed_at":"2026-08-02T23:02:11.703134Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T01:16:16.834861Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:00dafbe48756273ab520610864ac7259c796fe99a1d0c71aca5cfb0da049f94e","observation_id":"c28c49e0-8801-47b1-bd2c-b8f6a024ef55","resolution":{"observed_at":"2026-07-01T15:45:47.674763Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-06-30T20:49:34Z","snapshot_observed_at":"2026-08-02T23:02:11.703134Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-02T21:10:10.548489Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:6cf86547af8e514c96e11a9eb87ed7bcdd6fc003f371fd1e00c0536c087ec109","observation_id":"6e93af41-3080-4578-a7da-f416cd7b35bc","resolution":{"observed_at":"2026-07-02T21:17:24.184389Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-12T08:12:18.373103Z","title":"Semd- edup: Data-efficient learning at web-scale through semantic deduplication.arXiv preprint arXiv:2303.09540, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02637","last_updated":"2026-07-02T15:34:46Z","snapshot_observed_at":"2026-08-02T18:06:42.028681Z","submitted_at":"2026-07-02T15:34:46Z","title":"Post-Generation Curation of Synthetic Images via Homogeneous-Heterogeneous Splitting","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T08:12:18.373103Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2607.02637"},"observation_digest":"sha256:81b111374b19f038459e98c8defa85c0142b8ee94c3fe7e455a15ff6b76f92c2","observation_id":"bd0cdebc-125f-4f48-9fbe-23c03c040cf9","resolution":{"observed_at":"2026-07-12T08:12:18.373103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":"2303.09540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-09T03:05:54.898931Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","venue":"cs.LG","work_id":"492d4320-a8d4-4094-b226-ea8d784560d9","year":2023},"citing_paper":{"arxiv_id":"2607.07676","last_updated":"2026-07-08T17:34:28Z","snapshot_observed_at":"2026-08-04T22:55:13.068885Z","submitted_at":"2026-07-08T17:34:28Z","title":"SkillCenter: A Large-Scale Source-Grounded Skill Library for Autonomous AI Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-09T03:01:02.743557Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2607.07676"},"observation_digest":"sha256:1243c57b815a6f50e1c648563180f66064035efe310e0cef4b64642a39f65868","observation_id":"0af70ae9-48db-4b46-8b74-70a17fe2b2df","resolution":{"observed_at":"2026-07-09T03:05:54.902117Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-01T15:47:24.451264Z","title":"Abbas, K","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18187","last_updated":"2026-07-20T17:26:21Z","snapshot_observed_at":"2026-08-01T15:47:22.733574Z","submitted_at":"2026-07-20T17:26:21Z","title":"EVOLVE: Efficient Learned Volume Compression with Variable-Rate Encoding on a Cross-Domain Database","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T15:47:24.451264Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2607.18187"},"observation_digest":"sha256:c85ee64a2bc1323c0c32349f5afaebc39071467f2492b342a1a6280f4280da26","observation_id":"aa346b65-ce5d-4cf2-8fad-8c632312ac05","resolution":{"observed_at":"2026-08-01T15:47:24.451264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-01T13:54:02.554746Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18960","last_updated":"2026-07-21T10:52:04Z","snapshot_observed_at":"2026-08-04T11:51:44.579147Z","submitted_at":"2026-07-21T10:52:04Z","title":"SFGA: A Statistics-First Gating Architecture with Adjudicative Escalation for Trustworthy SFT Data Procurement","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T13:54:02.554746Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2607.18960"},"observation_digest":"sha256:68391179010cf7c649bbe3fb573aaeb9d39aef5bf9442b8da0793c9293f35e0f","observation_id":"b95a5126-7051-43c7-bcff-f81e33897d1f","resolution":{"observed_at":"2026-08-01T13:54:02.554746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-01T12:48:57.775587Z","title":"arXiv preprint arXiv:2303.09540 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19315","last_updated":"2026-07-23T10:08:22Z","snapshot_observed_at":"2026-08-03T02:08:06.743176Z","submitted_at":"2026-07-21T17:32:44Z","title":"ERank in Latent Space as an Image-Complexity and Richness Measure","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T12:48:57.775587Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2607.19315"},"observation_digest":"sha256:66e475c0e807633ea9a1453f7ecba1192f20cbae80a22d8b4dad84e08d0d1c12","observation_id":"a0d384c3-d9b3-4fee-b3c9-81cbd79ea600","resolution":{"observed_at":"2026-08-01T12:48:57.775587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-01T12:03:18.730783Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19704","last_updated":"2026-07-22T03:06:57Z","snapshot_observed_at":"2026-08-03T19:16:52.195856Z","submitted_at":"2026-07-22T03:06:57Z","title":"Efficient Clustering with Provable Guardrails for LLM Inference at Scale","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T12:03:18.730783Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2607.19704"},"observation_digest":"sha256:653f7628a0d5fb6302b10e6e07d42b1b7b342a17329655f9798529a1c4354f19","observation_id":"eaa89fd6-bc11-4481-9074-7021985d5ca2","resolution":{"observed_at":"2026-08-01T12:03:18.730783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-01T06:35:55.211257Z","title":", month = mar, year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21842","last_updated":"2026-07-23T22:12:17Z","snapshot_observed_at":"2026-08-05T10:19:10.523612Z","submitted_at":"2026-07-23T22:12:17Z","title":"Quantifying Political Partisanship for Cross-Platform Analyses","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-08-01T06:35:55.211257Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2607.21842"},"observation_digest":"sha256:d30aea9cd573f9aa2453a6fada601f5d0c270d275f6795bd49b098c10b6fab30","observation_id":"fe94ea21-d860-4b77-917d-e67234c7ae7a","resolution":{"observed_at":"2026-08-01T06:35:55.211257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-02T09:40:05.998274Z","title":"Semd- edup: Data-efficient learning at web-scale through semantic deduplication.arXiv preprint arXiv:2303.09540, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22662","last_updated":"2026-06-29T03:25:36Z","snapshot_observed_at":"2026-08-02T09:40:00.460587Z","submitted_at":"2026-06-29T03:25:36Z","title":"CuraWeb: Joint Optimization of Quality, Redundancy, and Diversity for Web-Scale Pretraining Data","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T09:40:05.998274Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2607.22662"},"observation_digest":"sha256:d325189f6d93bd3803964a60268142c49ed54cffffee217d55549de190233907","observation_id":"07fc7818-d002-450e-8dad-7a3a2fe0cb40","resolution":{"observed_at":"2026-08-02T09:40:05.998274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-01T20:38:39.461207Z","title":"Semd- edup: Data-efficient learning at web-scale through semantic deduplication.arXiv preprint arXiv:2303.09540, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22697","last_updated":"2026-07-18T00:28:57Z","snapshot_observed_at":"2026-08-05T00:16:16.665332Z","submitted_at":"2026-07-18T00:28:57Z","title":"Test-Time Coverage: Test-Conditioned Data Curation for Deployment-Aware Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T20:38:39.461207Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2607.22697"},"observation_digest":"sha256:b01dbc00e555b9dbd7544b389fa1ffc253ea36dcd587cf3b80f5ebf8e371c4ba","observation_id":"ae45f9b0-e326-4c0e-a994-8fac5c950c0f","resolution":{"observed_at":"2026-08-01T20:38:39.461207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-31T23:11:41.807439Z","title":"URL https://arxiv","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24063","last_updated":"2026-07-29T12:23:50Z","snapshot_observed_at":"2026-08-05T04:01:18.376783Z","submitted_at":"2026-07-27T07:05:11Z","title":"The Cost of Knowing: A Resource-Aware Protocol for Benchmarking Hallucination Beyond Static Leaderboards","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-31T23:11:41.807439Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2607.24063"},"observation_digest":"sha256:6cdf372666e3b05877f9dfba57a802919e08fee891cec9ca59af4121022a3e07","observation_id":"5a638c42-bf40-419d-b036-6f1bd6e4af2b","resolution":{"observed_at":"2026-07-31T23:11:41.807439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-31T18:01:58.885997Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24332","last_updated":"2026-07-27T12:09:03Z","snapshot_observed_at":"2026-08-05T03:57:40.267753Z","submitted_at":"2026-07-27T12:09:03Z","title":"Cross-Attention Calibrated Deduplication for Retrieval-Augmented Generation System","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T18:01:58.885997Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2607.24332"},"observation_digest":"sha256:89eaa3343c3d366184bbad41593e7ccf3af7d8cb3d8bb72b3f59fb963049d65a","observation_id":"72e12bea-8f70-47bf-b73b-7a04007c8e71","resolution":{"observed_at":"2026-07-31T18:01:58.885997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-07-31T07:01:45.831154Z","title":"arXiv preprint arXiv:2303.09540 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24717","last_updated":"2026-07-27T17:54:12Z","snapshot_observed_at":"2026-07-31T07:01:40.912045Z","submitted_at":"2026-07-27T17:54:12Z","title":"DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-31T07:01:45.831154Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2607.24717"},"observation_digest":"sha256:a58ba27b95c1c34a44c280ebb27ee25078669fe2fecd33fbc7f9830e5ff952f6","observation_id":"42e4ad28-8321-4542-88aa-779814434f49","resolution":{"observed_at":"2026-07-31T07:01:45.831154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-05T23:49:28.053975Z","title":"Mor- cos","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03199","last_updated":"2026-08-04T06:41:14Z","snapshot_observed_at":"2026-08-06T00:57:08.270332Z","submitted_at":"2026-08-04T06:41:14Z","title":"SieveIVF: Threshold-Aware IVF Execution for Large-Scale Training Data Deduplication","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:28.053975Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2608.03199"},"observation_digest":"sha256:895df74cc57b3be716d7cf621c07be2b460923b6416c5196b0ab2f6111a1e6dc","observation_id":"b63f527b-06a3-44c0-bc34-3042e658b3bc","resolution":{"observed_at":"2026-08-05T23:49:28.053975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2303.09540/citation-record","integrity":"/paper/2303.09540/integrity","json":"/paper/2303.09540/citation-record.json","paper":"/paper/2303.09540"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":"1712.00409","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-07-04T18:40:03.351817Z","title":"Deep Learning Scaling is Predictable, Empirically","venue":"cs.LG","work_id":"3638ccb4-3a4f-460e-8b6f-867a65922801","year":2017},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:4017d194b8071a81e35a512ed49c6f3eb6bb4c00ffa3ea053061f94180afcdfb","observation_id":"fbbaf43a-42d7-42a1-9153-fcf769dc874e","resolution":{"observed_at":"2026-05-18T02:43:30.962598Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:7487be97ae4ca17be86fc37bf682e022cc193c3eb801fcf32b427749502ee928","observation_id":"eddd037d-29d9-4c1f-aa04-64c3abfeec7c","resolution":{"observed_at":"2026-05-18T02:43:30.953138Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14701","last_updated":"2020-11-06T04:16:36Z","snapshot_observed_at":"2026-07-06T10:09:17.078776Z","submitted_at":"2020-10-28T02:17:24Z","title":"Scaling Laws for Autoregressive Generative Modeling","version":2},"cited_work":{"arxiv_id":"2010.14701","doi":"10.48550/arxiv.2010.14701","metadata_source":"pith","pith_arxiv_id":"2010.14701","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Autoregressive Generative Modeling","venue":"cs.LG","work_id":"1f180c21-02d6-4b11-9dfc-08d7f0d8fc81","year":2020},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"cited_paper":"/paper/2010.14701","citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:40ca1c3a5dcc3b4376974fe546e5dfa4caf92bcc6d945be54b949d659c001203","observation_id":"04ac98cc-c2ef-4394-b8f8-adedc883d169","resolution":{"observed_at":"2026-05-18T02:43:30.910350Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f9c5e67a-1d10-43fb-8140-f7af687845f6","year":2020},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:3871c11953cb7d46f51ffa21fb45ab26f763734a25459b811110eb15e657e68b","observation_id":"fe7e26a0-72cc-4de6-aed5-68c99aec58e5","resolution":{"observed_at":"2026-05-18T02:43:31.124807Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"590a44c5-86c4-4302-8bdf-abeda6d71a41","year":2021},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:29a2db87418b175167364688a53105140725afc7ad57cfac98c6b51a9dd37d4b","observation_id":"f8ee2e64-1b42-4583-a6a3-bb3f6b6d983e","resolution":{"observed_at":"2026-05-18T02:43:31.092754Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.01293","last_updated":"2021-02-02T04:07:38Z","snapshot_observed_at":"2026-08-01T22:46:19.170916Z","submitted_at":"2021-02-02T04:07:38Z","title":"Scaling Laws for Transfer","version":1},"cited_work":{"arxiv_id":"2102.01293","doi":"10.48550/arxiv.2102.01293","metadata_source":"pith","pith_arxiv_id":"2102.01293","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Transfer","venue":"cs.LG","work_id":"c58fc635-4090-4314-adf6-b45af9da58e5","year":2021},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"cited_paper":"/paper/2102.01293","citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:35bfde6ebec4495d04a92000ef54485a1168844fb0973820518bc02b2e358aab","observation_id":"4f7956d5-30d3-4bdc-a97a-4cafcd4111a4","resolution":{"observed_at":"2026-05-18T02:43:30.917635Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04560","last_updated":"2022-06-20T09:13:51Z","snapshot_observed_at":"2026-08-04T23:08:49.433171Z","submitted_at":"2021-06-08T17:47:39Z","title":"Scaling Vision Transformers","version":2},"cited_work":{"arxiv_id":"2106.04560","doi":"10.48550/arxiv.2106.04560","metadata_source":"arxiv_reference","pith_arxiv_id":"2106.04560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling vision transform- ers, 6 2021","venue":"arXiv (Cornell University)","work_id":"bed1e12d-8db3-4995-a609-386387c6cb86","year":2022},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"cited_paper":"/paper/2106.04560","citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:c7e3f6d0a37d32236e53a1e59c4256eb28ad96796f31eaf88b21b97204cadf97","observation_id":"92127002-de8e-4a05-a473-dd172a74731b","resolution":{"observed_at":"2026-05-18T02:43:30.924882Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":"2203.15556","doi":"10.1098/rsta.2024.0522","metadata_source":"pith","pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Compute-Optimal Large Language Models","venue":"cs.CL","work_id":"b2faf28d-86b7-429c-bc42-469458efc246","year":2022},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:da66348167b9fbbd304604568ec18d807db43a4d0aeec3782766c8b934f427f2","observation_id":"b9fcbaf5-5361-4f22-b31a-8a9fb04123ae","resolution":{"observed_at":"2026-05-18T02:43:30.936629Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Radford, J","venue":null,"work_id":"0183533f-8f89-4bd5-8d2c-01322d79b721","year":2021},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:67eb9e7410a64893374b3cdef039066edf54d55e1822d16c6200fb6d0cae89c2","observation_id":"9b06290b-8bf0-4b03-8d58-eeb8336b1542","resolution":{"observed_at":"2026-05-18T02:43:31.088902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.5143773","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ilharco, M","venue":"Zenodo (CERN European Organization for Nuclear Research)","work_id":"564dbf7c-d36d-4604-a76f-f485274a2431","year":2021},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:d4fa8221e1d68b21719493c2c6f18c2ef805d63d9961aa96c32fab9591b00825","observation_id":"49382cbf-c36c-40b7-861c-c6d92d655d57","resolution":{"observed_at":"2026-05-18T02:43:30.894462Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-03T20:38:15.624002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T20:38:15.624002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.03728","last_updated":"2023-01-10T00:20:06Z","snapshot_observed_at":"2026-07-06T14:39:50.174490Z","submitted_at":"2023-01-10T00:20:06Z","title":"Scaling Laws for Generative Mixed-Modal Language Models","version":1},"cited_work":{"arxiv_id":"2301.03728","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.03728","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aghajanyan, L","venue":null,"work_id":"22042a59-e502-4dd1-8288-7f2de7d5f7af","year":2023},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"cited_paper":"/paper/2301.03728","citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:546021bbc39c6cc1c0dda204cdbf5aca6a7c82c618c322558777f3aaf007617a","observation_id":"4ee0f99b-0c8a-4725-b376-5ae32e847e59","resolution":{"observed_at":"2026-05-18T02:43:30.945174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sorscher, R","venue":null,"work_id":"a650de24-a2a9-497a-8e9c-4512cc938273","year":2022},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:e118d4322781af892179861f24e0fcb55f09244a5b3ec52703eba23450273668","observation_id":"7e6391a8-47f3-46d3-935a-9937fb41a99a","resolution":{"observed_at":"2026-05-18T02:43:31.099419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02280","last_updated":"2023-03-29T19:05:14Z","snapshot_observed_at":"2026-07-06T14:37:51.682439Z","submitted_at":"2023-01-05T19:48:01Z","title":"Filtering, Distillation, and Hard Negatives for Vision-Language Pre-Training","version":2},"cited_work":{"arxiv_id":"2301.02280","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.02280","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Radenovic, A","venue":null,"work_id":"4084e244-27b4-46f1-8ad5-c82b92a73231","year":2023},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"cited_paper":"/paper/2301.02280","citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:369a2220648cca0ca5c90c61ed22a1edd28e819649d4fba6cfcb48da318310d7","observation_id":"4ecb5562-ebcf-4ef4-94a6-a306928f8503","resolution":{"observed_at":"2026-05-18T02:43:30.975522Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Feldman and C","venue":null,"work_id":"ab5bcba8-5984-48b5-9ba9-5f189b27745e","year":2020},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:50b886689f1a0d9346ccadae53cea6dd1bcf52d17426a3ce6c70328498cf91f3","observation_id":"212b4a2c-9dc4-4c3a-81d1-bfb77ddc6895","resolution":{"observed_at":"2026-05-18T02:43:31.106509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"06829855-21c7-405d-89c3-889ca384180b","year":2022},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:e04bb6aab8f12713eecd9e5faa9b8f658821a1837f7fe09fa288b38703c1e854","observation_id":"cb691896-08bb-416c-9c6f-7849020269ac","resolution":{"observed_at":"2026-05-18T02:43:31.111633Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Thomee, D","venue":null,"work_id":"b27c127d-1cab-416d-b8fe-536e07b228d2","year":2016},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:c63a5a58806808e8981cf1dc5e18486dd406309cc7411c9c50d10130f5381e5e","observation_id":"cb40eb35-0bee-4a9b-b580-41c1472faa89","resolution":{"observed_at":"2026-05-18T02:43:31.115147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10683","last_updated":"2023-09-19T15:14:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-23T17:37:36Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","version":4},"cited_work":{"arxiv_id":"1910.10683","doi":"10.18653/v1/2020.acl-main.259","metadata_source":"pith","pith_arxiv_id":"1910.10683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","venue":"cs.LG","work_id":"50e3b368-0243-4726-8186-233869802ad1","year":2019},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"cited_paper":"/paper/1910.10683","citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:72b4ff2700790a32f04f427a18b18b9cf2bad4e8a4d736169696d6fcdcda6df7","observation_id":"95cb8fc8-526f-452b-974f-fcea895aa607","resolution":{"observed_at":"2026-05-18T02:43:30.986575Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/sequen","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T12:43:25.311407Z","title":null,"venue":null,"work_id":"dea1eb9a-5f55-4c9e-befa-7ee96a1ada25","year":1997},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:fe14dbeb0dcde61c6d00ddd74babefa8e864206428ea0fe0a95807a4250b1b5d","observation_id":"1215d54e-47e0-45d4-be76-76f8ea86d9ce","resolution":{"observed_at":"2026-05-18T02:43:30.901402Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":"2112.11446","doi":"10.48550/arxiv.2112.11446","metadata_source":"pith","pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","venue":"cs.CL","work_id":"47ce8be9-e500-407d-af41-ac2d132215eb","year":2021},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:e9d646cf4ee4b3044031c845d8e6ecc86b9a625a17fe88f7070d33d34547be54","observation_id":"9cbee578-f996-4883-a3b1-854a6b011109","resolution":{"observed_at":"2026-05-18T02:43:30.993489Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06539","last_updated":"2022-12-20T05:21:40Z","snapshot_observed_at":"2026-07-06T12:37:25.512398Z","submitted_at":"2022-02-14T08:20:15Z","title":"Deduplicating Training Data Mitigates Privacy Risks in Language Models","version":3},"cited_work":{"arxiv_id":"2202.06539","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2202.06539","snapshot_observed_at":"2026-07-03T00:57:30.314629Z","title":"Kandpal, E","venue":null,"work_id":"3ae8f9ae-1809-495c-91a2-31ba604fe54b","year":2022},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"cited_paper":"/paper/2202.06539","citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:b658bfe972390db2d96c7463d06877600ee24901a724b179f89146df0ef51177","observation_id":"e2b7a3c8-f4b2-4687-98b0-ec217425aba5","resolution":{"observed_at":"2026-05-18T02:43:30.998986Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Silcock, L","venue":null,"work_id":"06e5b4dd-60ce-42d8-8117-5e29ed199614","year":2022},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:a01fffea5d95920f346d70e201c9f3cd7aef3cda566dc2a12d846df7dcb90dc8","observation_id":"ddd6b781-2c34-4d49-84ed-578ef8776976","resolution":{"observed_at":"2026-05-18T02:43:31.046679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Choi, D.-S","venue":null,"work_id":"a0a50afb-8357-4d12-9a10-7252b1d95937","year":2022},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:2ac80eb5c4a80f4118e437ecfedb1c8a2f5538e5cf8bf3dbc9109519ad7f3924","observation_id":"a05ca3fa-0728-4ea0-91aa-d7db3f24a2e8","resolution":{"observed_at":"2026-05-18T02:43:31.052965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2572b85d-bbce-4d32-ab7e-17433a93a013","year":2022},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:8809b683cf46a6ded464e8c2ff45be64304da7bee51032ad7a9e03b0a9e29a4b","observation_id":"9be7c67a-0906-446a-9795-72a88e2d5781","resolution":{"observed_at":"2026-05-18T02:43:31.056898Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"060d6d32-e024-4a9e-82c5-ef792daf8921","year":2016},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:e16e3b83e09627ad64f9163cd1800c37c8ee175ffbd2bcec1f2f4a23f4a55c86","observation_id":"25da8f1f-86ee-439a-8908-934f09fb5cd6","resolution":{"observed_at":"2026-05-18T02:43:31.060775Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Toneva, A","venue":null,"work_id":"2fbb3cb0-50f4-4b95-a225-fd9b87f5945f","year":2019},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:b3ccc87001bd5b8e3576ef335c69241e18e6f7d8a93ef9a7d524cd361697d189","observation_id":"49aabebd-4d26-4307-a6dc-2b22a25c6172","resolution":{"observed_at":"2026-05-18T02:43:31.063931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bee0bb0b-0d2b-4575-9dd1-96bea03652f1","year":2021},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:9aebcd46cfdbb03d5235721ed44fbd5a900f66b750c7607bfb8c8cb0e4671350","observation_id":"0ec7ba31-4032-42e2-b230-e4689252b933","resolution":{"observed_at":"2026-05-18T02:43:31.068290Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chitta, J","venue":null,"work_id":"0218fc64-c948-4f15-9fb5-a0c1d5467890","year":2021},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:1dfc461ae180c87df15875b1550934e4b568e97743e264f4b816642270a04d22","observation_id":"a4db4bfe-f73d-4aea-8c5d-131b6a52482a","resolution":{"observed_at":"2026-05-18T02:43:31.073701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meding, L","venue":null,"work_id":"4e2ee96c-e168-4e03-8653-dfc1402e3eea","year":2022},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:38efdeed54a6d7a17f1d12b31ebf1b68a360b7f6e25646d658f068ea1ee91a22","observation_id":"c20a0248-8826-4576-bfca-b6a1bb6b35e2","resolution":{"observed_at":"2026-05-18T02:43:31.077222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Radford, J","venue":null,"work_id":"aa759d53-f146-4b48-a25a-a854c790f8f7","year":2021},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:52cc6b523db889ce38937ae83ac5fada49bfee43702274ca884b64acc9f09944","observation_id":"2bb7a542-0053-41e1-bd2f-5d1d34a3da84","resolution":{"observed_at":"2026-05-18T02:43:31.081104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:5dd194f5cc8e2a8c159a772c0900a27d498219e0e1aad23573797bdbdfa06191","observation_id":"ab09c90c-ca7b-4bf0-b2d9-b879472102fa","resolution":{"observed_at":"2026-05-18T02:43:31.004497Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":"2010.11929","doi":"10.1175/jcli-d-22-0357.1","metadata_source":"pith","pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":"cs.CV","work_id":"e96730e3-129b-4db6-b981-15ab7932e297","year":2020},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:3bf322ac758b602c0e41c108be15c28859be8472f6affeb06bd39c5694572ffb","observation_id":"091c23c2-de76-4a8e-9d6e-7a6febe8b33c","resolution":{"observed_at":"2026-05-18T02:43:31.010332Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08402","last_updated":"2022-10-16T00:08:18Z","snapshot_observed_at":"2026-07-29T21:51:47.064287Z","submitted_at":"2022-10-16T00:08:18Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","version":1},"cited_work":{"arxiv_id":"2210.08402","doi":"10.48550/arxiv.2210.08402","metadata_source":"pith","pith_arxiv_id":"2210.08402","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","venue":"cs.CV","work_id":"1d19deb4-3043-409d-b901-f047c51a323b","year":2022},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"cited_paper":"/paper/2210.08402","citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:3149b00c43c607cb05fdac3af0e3614e019a377dd6790e451af236f40ef738a8","observation_id":"f05fd2a2-c021-45a3-ba80-f642ef162a4b","resolution":{"observed_at":"2026-05-18T02:43:31.016105Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":"2111.02114","doi":"10.48550/arxiv.2111.02114","metadata_source":"pith","pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","venue":"cs.CV","work_id":"fbf16034-512e-4dd9-a0bd-7ddd23f532a6","year":2021},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:2a6af57aa2c872b2e566f8fb05498c5a6f54abadf289bddd246cd7bfa454fe25","observation_id":"34c60957-c447-4157-a0eb-bfde02f75fec","resolution":{"observed_at":"2026-05-18T02:43:31.021105Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:40.426779+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:40.426779+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vaswani, N","venue":null,"work_id":"6804b561-3f4c-4d4a-b53d-5efc004c0eff","year":2017},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:04681bd7ae9741e91e452d9764fcbe2abcdce55e9fc485a06deae2fbaa6b568a","observation_id":"3c85f498-2a22-4638-8696-82be58802e2d","resolution":{"observed_at":"2026-05-18T02:43:31.128541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:56293107231d3d789fb3c8ee4f46e94c09c321874c23c0ee63428b2400958d3a","observation_id":"9e9b0568-156a-4472-8a24-0f86c97e5754","resolution":{"observed_at":"2026-05-18T02:43:31.026617Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hendrycks, K","venue":null,"work_id":"7e52b701-fdd6-4fd7-b9af-0f0fa95a1166","year":2021},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:e59d6835ae3265b7268bc0e61d29d74a700a9f508efd6458eb82eddf39ccb95a","observation_id":"84e0b3de-1ce5-4d5c-a42a-9ee85c38e37a","resolution":{"observed_at":"2026-05-18T02:43:31.085198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hendrycks, S","venue":null,"work_id":"240be9ce-d1e7-4699-89c0-fe81f60b6bc0","year":2021},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:7162c4bdb471326dfeff83277a244c48a485972e1bf9edb0d73de9a6dadbbd07","observation_id":"c3c23342-f23c-4b55-b2e9-63560c84c994","resolution":{"observed_at":"2026-05-18T02:43:31.095917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c739adb6-d904-4b0b-9845-646ca6a96dc4","year":2019},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:b456158ddb6941162b8602b64806a16b556e81e0ba6c883f9c501cba788fe129","observation_id":"7c500fe9-c3f4-4fd2-9f3d-57118e2afffc","resolution":{"observed_at":"2026-05-18T02:43:31.102946Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recht, R","venue":null,"work_id":"d58fc754-0a36-4c7b-920f-4b10586b955f","year":2019},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:81d2e7d52a9774e860b4d950419564bd8e14e6f1d2e0d82abb22f49e398cc340","observation_id":"058f8a7d-34b5-4e8d-9c6c-bc839f570ca5","resolution":{"observed_at":"2026-05-18T02:43:31.121100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Barbu, D","venue":null,"work_id":"4c997de9-0bbf-4828-81a9-465acdb8e68e","year":2019},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:221d0766bfde8714813221c9e944916eac8331c3b5e530009db51a61a1c1aef6","observation_id":"23b92a66-b16d-4b00-b070-1a07645c7ade","resolution":{"observed_at":"2026-05-18T02:43:31.134690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06499","last_updated":"2022-03-24T19:29:45Z","snapshot_observed_at":"2026-08-05T18:30:13.997811Z","submitted_at":"2021-07-14T06:06:52Z","title":"Deduplicating Training Data Makes Language Models Better","version":2},"cited_work":{"arxiv_id":"2107.06499","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.06499","snapshot_observed_at":"2026-07-09T03:05:54.907820Z","title":"Deduplicating Training Data Makes Language Models Better","venue":"cs.CL","work_id":"7b9b24f2-6013-4e4a-be6b-ce3aeef64aa8","year":2021},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"cited_paper":"/paper/2107.06499","citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:2677ff29c3b96b83a71b0697a09dcb47b97b4bc813116bda001069a6eeb0c349","observation_id":"ed33ab4b-c15c-46a9-8b8b-2576f9ca0438","resolution":{"observed_at":"2026-05-18T02:43:31.036373Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.12017","last_updated":"2023-01-30T05:25:59Z","snapshot_observed_at":"2026-08-02T23:44:31.455796Z","submitted_at":"2022-12-22T19:56:09Z","title":"OPT-IML: Scaling Language Model Instruction Meta Learning through the Lens of Generalization","version":3},"cited_work":{"arxiv_id":"2212.12017","doi":"10.48550/arxiv.2212.12017","metadata_source":"pith","pith_arxiv_id":"2212.12017","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OPT-IML: Scaling Language Model Instruction Meta Learning through the Lens of Generalization","venue":"cs.CL","work_id":"dd464d2b-4adb-40de-9148-c19470e7533b","year":2022},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"cited_paper":"/paper/2212.12017","citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:e7cdf81ac1c2ad3368306bff2451f099e35048373bb760a1e5e9730ab3e100b8","observation_id":"29bdad5d-433f-4eec-bbac-4775631e3b2f","resolution":{"observed_at":"2026-05-18T02:43:31.041915Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":7,"verified_exact":18,"verified_fuzzy":15},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 55 inbound Pith citation observations for arXiv:2303.09540."}