{"as_of":"2026-08-08T03:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:685cfda52bfcce69538f5871dc53352f03ac40665d0ced084f4a7e1e20a650fd","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:44:34.145164Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T21:17:24.167881Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.06059","last_updated":"2024-01-11T17:24:49Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:24:49Z","title":"Investigating Data Contamination for Pre-training Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06059","snapshot_observed_at":"2026-08-07T14:44:34.145164Z","title":"Investigating Data Contamination for Pre-training Language Models.arXiv preprint arXiv:2401.06059,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18102","last_updated":"2026-05-30T13:29:55Z","snapshot_observed_at":"2026-08-07T14:33:15.240605Z","submitted_at":"2025-05-23T16:57:34Z","title":"CapBencher: Give Your LLM Benchmark a Built-in Alarm for Test-Set Overfitting","version":7},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:34.145164Z"},"links":{"cited_paper":"/paper/2401.06059","citing_paper":"/paper/2505.18102"},"observation_digest":"sha256:5cd66890b4dc15d66c2c516d28ce581d35bc036e01b9d926fffa268f5817b6c3","observation_id":"89a0abb8-07bf-4c42-a787-5cfdcd8e09cd","resolution":{"observed_at":"2026-08-07T14:44:34.145164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06059","last_updated":"2024-01-11T17:24:49Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:24:49Z","title":"Investigating Data Contamination for Pre-training Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06059","snapshot_observed_at":"2026-08-07T00:23:41.260222Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-07T00:15:23.993156Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:41.260222Z"},"links":{"cited_paper":"/paper/2401.06059","citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:b332f9298588808a8f45373e8f3976f270f320e3c6022627c89f8b443a17f90f","observation_id":"b460b024-0bbc-47a7-b8f4-f7159f6800f8","resolution":{"observed_at":"2026-08-07T00:23:41.260222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06059","last_updated":"2024-01-11T17:24:49Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:24:49Z","title":"Investigating Data Contamination for Pre-training Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06059","snapshot_observed_at":"2026-08-06T20:02:23.208794Z","title":"Kelly, M., Longjohn, R., and Nottingham, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03971","last_updated":"2025-07-05T09:39:07Z","snapshot_observed_at":"2026-08-06T19:55:58.115615Z","submitted_at":"2025-07-05T09:39:07Z","title":"Real-TabPFN: Improving Tabular Foundation Models via Continued Pre-training With Real-World Data","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T20:02:23.208794Z"},"links":{"cited_paper":"/paper/2401.06059","citing_paper":"/paper/2507.03971"},"observation_digest":"sha256:350f9f10e01f2a34ae8232e9c7ff9b544e83e7c3ad890c18b805fff6959e423c","observation_id":"367caea1-da5b-4b5a-98a1-cae7a28bf80c","resolution":{"observed_at":"2026-08-06T20:02:23.208794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06059","last_updated":"2024-01-11T17:24:49Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:24:49Z","title":"Investigating Data Contamination for Pre-training Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06059","snapshot_observed_at":"2026-08-06T14:51:53.769972Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.769972Z"},"links":{"cited_paper":"/paper/2401.06059","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:ae87d914d1b96793996bcb3f8c65d789f48326b1d13b4868b983821f81334bcc","observation_id":"ede787cc-e818-4db0-be20-9d383381e5f6","resolution":{"observed_at":"2026-08-06T14:51:53.769972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06059","last_updated":"2024-01-11T17:24:49Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:24:49Z","title":"Investigating Data Contamination for Pre-training Language Models","version":1},"cited_work":{"arxiv_id":"2401.06059","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06059","snapshot_observed_at":"2026-07-02T21:17:24.167881Z","title":"Sayash Kapoor and Arvind Narayanan","venue":null,"work_id":"c73162cf-f918-4be7-be6d-2702d58b0c12","year":2024},"citing_paper":{"arxiv_id":"2605.06865","last_updated":"2026-05-07T19:06:35Z","snapshot_observed_at":"2026-07-06T23:19:15.382283Z","submitted_at":"2026-05-07T19:06:35Z","title":"Dataset Watermarking for Closed LLMs with Provable Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T00:53:42.185498Z"},"links":{"cited_paper":"/paper/2401.06059","citing_paper":"/paper/2605.06865"},"observation_digest":"sha256:23c240e0006778db07a426b89417bb94fb8aeac92d8bb244c4f9126976e48f49","observation_id":"bd36c6b1-c8ed-4339-b358-6869b3900492","resolution":{"observed_at":"2026-05-11T05:00:57.277115Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06059","last_updated":"2024-01-11T17:24:49Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:24:49Z","title":"Investigating Data Contamination for Pre-training Language Models","version":1},"cited_work":{"arxiv_id":"2401.06059","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06059","snapshot_observed_at":"2026-07-02T21:17:24.167881Z","title":"Sayash Kapoor and Arvind Narayanan","venue":null,"work_id":"c73162cf-f918-4be7-be6d-2702d58b0c12","year":2024},"citing_paper":{"arxiv_id":"2605.19999","last_updated":"2026-05-19T15:33:16Z","snapshot_observed_at":"2026-07-06T23:30:39.512029Z","submitted_at":"2026-05-19T15:33:16Z","title":"LLM Benchmark Datasets Should Be Contamination-Resistant","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-20T07:19:50.354875Z"},"links":{"cited_paper":"/paper/2401.06059","citing_paper":"/paper/2605.19999"},"observation_digest":"sha256:571eafcffdc12c9e7b5c1e49f2094fda601d07e6bcb8cca5c2ca910664593119","observation_id":"b54ef219-da74-42cc-9569-2fe133ae6f25","resolution":{"observed_at":"2026-05-20T07:23:07.050056Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06059","last_updated":"2024-01-11T17:24:49Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:24:49Z","title":"Investigating Data Contamination for Pre-training Language Models","version":1},"cited_work":{"arxiv_id":"2401.06059","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06059","snapshot_observed_at":"2026-07-02T21:17:24.167881Z","title":"Sayash Kapoor and Arvind Narayanan","venue":null,"work_id":"c73162cf-f918-4be7-be6d-2702d58b0c12","year":2024},"citing_paper":{"arxiv_id":"2605.23628","last_updated":"2026-05-22T13:40:00Z","snapshot_observed_at":"2026-07-06T23:33:49.013121Z","submitted_at":"2026-05-22T13:40:00Z","title":"How Hard is it to Rig a Benchmark? A Social Choice Analysis of Leaderboard Robustness","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-25T04:37:01.537128Z"},"links":{"cited_paper":"/paper/2401.06059","citing_paper":"/paper/2605.23628"},"observation_digest":"sha256:38a63486806bc568a281d608e61be9c463f0f52dfd20f1ad342105d5535986fd","observation_id":"5377c182-e0ca-4f62-8394-9bcfe8a2581a","resolution":{"observed_at":"2026-05-25T04:40:24.421044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06059","last_updated":"2024-01-11T17:24:49Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:24:49Z","title":"Investigating Data Contamination for Pre-training Language Models","version":1},"cited_work":{"arxiv_id":"2401.06059","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06059","snapshot_observed_at":"2026-07-02T21:17:24.167881Z","title":"Sayash Kapoor and Arvind Narayanan","venue":null,"work_id":"c73162cf-f918-4be7-be6d-2702d58b0c12","year":2024},"citing_paper":{"arxiv_id":"2605.26161","last_updated":"2026-05-24T14:59:12Z","snapshot_observed_at":"2026-08-02T04:25:25.218976Z","submitted_at":"2026-05-24T14:59:12Z","title":"TSFMAudit: Data Contamination Auditing in Forecasting Time Series Foundation Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T12:00:05.807004Z"},"links":{"cited_paper":"/paper/2401.06059","citing_paper":"/paper/2605.26161"},"observation_digest":"sha256:3fb9dc6e53fd74cd8b54527d967e8f3f52be16c93fd39a5d270600aa66d14208","observation_id":"20189093-0b97-45f4-8f59-facd5b977006","resolution":{"observed_at":"2026-06-30T12:04:38.792275Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06059","last_updated":"2024-01-11T17:24:49Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:24:49Z","title":"Investigating Data Contamination for Pre-training Language Models","version":1},"cited_work":{"arxiv_id":"2401.06059","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06059","snapshot_observed_at":"2026-07-02T21:17:24.167881Z","title":"Sayash Kapoor and Arvind Narayanan","venue":null,"work_id":"c73162cf-f918-4be7-be6d-2702d58b0c12","year":2024},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-06-30T20:49:34Z","snapshot_observed_at":"2026-08-02T23:02:11.703134Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":1},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-06-30T01:16:16.834861Z"},"links":{"cited_paper":"/paper/2401.06059","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:bae0bd71efb566d5aa6fcce38831dcfcd66d2617f43d4495214e6c7195eebd83","observation_id":"f0e50035-da39-45b2-a795-5de66d88e973","resolution":{"observed_at":"2026-07-01T15:45:47.570680Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06059","last_updated":"2024-01-11T17:24:49Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:24:49Z","title":"Investigating Data Contamination for Pre-training Language Models","version":1},"cited_work":{"arxiv_id":"2401.06059","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06059","snapshot_observed_at":"2026-07-02T21:17:24.167881Z","title":"Sayash Kapoor and Arvind Narayanan","venue":null,"work_id":"c73162cf-f918-4be7-be6d-2702d58b0c12","year":2024},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-06-30T20:49:34Z","snapshot_observed_at":"2026-08-02T23:02:11.703134Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":2},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-07-02T21:10:10.548489Z"},"links":{"cited_paper":"/paper/2401.06059","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:8623fc108e0b68e3d9e9134cc6d87f7404339aa2c0babccbfc523117d13da311","observation_id":"d690820f-a685-4ea9-92b7-ecfc5e511bf7","resolution":{"observed_at":"2026-07-02T21:17:24.169298Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2401.06059/citation-record","integrity":"/paper/2401.06059/integrity","json":"/paper/2401.06059/citation-record.json","paper":"/paper/2401.06059"},"outbound":[],"paper":{"arxiv_id":"2401.06059","last_updated":"2024-01-11T17:24:49Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:24:49Z","title":"Investigating Data Contamination for Pre-training Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2401.06059."}