{"as_of":"2026-08-08T23:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e2491475ba10e042d9c932600b28f7e01747f7c373d5d7254bb42c32d90f7b27","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T13:11:51.730776Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T13:16:58.130004Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.03923","last_updated":"2024-11-06T13:54:08Z","snapshot_observed_at":"2026-08-07T09:59:12.000905Z","submitted_at":"2024-11-06T13:54:08Z","title":"Evaluation data contamination in LLMs: how do we measure it and (when) does it matter?","version":1},"cited_work":{"arxiv_id":"2411.03923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.03923","snapshot_observed_at":"2026-07-02T13:16:58.130004Z","title":"Evaluation data contamination in llms: how do we measure it and (when) does it matter?","venue":null,"work_id":"8112fca7-038b-400f-9ab7-c18c1ffb3c10","year":2024},"citing_paper":{"arxiv_id":"2406.19314","last_updated":"2025-04-18T19:36:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-27T16:47:42Z","title":"LiveBench: A Challenging, Contamination-Limited LLM Benchmark","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T04:48:26.303240Z"},"links":{"cited_paper":"/paper/2411.03923","citing_paper":"/paper/2406.19314"},"observation_digest":"sha256:bde608fa121ebf876427a2094d01035d82b84ca8c3b50c25de0cf390f0bff8ed","observation_id":"bb55b6ed-45c0-445b-a95d-ebfd06e968c7","resolution":{"observed_at":"2026-05-15T04:48:26.481297Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03923","last_updated":"2024-11-06T13:54:08Z","snapshot_observed_at":"2026-08-07T09:59:12.000905Z","submitted_at":"2024-11-06T13:54:08Z","title":"Evaluation data contamination in LLMs: how do we measure it and (when) does it matter?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03923","snapshot_observed_at":"2026-08-08T13:11:51.730776Z","title":"K., Kocyigit, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07316","last_updated":"2025-05-21T13:38:27Z","snapshot_observed_at":"2026-08-08T13:05:11.787794Z","submitted_at":"2025-02-11T07:26:50Z","title":"CodeI/O: Condensing Reasoning Patterns via Code Input-Output Prediction","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T13:11:51.730776Z"},"links":{"cited_paper":"/paper/2411.03923","citing_paper":"/paper/2502.07316"},"observation_digest":"sha256:aa4ffacd801f967aa668e341a0d8bddf433fa55dce26cd6bf7a9cec8c7c709c2","observation_id":"78b94966-d4c8-42f7-95be-366900a8aa7b","resolution":{"observed_at":"2026-08-08T13:11:51.730776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03923","last_updated":"2024-11-06T13:54:08Z","snapshot_observed_at":"2026-08-07T09:59:12.000905Z","submitted_at":"2024-11-06T13:54:08Z","title":"Evaluation data contamination in LLMs: how do we measure it and (when) does it matter?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03923","snapshot_observed_at":"2026-08-06T18:03:26.695956Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09255","last_updated":"2025-07-12T11:29:44Z","snapshot_observed_at":"2026-08-08T09:10:31.239439Z","submitted_at":"2025-07-12T11:29:44Z","title":"StockSim: A Dual-Mode Order-Level Simulator for Evaluating Multi-Agent LLMs in Financial Markets","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T18:03:26.695956Z"},"links":{"cited_paper":"/paper/2411.03923","citing_paper":"/paper/2507.09255"},"observation_digest":"sha256:900d4231e7ae43f45450e06970ef1673403c5f75e13e961963a2f90386506a9e","observation_id":"9d1eb138-e830-4a39-bfb2-be530c42a6d8","resolution":{"observed_at":"2026-08-06T18:03:26.695956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03923","last_updated":"2024-11-06T13:54:08Z","snapshot_observed_at":"2026-08-07T09:59:12.000905Z","submitted_at":"2024-11-06T13:54:08Z","title":"Evaluation data contamination in LLMs: how do we measure it and (when) does it matter?","version":1},"cited_work":{"arxiv_id":"2411.03923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.03923","snapshot_observed_at":"2026-07-02T13:16:58.130004Z","title":"Evaluation data contamination in llms: how do we measure it and (when) does it matter?","venue":null,"work_id":"8112fca7-038b-400f-9ab7-c18c1ffb3c10","year":2024},"citing_paper":{"arxiv_id":"2509.19590","last_updated":"2026-05-16T01:07:51Z","snapshot_observed_at":"2026-07-06T22:30:36.671861Z","submitted_at":"2025-09-23T21:29:04Z","title":"Position: AI Evaluations Should be Grounded on a Theory of Capability","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-21T21:57:55.834632Z"},"links":{"cited_paper":"/paper/2411.03923","citing_paper":"/paper/2509.19590"},"observation_digest":"sha256:de6ef52aaa71524607a0d0a1e148b31e7fdddee4c642e1813285b00a28106871","observation_id":"e2a72f36-9d7c-4e11-a269-6549549feb13","resolution":{"observed_at":"2026-05-21T22:00:41.475033Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03923","last_updated":"2024-11-06T13:54:08Z","snapshot_observed_at":"2026-08-07T09:59:12.000905Z","submitted_at":"2024-11-06T13:54:08Z","title":"Evaluation data contamination in LLMs: how do we measure it and (when) does it matter?","version":1},"cited_work":{"arxiv_id":"2411.03923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.03923","snapshot_observed_at":"2026-07-02T13:16:58.130004Z","title":"Evaluation data contamination in llms: how do we measure it and (when) does it matter?","venue":null,"work_id":"8112fca7-038b-400f-9ab7-c18c1ffb3c10","year":2024},"citing_paper":{"arxiv_id":"2604.17842","last_updated":"2026-04-20T05:51:50Z","snapshot_observed_at":"2026-08-04T02:34:16.438625Z","submitted_at":"2026-04-20T05:51:50Z","title":"QuickScope: Certifying Hard Questions in Dynamic LLM Benchmarks","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-10T04:27:11.735657Z"},"links":{"cited_paper":"/paper/2411.03923","citing_paper":"/paper/2604.17842"},"observation_digest":"sha256:7764c200a9683e33059d081f7b31ae499236e743a8e293b2082dc451a0c66f7b","observation_id":"ca0e5472-5a92-4f1e-80c4-6a08e2760cb1","resolution":{"observed_at":"2026-05-11T11:56:29.688964Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03923","last_updated":"2024-11-06T13:54:08Z","snapshot_observed_at":"2026-08-07T09:59:12.000905Z","submitted_at":"2024-11-06T13:54:08Z","title":"Evaluation data contamination in LLMs: how do we measure it and (when) does it matter?","version":1},"cited_work":{"arxiv_id":"2411.03923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.03923","snapshot_observed_at":"2026-07-02T13:16:58.130004Z","title":"Evaluation data contamination in llms: how do we measure it and (when) does it matter?","venue":null,"work_id":"8112fca7-038b-400f-9ab7-c18c1ffb3c10","year":2024},"citing_paper":{"arxiv_id":"2605.02442","last_updated":"2026-05-04T10:42:26Z","snapshot_observed_at":"2026-07-30T10:52:38.632184Z","submitted_at":"2026-05-04T10:42:26Z","title":"Measuring AI Reasoning: A Guide for Researchers","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-08T18:53:18.586923Z"},"links":{"cited_paper":"/paper/2411.03923","citing_paper":"/paper/2605.02442"},"observation_digest":"sha256:6bc305ffb8c6976e7dba97d62defee97919a17e5becf0f1f90c2cef10f5d5045","observation_id":"60f42c4b-1ba6-476c-a6b6-5419dd0d799f","resolution":{"observed_at":"2026-05-09T06:05:36.930166Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03923","last_updated":"2024-11-06T13:54:08Z","snapshot_observed_at":"2026-08-07T09:59:12.000905Z","submitted_at":"2024-11-06T13:54:08Z","title":"Evaluation data contamination in LLMs: how do we measure it and (when) does it matter?","version":1},"cited_work":{"arxiv_id":"2411.03923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.03923","snapshot_observed_at":"2026-07-02T13:16:58.130004Z","title":"Evaluation data contamination in llms: how do we measure it and (when) does it matter?","venue":null,"work_id":"8112fca7-038b-400f-9ab7-c18c1ffb3c10","year":2024},"citing_paper":{"arxiv_id":"2605.06865","last_updated":"2026-05-07T19:06:35Z","snapshot_observed_at":"2026-07-06T23:19:15.382283Z","submitted_at":"2026-05-07T19:06:35Z","title":"Dataset Watermarking for Closed LLMs with Provable Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T00:53:42.185498Z"},"links":{"cited_paper":"/paper/2411.03923","citing_paper":"/paper/2605.06865"},"observation_digest":"sha256:14d05803b5c9ec9ff43771e634b3d357d069ad3bc7d03958ac0cc453714db8e5","observation_id":"09cbb8ab-6e55-4a22-91c5-76b151197650","resolution":{"observed_at":"2026-05-11T05:00:57.253215Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03923","last_updated":"2024-11-06T13:54:08Z","snapshot_observed_at":"2026-08-07T09:59:12.000905Z","submitted_at":"2024-11-06T13:54:08Z","title":"Evaluation data contamination in LLMs: how do we measure it and (when) does it matter?","version":1},"cited_work":{"arxiv_id":"2411.03923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.03923","snapshot_observed_at":"2026-07-02T13:16:58.130004Z","title":"Evaluation data contamination in llms: how do we measure it and (when) does it matter?","venue":null,"work_id":"8112fca7-038b-400f-9ab7-c18c1ffb3c10","year":2024},"citing_paper":{"arxiv_id":"2605.24213","last_updated":"2026-05-22T20:54:30Z","snapshot_observed_at":"2026-08-02T06:58:01.300783Z","submitted_at":"2026-05-22T20:54:30Z","title":"Towards Evaluation Engineering: An Empirical Study of ML Evaluation Harnesses in the Wild","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-30T14:41:07.354007Z"},"links":{"cited_paper":"/paper/2411.03923","citing_paper":"/paper/2605.24213"},"observation_digest":"sha256:113009c36bf572a97230146894c80593da612d28818bb2f6a2fe661d3c8671d1","observation_id":"c3d3fcce-b28a-408a-bbfd-68acd20b10e8","resolution":{"observed_at":"2026-06-30T14:44:45.153124Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03923","last_updated":"2024-11-06T13:54:08Z","snapshot_observed_at":"2026-08-07T09:59:12.000905Z","submitted_at":"2024-11-06T13:54:08Z","title":"Evaluation data contamination in LLMs: how do we measure it and (when) does it matter?","version":1},"cited_work":{"arxiv_id":"2411.03923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.03923","snapshot_observed_at":"2026-07-02T13:16:58.130004Z","title":"Evaluation data contamination in llms: how do we measure it and (when) does it matter?","venue":null,"work_id":"8112fca7-038b-400f-9ab7-c18c1ffb3c10","year":2024},"citing_paper":{"arxiv_id":"2606.31991","last_updated":"2026-06-30T17:29:04Z","snapshot_observed_at":"2026-07-07T00:05:37.068846Z","submitted_at":"2026-06-30T17:29:04Z","title":"Amplifying Membership Signal Through Chained Regeneration","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-01T06:22:08.140403Z"},"links":{"cited_paper":"/paper/2411.03923","citing_paper":"/paper/2606.31991"},"observation_digest":"sha256:45e53c95ad07af9996797c5cfb294acce635fa1098448d00e62120e351f806b0","observation_id":"a8712fb1-cb99-4579-95f3-03c93b80a763","resolution":{"observed_at":"2026-07-01T09:45:39.288910Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03923","last_updated":"2024-11-06T13:54:08Z","snapshot_observed_at":"2026-08-07T09:59:12.000905Z","submitted_at":"2024-11-06T13:54:08Z","title":"Evaluation data contamination in LLMs: how do we measure it and (when) does it matter?","version":1},"cited_work":{"arxiv_id":"2411.03923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.03923","snapshot_observed_at":"2026-07-02T13:16:58.130004Z","title":"Evaluation data contamination in llms: how do we measure it and (when) does it matter?","venue":null,"work_id":"8112fca7-038b-400f-9ab7-c18c1ffb3c10","year":2024},"citing_paper":{"arxiv_id":"2607.00890","last_updated":"2026-07-01T12:55:58Z","snapshot_observed_at":"2026-08-05T20:43:07.994732Z","submitted_at":"2026-07-01T12:55:58Z","title":"MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-07-02T13:14:15.684960Z"},"links":{"cited_paper":"/paper/2411.03923","citing_paper":"/paper/2607.00890"},"observation_digest":"sha256:beeb73f3170fb1f00ab67dfce982f04c0730a9b0ef125bbe97f2d6fe3341043f","observation_id":"fd18870b-ebe7-4d86-91f6-677dc74517e0","resolution":{"observed_at":"2026-07-02T13:16:58.131717Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03923","last_updated":"2024-11-06T13:54:08Z","snapshot_observed_at":"2026-08-07T09:59:12.000905Z","submitted_at":"2024-11-06T13:54:08Z","title":"Evaluation data contamination in LLMs: how do we measure it and (when) does it matter?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03923","snapshot_observed_at":"2026-08-02T13:46:09.669375Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22554","last_updated":"2026-05-18T16:45:13Z","snapshot_observed_at":"2026-08-08T05:06:39.163957Z","submitted_at":"2026-05-18T16:45:13Z","title":"Same Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T13:46:09.669375Z"},"links":{"cited_paper":"/paper/2411.03923","citing_paper":"/paper/2607.22554"},"observation_digest":"sha256:4b26c20a200e5c385eba816d68f263b9bd21c256374a29206524a57f91388c5e","observation_id":"e9a46123-ac97-4ffe-a532-9b4ac9c3f628","resolution":{"observed_at":"2026-08-02T13:46:09.669375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03923","last_updated":"2024-11-06T13:54:08Z","snapshot_observed_at":"2026-08-07T09:59:12.000905Z","submitted_at":"2024-11-06T13:54:08Z","title":"Evaluation data contamination in LLMs: how do we measure it and (when) does it matter?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03923","snapshot_observed_at":"2026-08-08T04:31:04.401902Z","title":"Singh, Muhammed Yusuf Kocyigit, Andrew Poulton, David Esiobu, Maria Lomeli, Gergely Szilvasy, and Dieuwke Hupkes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02985","last_updated":"2026-08-04T00:45:54Z","snapshot_observed_at":"2026-08-08T04:19:18.723440Z","submitted_at":"2026-08-04T00:45:54Z","title":"Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-08T04:31:04.401902Z"},"links":{"cited_paper":"/paper/2411.03923","citing_paper":"/paper/2608.02985"},"observation_digest":"sha256:559968bc17be1b0d6f67b77f18ad59fe3263b1795d502a6a312864fdcd23cb25","observation_id":"c0328c06-8a03-4415-88fd-e754b03f040c","resolution":{"observed_at":"2026-08-08T04:31:04.401902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.03923/citation-record","integrity":"/paper/2411.03923/integrity","json":"/paper/2411.03923/citation-record.json","paper":"/paper/2411.03923"},"outbound":[],"paper":{"arxiv_id":"2411.03923","last_updated":"2024-11-06T13:54:08Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T09:59:12.000905Z","submitted_at":"2024-11-06T13:54:08Z","title":"Evaluation data contamination in LLMs: how do we measure it and (when) does it matter?"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2411.03923."}