{"as_of":"2026-08-07T06:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0a51b18d9b40343ccb3bfab01a95bc90435877fb003d247fc5e9297b3b344468","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":34,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:23:50.793745Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":18,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2403.03952","last_updated":"2026-04-20T06:05:54Z","snapshot_observed_at":"2026-08-03T00:56:47.399756Z","submitted_at":"2024-03-06T18:56:36Z","title":"Bridging Language and Items for Retrieval and Recommendation: Benchmarking LLMs as Semantic Encoders","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-24T03:03:51.053556Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2403.03952"},"observation_digest":"sha256:7451b04c1dac12341b7e47c867456015615fe5608a3edf6ecf5f1f433104e626","observation_id":"3aaa96ce-fe7c-4b16-930d-13eb3909db90","resolution":{"observed_at":"2026-05-24T03:05:56.990257Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"reference_index":223,"source":"arxiv_source","source_observed_at":"2026-05-10T17:34:42.565806Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2403.07974"},"observation_digest":"sha256:3bb4b058a16e8cb8878b98c39961ba69ad7836c7617ccaf9a12ef8baeae84477","observation_id":"09a21ebc-9711-4355-941f-f7a01f2d0c76","resolution":{"observed_at":"2026-05-10T17:34:42.839749Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2406.04244","last_updated":"2024-06-06T16:41:39Z","snapshot_observed_at":"2026-07-30T15:43:06.151242Z","submitted_at":"2024-06-06T16:41:39Z","title":"Benchmark Data Contamination of Large Language Models: A Survey","version":1},"reference_index":187,"source":"pdf_text","source_observed_at":"2026-05-22T23:10:40.420241Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2406.04244"},"observation_digest":"sha256:56d1ae4603b6b5917c4001b1882bbec36bde04f2362a359e1b83dd6477abf213","observation_id":"01ef215d-f693-4a35-a813-56451877a25c","resolution":{"observed_at":"2026-05-22T23:10:41.160577Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"reference_index":155,"source":"pdf_text","source_observed_at":"2026-05-17T00:05:03.547664Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2406.16860"},"observation_digest":"sha256:3418fcafe70f13712cddd50393a4d99d5184ecdbb0d3d145e695dbf0dacd4105","observation_id":"6e87ec1d-90ca-4af7-9894-a408d1a97434","resolution":{"observed_at":"2026-05-17T00:05:03.901359Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"reference_index":197,"source":"arxiv_source","source_observed_at":"2026-05-17T07:51:12.953777Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2412.14164"},"observation_digest":"sha256:365cae58c3467ceffe94cbca715327f15c657f218fc6db898d5293ad65e3ec0c","observation_id":"11e37873-e86e-4360-8c9d-92532dc29dd4","resolution":{"observed_at":"2026-05-17T07:51:13.131940Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-06T23:25:53.137574Z","title":"X., Chen, X., Lin, Y., Wen, J.-R., and Han, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18213","last_updated":"2025-06-23T00:19:27Z","snapshot_observed_at":"2026-08-06T23:20:47.555675Z","submitted_at":"2025-06-23T00:19:27Z","title":"A Conceptual Framework for AI Capability Evaluations","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-08-06T23:25:53.137574Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2506.18213"},"observation_digest":"sha256:3a608f2f56d493d0b937e4e4ff007f3b8abb4e3134773a034d7b7d3701278397","observation_id":"3983b9a3-1339-405a-8c93-7ae58305dce3","resolution":{"observed_at":"2026-08-06T23:25:53.137574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-07T00:23:50.793745Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-07T00:15:23.993156Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:50.793745Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:668ee67d0c5e45a516376ba042bc0de3a386178562bd2d10ca91bc4ad22052b6","observation_id":"c201a5ad-d818-43c7-b7a5-0128eba0b6ae","resolution":{"observed_at":"2026-08-07T00:23:50.793745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-06T20:24:28.438581Z","title":"Don’t make your llm an evaluation benchmark cheater","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02825","last_updated":"2025-08-07T06:58:08Z","snapshot_observed_at":"2026-08-06T22:15:42.048508Z","submitted_at":"2025-07-03T17:35:31Z","title":"Establishing Best Practices for Building Rigorous Agentic Benchmarks","version":5},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:28.438581Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2507.02825"},"observation_digest":"sha256:149a72abecedd5cc9f3378540738f1c64d4a7ac088b476aeccb3056504ab95a7","observation_id":"11652142-6a23-4b3c-b5d8-bee15e27fe51","resolution":{"observed_at":"2026-08-06T20:24:28.438581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-06T19:47:49.856525Z","title":"X.; Chen, X.; Lin, Y.; Wen, J.-R.; and Han, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04641","last_updated":"2025-07-07T03:49:58Z","snapshot_observed_at":"2026-08-06T21:37:04.501820Z","submitted_at":"2025-07-07T03:49:58Z","title":"Toward Valid Measurement Of (Un)fairness For Generative AI: A Proposal For Systematization Through The Lens Of Fair Equality of Chances","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-06T19:47:49.856525Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2507.04641"},"observation_digest":"sha256:fcdb3f63a4103fe67f98f54a3f35453506f8dcbd231735df5a46a1a7e7e44c3b","observation_id":"5a5eeb3d-ad4e-4eb4-807a-a8526dd0d0aa","resolution":{"observed_at":"2026-08-06T19:47:49.856525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-06T21:43:41.764235Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05266","last_updated":"2025-06-30T06:14:32Z","snapshot_observed_at":"2026-08-06T21:36:14.853232Z","submitted_at":"2025-06-30T06:14:32Z","title":"User Behavior Prediction as a Generic, Robust, Scalable, and Low-Cost Evaluation Strategy for Estimating Generalization in LLMs","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T21:43:41.764235Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2507.05266"},"observation_digest":"sha256:c98705445f85daa84c0922feb23393325cf87abc4e395c7525d6d04ce801651c","observation_id":"5ecc2e53-7f59-435d-afc4-b5bb1194e4e6","resolution":{"observed_at":"2026-08-06T21:43:41.764235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-06T19:07:40.530184Z","title":"X., Chen, X., Lin, Y., Wen, J.-R., and Han, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06434","last_updated":"2025-07-08T22:29:06Z","snapshot_observed_at":"2026-08-06T19:02:05.373476Z","submitted_at":"2025-07-08T22:29:06Z","title":"Deprecating Benchmarks: Criteria and Framework","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T19:07:40.530184Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2507.06434"},"observation_digest":"sha256:b1d7d9c708e0f5336382cf0d19e443679d3c8401130d44a227b609088afeb467","observation_id":"a680c7fb-277d-4b9c-a183-19a2afd2d214","resolution":{"observed_at":"2026-08-06T19:07:40.530184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T16:50:28.964070Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17767","last_updated":"2025-09-13T01:49:58Z","snapshot_observed_at":"2026-08-06T11:47:39.038660Z","submitted_at":"2025-08-25T08:04:20Z","title":"ISACL: Internal State Analyzer for Copyrighted Training Data Leakage","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:28.964070Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2508.17767"},"observation_digest":"sha256:6421ffe8344a0d28ae0e9ca460b86d71d577ed9c61308470e07b113e43d42ca5","observation_id":"97aa3bc0-878f-47d6-8b62-1e86e5b135dd","resolution":{"observed_at":"2026-08-05T16:50:28.964070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T14:44:28.055272Z","title":"Don’t make your llm an evaluation benchmark cheater,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21003","last_updated":"2025-08-28T17:04:43Z","snapshot_observed_at":"2026-08-06T10:56:05.447380Z","submitted_at":"2025-08-28T17:04:43Z","title":"InSQuAD: In-Context Learning for Efficient Retrieval via Submodular Mutual Information to Enforce Quality and Diversity","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T14:44:28.055272Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2508.21003"},"observation_digest":"sha256:d31036ab684cbe7427df71519e32a954f57413b4f65712e8bdd3f481d9a8b1e2","observation_id":"814f58bc-4f4b-435d-92ee-04ac5bae3038","resolution":{"observed_at":"2026-08-05T14:44:28.055272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2509.20909","last_updated":"2026-05-09T19:01:47Z","snapshot_observed_at":"2026-08-02T22:05:17.866277Z","submitted_at":"2025-09-25T08:55:18Z","title":"LogitTrace: Detecting Benchmark Contamination via Layerwise Logit Trajectories","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-18T14:32:57.426996Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2509.20909"},"observation_digest":"sha256:62e562711f44e89562fffdbe2cee1c59b77fb3f28089b0db0b6c25b015f2a82c","observation_id":"ca9ba4eb-c67c-4ba0-94b8-5b5319d0bcc5","resolution":{"observed_at":"2026-05-18T14:36:28.964642Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-04T13:29:04.649764Z","title":"X., CHEN, X., LIN, Y., WEN, J.-R.,ANDHAN, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.00481","last_updated":"2026-05-30T15:21:07Z","snapshot_observed_at":"2026-08-05T23:47:00.790457Z","submitted_at":"2025-10-01T04:03:51Z","title":"Make a Video Call with LLM: A Measurement Campaign over Six Mainstream Apps","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T13:29:04.649764Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2510.00481"},"observation_digest":"sha256:79f3597bc25005c7bc3aa90094dbda130a439a014d11f66916dda6f33cb52649","observation_id":"62e80328-de9e-46ef-8346-c51a5dec4830","resolution":{"observed_at":"2026-08-04T13:29:04.649764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2601.12910","last_updated":"2026-04-22T09:40:34Z","snapshot_observed_at":"2026-08-02T17:38:14.873275Z","submitted_at":"2026-01-19T10:04:33Z","title":"SciCoQA: Quality Assurance for Scientific Paper--Code Alignment","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T13:20:07.741347Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2601.12910"},"observation_digest":"sha256:c54da2ee85db0893b62df2f10238661942a1740a1168f693221b10ff7bea1af2","observation_id":"13edee3e-fa11-45a1-a31e-00ca70fb6dd7","resolution":{"observed_at":"2026-05-16T13:20:57.867847Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-02T23:32:09.809875Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.13626","last_updated":"2026-05-26T14:18:40Z","snapshot_observed_at":"2026-08-02T23:32:06.387048Z","submitted_at":"2026-02-14T06:34:19Z","title":"Benchmark Leakage Trap: Can We Trust LLM-based Recommendation?","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-02T23:32:09.809875Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2602.13626"},"observation_digest":"sha256:0922145c8d09f7580914e6a276e04c107f43f752da1a5f553998aef93e94dd1e","observation_id":"0be77a86-62d8-4578-a0e6-0e23617115be","resolution":{"observed_at":"2026-08-02T23:32:09.809875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2603.18916","last_updated":"2026-04-12T07:45:59Z","snapshot_observed_at":"2026-07-06T22:49:42.664225Z","submitted_at":"2026-03-19T13:52:17Z","title":"Agentic Business Process Management: A Research Manifesto","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-15T08:24:56.763438Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2603.18916"},"observation_digest":"sha256:25da4882ef800f36e3998a37cbbb54a4f1579a6239104597e4008d4e75965b11","observation_id":"fb03d784-d5ec-47bb-b80b-073e1a2b49b2","resolution":{"observed_at":"2026-05-15T08:25:18.811678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2604.04815","last_updated":"2026-04-20T15:33:20Z","snapshot_observed_at":"2026-08-03T13:56:37.976114Z","submitted_at":"2026-04-06T16:20:47Z","title":"LiveFact: A Dynamic, Time-Aware Benchmark for LLM-Driven Fake News Detection","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T20:30:53.094207Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2604.04815"},"observation_digest":"sha256:f36d404abb7fd8dda110138b3ca03f8ae87be9d6595ce750f03cc53069210f8a","observation_id":"22ed82ce-384d-4802-8fd1-d4c1ae345d65","resolution":{"observed_at":"2026-05-10T21:55:49.393337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2604.06802","last_updated":"2026-06-23T06:45:36Z","snapshot_observed_at":"2026-07-13T08:50:52.244397Z","submitted_at":"2026-04-08T08:16:37Z","title":"Riemann-Bench: A Benchmark for Moonshot Mathematics","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T18:02:42.607682Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2604.06802"},"observation_digest":"sha256:965408cd5091b9fa9777f57ec03dc2219c93928d22f17f86fb2be10bd2de4062","observation_id":"a69ccd46-f3ac-4193-967f-d2b183c8a583","resolution":{"observed_at":"2026-05-11T05:36:00.811359Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2604.07650","last_updated":"2026-04-08T23:32:06Z","snapshot_observed_at":"2026-08-02T20:20:50.082823Z","submitted_at":"2026-04-08T23:32:06Z","title":"How Independent are Large Language Models? A Statistical Framework for Auditing Behavioral Entanglement and Reweighting Verifier Ensembles","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T17:13:04.305435Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2604.07650"},"observation_digest":"sha256:efcb92d3dbb99bf1b61acf873afc6dabb64643d5bdb09c91818799af1eeb0528","observation_id":"227c3cac-82a2-40f0-be47-0d92e3231ded","resolution":{"observed_at":"2026-05-11T07:20:58.932401Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2604.20273","last_updated":"2026-04-22T07:20:03Z","snapshot_observed_at":"2026-07-06T23:06:44.624357Z","submitted_at":"2026-04-22T07:20:03Z","title":"ActuBench: A Multi-Agent LLM Pipeline for Generation and Evaluation of Actuarial Reasoning Tasks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T00:35:24.397273Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2604.20273"},"observation_digest":"sha256:e3ca0336e3ad612293f91f5865567c8dbc0e705724157bd46f94711e09de0cb7","observation_id":"5d80a5c7-a48b-4c8f-831f-22fbfb20d00a","resolution":{"observed_at":"2026-05-11T13:46:05.207324Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2604.23067","last_updated":"2026-04-24T23:37:17Z","snapshot_observed_at":"2026-08-02T12:00:10.017635Z","submitted_at":"2026-04-24T23:37:17Z","title":"Training a General Purpose Automated Red Teaming Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T11:20:09.224745Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2604.23067"},"observation_digest":"sha256:dbaa0a0ae5306794173696c3b657e41e8fb83f962e245c33cb6f39333ab203e8","observation_id":"d1555bcf-9371-468c-b0c0-4efe0b8c70e2","resolution":{"observed_at":"2026-05-11T19:41:08.319868Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2604.24544","last_updated":"2026-04-27T14:39:41Z","snapshot_observed_at":"2026-07-06T23:10:33.821313Z","submitted_at":"2026-04-27T14:39:41Z","title":"STELLAR-E: a Synthetic, Tailored, End-to-end LLM Application Rigorous Evaluator","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-08T03:39:30.528601Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2604.24544"},"observation_digest":"sha256:f3221ded4c491550c0d7dc3880da495b9812e5b17f2a4ab6c474029ff60e7231","observation_id":"dbdfad1f-74b3-4fa4-9dc4-5dd2f0084784","resolution":{"observed_at":"2026-05-11T22:01:10.945701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2604.24819","last_updated":"2026-04-27T14:05:18Z","snapshot_observed_at":"2026-08-03T03:44:08.503208Z","submitted_at":"2026-04-27T14:05:18Z","title":"Programming with Data: Test-Driven Data Engineering for Self-Improving LLMs from Raw Corpora","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-08T03:13:30.648190Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2604.24819"},"observation_digest":"sha256:3f48bc28e29de3c916af2456406d158abfe4ceffe4b3c8e804669b72dfa88a55","observation_id":"2e23b564-b627-4049-8ba4-b2fd10035453","resolution":{"observed_at":"2026-05-11T22:11:16.280192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2605.08838","last_updated":"2026-05-09T09:48:50Z","snapshot_observed_at":"2026-07-06T23:21:02.177557Z","submitted_at":"2026-05-09T09:48:50Z","title":"Generating Leakage-Free Benchmarks for Robust RAG Evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T03:04:39.253429Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2605.08838"},"observation_digest":"sha256:9d9f8aa7ff20839f01a4e88452dbde54c186974be4a2c7b4b784ad5d597af73b","observation_id":"f8720662-6515-4a69-bcce-5408c93bda67","resolution":{"observed_at":"2026-05-12T03:06:18.948679Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2605.21543","last_updated":"2026-05-20T09:16:39Z","snapshot_observed_at":"2026-08-01T19:04:50.092578Z","submitted_at":"2026-05-20T09:16:39Z","title":"Provable Joint Decontamination for Benchmarking Multiple Large Language Models","version":1},"reference_index":181,"source":"arxiv_source","source_observed_at":"2026-05-22T00:40:54.038367Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2605.21543"},"observation_digest":"sha256:e8520ce8e2f99d56a52aa6911bd7fb01f9b77c0a6f9ce7695ddf82b4db166539","observation_id":"d5bf708a-2ecb-4cc9-8afa-52f0f61be15f","resolution":{"observed_at":"2026-05-22T00:44:29.503089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2605.23628","last_updated":"2026-05-22T13:40:00Z","snapshot_observed_at":"2026-07-06T23:33:49.013121Z","submitted_at":"2026-05-22T13:40:00Z","title":"How Hard is it to Rig a Benchmark? A Social Choice Analysis of Leaderboard Robustness","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-25T04:37:01.537128Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2605.23628"},"observation_digest":"sha256:177cffc873945b3f84184757fb22c4f6b03d6ec01bb9ab617f4d9ce75871a56b","observation_id":"6ac7c5d0-9059-4a44-9a04-cdcff63d2890","resolution":{"observed_at":"2026-05-25T04:40:24.435108Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2605.26133","last_updated":"2026-05-21T10:32:33Z","snapshot_observed_at":"2026-07-06T23:36:01.564747Z","submitted_at":"2026-05-21T10:32:33Z","title":"Pretraining Data Exposure in Large Language Models: A Survey of Membership Inference, Data Contamination, and Security Implications","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-30T17:20:16.735285Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2605.26133"},"observation_digest":"sha256:39e65d9da92d7aecd1d41147bc413bf2202c108fa6f61ce4073581179881bfcf","observation_id":"7feb40be-8f95-4344-97f7-80e1ed66da49","resolution":{"observed_at":"2026-06-30T17:24:56.540890Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2605.30916","last_updated":"2026-05-29T07:01:38Z","snapshot_observed_at":"2026-08-06T11:05:12.049404Z","submitted_at":"2026-05-29T07:01:38Z","title":"Welfare, Improvability, and Variance: A Principal-Agent Approach to Optimal Benchmark Item Aggregation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-28T23:49:57.580051Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2605.30916"},"observation_digest":"sha256:f0fd022a34a4c773218c5f06e44fc139cf7299844010d72704e936c5e0590310","observation_id":"3f65e975-0d9d-4cb3-a563-06e43cae517f","resolution":{"observed_at":"2026-06-28T23:52:49.465940Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2606.11166","last_updated":"2026-06-09T17:46:10Z","snapshot_observed_at":"2026-07-06T23:50:16.299969Z","submitted_at":"2026-06-09T17:46:10Z","title":"Flaws in the LLM Automation Narrative","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T10:52:36.252919Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2606.11166"},"observation_digest":"sha256:d849d4e47493d355bb7bf0570e5fcf2653511edd8beedfc2b4307e052c899f51","observation_id":"119018cb-5232-4f83-8943-cac3dbc2a450","resolution":{"observed_at":"2026-07-03T08:17:45.290264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2606.28863","last_updated":"2026-06-27T11:12:17Z","snapshot_observed_at":"2026-07-07T00:02:52.539331Z","submitted_at":"2026-06-27T11:12:17Z","title":"Defeat Devices in AI Systems","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-30T08:34:58.879346Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2606.28863"},"observation_digest":"sha256:130e2fc85caf726a37ae8143a3097a221cb175a765811e456250a637179587c3","observation_id":"c4eb3bdd-b34a-46fb-aca3-ecf7dea39295","resolution":{"observed_at":"2026-06-30T08:44:27.875364Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":"2311.01964","doi":"10.48550/arxiv.2311.01964","metadata_source":"pith","pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't make your llm an evaluation benchmark cheater","venue":"cs.CL","work_id":"7ea5a199-3c68-4578-a9b4-22b8573dcaa3","year":2023},"citing_paper":{"arxiv_id":"2607.08009","last_updated":"2026-07-09T00:27:07Z","snapshot_observed_at":"2026-08-03T01:18:12.663488Z","submitted_at":"2026-07-09T00:27:07Z","title":"From Execution to Education: A Bloom-Aligned Framework for Measuring Educational Control in LLMs","version":1},"reference_index":208,"source":"arxiv_source","source_observed_at":"2026-07-10T13:49:17.343893Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2607.08009"},"observation_digest":"sha256:ac36eb492b7e2c108675f034e0fbcd388bd95a1ac376b2d1b552a26ca976e62c","observation_id":"be1c851b-6620-4735-9841-8d4ecfb0c51c","resolution":{"observed_at":"2026-07-10T13:57:06.719623Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-06T17:07:02.934623Z","title":"arXiv preprint arXiv:2311.01964 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04772","last_updated":"2026-08-05T12:37:31Z","snapshot_observed_at":"2026-08-07T06:31:10.596738Z","submitted_at":"2026-08-05T12:37:31Z","title":"Guideline-as-Oracle: Zero-Annotation Training of an Ophthalmic Telephone Triage Agent","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T17:07:02.934623Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2608.04772"},"observation_digest":"sha256:4893abb764c68549e36fc6c43ba0e6096b4b6f7e441a91f1dfb0914049b2ef8f","observation_id":"4bd18683-eceb-42fc-acc7-3c6ea3c4f451","resolution":{"observed_at":"2026-08-06T17:07:02.934623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.01964/citation-record","integrity":"/paper/2311.01964/integrity","json":"/paper/2311.01964/citation-record.json","paper":"/paper/2311.01964"},"outbound":[],"paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 34 inbound Pith citation observations for arXiv:2311.01964."}