{"as_of":"2026-08-10T19:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9f4ccac918549428c50c2594c06950fc975f250931b68e2b22a09bcaeb909188","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T06:02:27.994149Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07341/citation-record","integrity":"/paper/2608.07341/integrity","json":"/paper/2608.07341/citation-record.json","paper":"/paper/2608.07341"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.findings-emnlp.188","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.223263Z","title":"LNE -Blocking: An Efficient Framework for Contamination Mitigation Evaluation on Large Language Models","venue":null,"work_id":"09242cd8-4fa7-4a2b-a8c6-976f813d3e72","year":2025},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.740716Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:e3e69ea6cad1af9077ff8371c0b901f5488ebf09c1932b4f90f7aa77753b8c11","observation_id":"d7dc0e89-79b5-481c-87cf-f918672263dd","resolution":{"observed_at":"2026-08-10T06:02:28.228112Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.acl-long.192","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.208567Z","title":"Establishing Trustworthy LLM Evaluation via Shortcut Neuron Analysis","venue":null,"work_id":"48395524-7ca7-4d5a-b40e-b6c5dbe1bc2d","year":2025},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.747195Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:72d5d3db5caef0349acf00c6c4f63ad766cfcdf213464381e2d54f9e8a64a1e6","observation_id":"02e918b6-b44b-4b19-b33c-6f4fec5de48a","resolution":{"observed_at":"2026-08-10T06:02:28.213191Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.768889Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":"a305f3c6-3881-40e2-b6f2-7c457f759674","year":null},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.752835Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:3600dfaac3f92baffdede06397a9d2bcfb407ab31e6ea6239238b7f9295ef031","observation_id":"3b679bda-9fbe-4449-ba69-6a0961e31184","resolution":{"observed_at":"2026-08-10T06:02:28.773965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.757864Z","title":"DeepSeek-V4 : Towards Highly Efficient Million-Token Context Intelligence","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.757864Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:90d266f58e7f69c3606f51404a980f25070ccfd8abd207dd17a7fb7ecb4861f4","observation_id":"b94b7bb4-6e53-4207-a00a-d0bf051febaf","resolution":{"observed_at":"2026-08-10T06:02:27.757864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.753484Z","title":"Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling","venue":null,"work_id":"b8d4a437-ac04-4a84-8429-9b1f53687ab2","year":2023},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.762702Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:7b216e988e25a98689f431e540add5a8611a9c677e4bfb6018ee68910e18817c","observation_id":"f3faf0c9-2c57-4b72-b710-0a8fda80ff42","resolution":{"observed_at":"2026-08-10T06:02:28.758493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.737669Z","title":"OpenOrca : An Open Dataset of GPT Augmented FLAN Reasoning Traces","venue":null,"work_id":"2205d267-9b88-46ed-81b8-dae8907770fc","year":2023},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.767463Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:834e7c50e66869ba484ba3ccb4b7dbed359df4c5efa9f98f7d7df01731079da5","observation_id":"799ed2d2-eb18-458b-ae47-a45aba6f4e16","resolution":{"observed_at":"2026-08-10T06:02:28.742644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.02770","last_updated":"2026-07-02T21:08:53Z","snapshot_observed_at":"2026-08-09T14:18:19.682421Z","submitted_at":"2026-07-02T21:08:53Z","title":"Gemma 4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.02770","snapshot_observed_at":"2026-08-10T06:02:27.772444Z","title":"Gemma 4 Technical Report","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.772444Z"},"links":{"cited_paper":"/paper/2607.02770","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:119174c91b2ae38b253b04e242668d9568f898fe9c2a0b19eff4314ba5e29dbc","observation_id":"1e5f1813-3186-458d-ade2-a42e97a82854","resolution":{"observed_at":"2026-08-10T06:02:27.772444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.721730Z","title":"and Zhou, Denny","venue":null,"work_id":"9d62f675-6ea4-44ae-b363-a3d8163edea6","year":2022},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.778487Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:ad704bd44d36997c06fe50cf68aaad6982c15a4e35c07368e8d457cf220fec50","observation_id":"6b072f53-aa78-40f9-961c-14e1a412e8f7","resolution":{"observed_at":"2026-08-10T06:02:28.726506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.705871Z","title":"and Le, Quoc V","venue":null,"work_id":"a3b9da60-cfd9-4c33-bded-aaecc9bb82aa","year":null},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.783126Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:a9abc8581f4f927dcdc2d92cabfbbf534f884de0d1c62e090be374ec4cc14bb0","observation_id":"b013282a-0dc2-4804-8ab3-894d2e50c897","resolution":{"observed_at":"2026-08-10T06:02:28.710640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06575","last_updated":"2024-08-17T14:31:42Z","snapshot_observed_at":"2026-08-08T14:35:49.004908Z","submitted_at":"2023-05-11T05:19:47Z","title":"Chain-of-Dictionary Prompting Elicits Translation in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06575","snapshot_observed_at":"2026-08-10T06:02:27.788123Z","title":"2023 , month = may, journal =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.788123Z"},"links":{"cited_paper":"/paper/2305.06575","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:0639c6981c0fbb31ed7c842b8d78d138d013e318de8b17e8da397ec819215d8d","observation_id":"0d24cd1d-2c3e-4ff3-963f-d67b9d1b5c7b","resolution":{"observed_at":"2026-08-10T06:02:27.788123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10200","last_updated":"2024-05-23T20:53:59Z","snapshot_observed_at":"2026-07-06T17:30:47.845775Z","submitted_at":"2024-02-15T18:55:41Z","title":"Chain-of-Thought Reasoning Without Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10200","snapshot_observed_at":"2026-08-10T06:02:27.793116Z","title":"2024 , month = feb, journal =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.793116Z"},"links":{"cited_paper":"/paper/2402.10200","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:50cba99017bda700a017fc72a63eed9afde6d912e47a95664419604314e9d9ef","observation_id":"c6f55e24-0f54-49e1-bcb9-d723dce71c50","resolution":{"observed_at":"2026-08-10T06:02:27.793116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.798336Z","title":"Leak, Cheat, Repeat:","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.798336Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:c249d0f75dd95b5c80b3b132b28a17e2b82183d905361ce1b05d14ba338f8d48","observation_id":"2e42c8f1-431c-427a-90e4-d81927a8802a","resolution":{"observed_at":"2026-08-10T06:02:27.798336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.690378Z","title":"Large Scale Kernel Machines , author =","venue":null,"work_id":"8d6757a6-e5ce-44e9-8353-5155893f698c","year":2007},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.803038Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:a6133cce19036e87f44f333e84466ff1f9d9b579b86039a1a30e5dee7a4d269b","observation_id":"d2e906ae-999f-4aa2-b35f-b1ac8b37f6ef","resolution":{"observed_at":"2026-08-10T06:02:28.695314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-10T06:02:27.807650Z","title":"2021 , journal =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.807650Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:3f953d2aa46740d35bde830b51066b527069e63287dd47bc22b189c24821092f","observation_id":"fc81245f-475d-4b99-8bdd-7649ab6b12cd","resolution":{"observed_at":"2026-08-10T06:02:27.807650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.812585Z","title":"Findings of the Association for Computational Linguistics:","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.812585Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:b5bd44e0abda341f563a4b3e04d3e9869416531cc5951ac57dca617a19be2e05","observation_id":"e56585dc-b039-4315-a18a-de56c1f1be79","resolution":{"observed_at":"2026-08-10T06:02:27.812585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-10T06:02:27.817062Z","title":"2021 , journal =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.817062Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:c167a154094c35ddfd8a84597b750de0e68fef818942c1062f8d245155d727b1","observation_id":"38c5e3ce-ca40-41cb-be76-c9d1d72f8e72","resolution":{"observed_at":"2026-08-10T06:02:27.817062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.821781Z","title":"Unveiling the Spectrum of Data Contamination in Language Model: A Survey from Detection to Remediation , booktitle =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.821781Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:c6c5f18604a6bca0a02b10c248fba6f64a6cbac60ca42dbd897ede15484ca86c","observation_id":"21d222fa-acb9-4937-b738-0a60d99dbfdd","resolution":{"observed_at":"2026-08-10T06:02:27.821781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.826574Z","title":"Pretraining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.826574Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:53677854d87f20f11782ccdef11c9f0a05fd73d8088e57b3bb439e814dd10f38","observation_id":"5c12fa61-9aaf-47c4-933c-2cf7a59df6c2","resolution":{"observed_at":"2026-08-10T06:02:27.826574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.831286Z","title":"Generalization or Memorization:","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.831286Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:9061e7d5358bae051f086168c9048af5491e55a65a362c992bb2ed4d99d17404","observation_id":"de4f2eda-60d6-4b51-8a3d-666952a3447a","resolution":{"observed_at":"2026-08-10T06:02:27.831286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T06:02:27.835926Z","title":"2024 , journal =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.835926Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:42afffaddf28c513433f88e636e7f3a0c72ee1ef31a5a5316f3696c41cdd8cfd","observation_id":"02eaa788-d44d-42ca-b46c-40bb600a3908","resolution":{"observed_at":"2026-08-10T06:02:27.835926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.675239Z","title":"2023 , journal =","venue":null,"work_id":"f5909062-311f-48f9-ada7-de1fb785b9e5","year":2023},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.840805Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:90a451568d4155fa0ab29f1e8093dd16e36d9d1785dc6c875c6b8f8e83968725","observation_id":"6739cf4b-ba39-4914-9630-21428556c78e","resolution":{"observed_at":"2026-08-10T06:02:28.680155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.325","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.118353Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1:","venue":null,"work_id":"a72b6e63-ad6e-488e-b5eb-54fe37d9672b","year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.845191Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:c2560abf89365639cf99a6bfdf47b2a234eceb9fa604bbc2e7c63ad6e3c4a63f","observation_id":"c60bd7b2-9bb1-49b5-afd6-ab53f3303007","resolution":{"observed_at":"2026-08-10T06:02:28.123179Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.660326Z","title":"Treeeval:","venue":null,"work_id":"e51f1fd5-5ca3-4926-a9ea-1c5f7698760a","year":null},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.849759Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:4b741656e8212116d079f8b33a0a81fa68aed7c7bb06664fae5db4d158e4ea63","observation_id":"fd2ac138-5a0e-4983-8c1b-90720ec659e1","resolution":{"observed_at":"2026-08-10T06:02:28.665242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.645539Z","title":"and Dodge, Jesse , year =","venue":null,"work_id":"584a8770-0150-48c9-8751-9a4356f16e50","year":null},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.854332Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:124cefeca1eab508852e6ce3f6d760677335d3ce57b407c88548da1805bf8f36","observation_id":"0fb6a903-0109-44ab-a35c-c39c093b0e00","resolution":{"observed_at":"2026-08-10T06:02:28.650218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.858536Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 3: System Demonstrations) , address=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.858536Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:2b390db7543b389b52eb24c49112ca7dfaac06a022e50c0ea9f6af4032f73190","observation_id":"b0892300-bfe3-490d-8554-982ae3166c11","resolution":{"observed_at":"2026-08-10T06:02:27.858536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.621441Z","title":"The Twelfth International Conference on Learning Representations , author =","venue":null,"work_id":"5420388d-4778-4caa-a9cf-80eda9f3c96e","year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.862663Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:555930c28f7e2a1efaa821289ee2d104d6e0312d7d9ab2613141638ab9765863","observation_id":"efeea341-8de7-40da-8d8d-e2b229beab9e","resolution":{"observed_at":"2026-08-10T06:02:28.625870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.607264Z","title":"2016 , volume =","venue":null,"work_id":"2aafae2f-a4e8-43ea-9b5b-fe2d722e2a1d","year":2016},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.866563Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:531ddec4d25374aff35bbea165927dcf1660990c579d59c65ad05f3ea1480313","observation_id":"a086d665-37c6-4346-bd47-e8db86cb0b6c","resolution":{"observed_at":"2026-08-10T06:02:28.611623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-10T06:02:27.870440Z","title":"2020 , journal =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.870440Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:df59fd1b95e788fec5d0b87d50bcb23c9fb1a1c497d00febec1fde1ac5fb979b","observation_id":"4e0a3506-1721-4e7c-9eb7-6049c9d5961b","resolution":{"observed_at":"2026-08-10T06:02:27.870440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.874530Z","title":"2023 , eprint =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.874530Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:053ae8e2a62045aa1033ad3276afd57304237bc926d812889cdd09d9f1259187","observation_id":"912e8849-8496-4542-be09-2460d1e5e043","resolution":{"observed_at":"2026-08-10T06:02:27.874530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.582347Z","title":"Privacy Risks of General-Purpose Language Models , booktitle =","venue":null,"work_id":"dad5b28b-83e3-41eb-b972-6804cb8fdee2","year":null},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.878400Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:752706c0f1b49d57f1fb69cb40460b8a5bd5842d5d471a9e4615177b646d7f81","observation_id":"68012d3d-a7cc-4914-b0aa-912ccfa7bff5","resolution":{"observed_at":"2026-08-10T06:02:28.586670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01964","last_updated":"2023-11-03T14:59:54Z","snapshot_observed_at":"2026-08-06T10:56:05.075839Z","submitted_at":"2023-11-03T14:59:54Z","title":"Don't Make Your LLM an Evaluation Benchmark Cheater","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01964","snapshot_observed_at":"2026-08-10T06:02:27.882400Z","title":"2023 , journal =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.882400Z"},"links":{"cited_paper":"/paper/2311.01964","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:ce34130070369891abe9e328babc946bc56008c48b19baf966d8e845f8fe5f04","observation_id":"2e9ede79-c27b-40e9-9e6a-5efd4a8f9ddb","resolution":{"observed_at":"2026-08-10T06:02:27.882400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10160","last_updated":"2023-10-18T13:17:13Z","snapshot_observed_at":"2026-08-07T21:42:40.112957Z","submitted_at":"2023-05-17T12:23:38Z","title":"Stop Uploading Test Data in Plain Text: Practical Strategies for Mitigating Data Contamination by Evaluation Benchmarks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10160","snapshot_observed_at":"2026-08-10T06:02:27.886353Z","title":"Stop Uploading Test Data in Plain Text:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.886353Z"},"links":{"cited_paper":"/paper/2305.10160","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:60e4b685b14ee9720bf8b9d2d9aea3cdc851638ad3bfbe7ed4c11b33a75fe47a","observation_id":"13615bf3-77df-4b8d-b153-3737578c7886","resolution":{"observed_at":"2026-08-10T06:02:27.886353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08758","last_updated":"2021-09-30T17:20:01Z","snapshot_observed_at":"2026-08-03T11:31:09.198404Z","submitted_at":"2021-04-18T07:42:52Z","title":"Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08758","snapshot_observed_at":"2026-08-10T06:02:27.891496Z","title":"Documenting Large Webtext Corpora:","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.891496Z"},"links":{"cited_paper":"/paper/2104.08758","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:a9dd52bb5bd4b59ae77d81479b5a584527061d0999752763a7092c04913d8bdb","observation_id":"6aa0321a-9e9f-42e9-b599-59ca0f263cc9","resolution":{"observed_at":"2026-08-10T06:02:27.891496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.566639Z","title":"2006 , journal =","venue":null,"work_id":"71507ff4-602c-41ec-8556-8872c54f210f","year":2006},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.896375Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:1c31c83f2c92a647185b0f43d2c2e816d55aed3642bc11ccafdf4834f9d1d9f1","observation_id":"41e8f71b-fdad-4951-903b-e7f07db99eb0","resolution":{"observed_at":"2026-08-10T06:02:28.571341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.551267Z","title":"Chain-of-Symbol Prompting for Spatial Reasoning in Large Language Models , booktitle =","venue":null,"work_id":"5540ea03-efbf-4685-9ef0-42b540f908df","year":null},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.901086Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:3368f9a2ce9a77d563d95a4bb77c76550ed1563196e6c39ef06630f23a18bc6a","observation_id":"1438432d-7512-4c88-b0cf-cea4e97eca08","resolution":{"observed_at":"2026-08-10T06:02:28.556718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.905509Z","title":"Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 1:","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.905509Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:9fa4770ccf6991297fe09888cfe5bbf8f1aa26ba7bee7d9b949b14bd67395775","observation_id":"4b0fff4c-1a87-4db3-94e7-ee84b51529a2","resolution":{"observed_at":"2026-08-10T06:02:27.905509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.910224Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1:","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.910224Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:9d470f3772b762e5b9d4500adb4ae5e6fc8a69a11eb427acaabb257d0455dacd","observation_id":"929c8c72-44c0-4045-8818-d6ad35adaaeb","resolution":{"observed_at":"2026-08-10T06:02:27.910224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06161","last_updated":"2023-12-13T14:44:10Z","snapshot_observed_at":"2026-07-06T15:25:35.930688Z","submitted_at":"2023-05-09T08:16:42Z","title":"StarCoder: may the source be with you!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06161","snapshot_observed_at":"2026-08-10T06:02:27.914735Z","title":"2023 , journal =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.914735Z"},"links":{"cited_paper":"/paper/2305.06161","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:3c5fce65623a1d8ff9a8ef9ed1a4286c0006cda5d8c1c7a625c2807a47e71b05","observation_id":"063346a9-d529-4a27-b971-116dc34e7570","resolution":{"observed_at":"2026-08-10T06:02:27.914735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13125","last_updated":"2024-12-13T10:48:13Z","snapshot_observed_at":"2026-08-05T01:40:57.962531Z","submitted_at":"2024-02-20T16:38:33Z","title":"TreeEval: Benchmark-Free Evaluation of Large Language Models through Tree Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13125","snapshot_observed_at":"2026-08-10T06:02:27.919399Z","title":"arXiv preprint arXiv:2402.13125 , eprint =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.919399Z"},"links":{"cited_paper":"/paper/2402.13125","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:c55fad6d9685628a5b83de2acae3251260f8f8a040b60bd3f6c5dc5d9df007d5","observation_id":"ed307eb7-0c73-44fa-a888-517c3b418fd1","resolution":{"observed_at":"2026-08-10T06:02:27.919399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.536424Z","title":"2004 , month = jul, pages =","venue":null,"work_id":"bff7393e-5e30-4c43-a457-cef6689cb0af","year":2004},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.924422Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:d9ca74c710e0acb2e12019dc3f398bcb7b8e1896aaccacb14bbadfd6dada08ef","observation_id":"3bda2178-6507-4e9a-ad6d-d93c2f4ffc54","resolution":{"observed_at":"2026-08-10T06:02:28.541126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.929374Z","title":"2023 , month = may, pages =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.929374Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:37885794ceb7817875152451fddf2aeac6c2a99a28d93630c9d7da28f7f511d1","observation_id":"c2c69a22-e0d4-4e3b-9e6d-c75298206ca4","resolution":{"observed_at":"2026-08-10T06:02:27.929374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.940213Z","title":"Data Contamination:","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.940213Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:e6f566c56f3b8da5055caffd524bc5e1e895516eb6450e2a6b67e47f99ec35d4","observation_id":"530b11b1-e72e-404c-8d0b-5fc66ad01a44","resolution":{"observed_at":"2026-08-10T06:02:27.940213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.520862Z","title":"Detecting Pretraining Data from Large Language Models , booktitle =","venue":null,"work_id":"b793e038-83f4-44cc-af2d-3f45663dc10e","year":null},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.944963Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:8372b95557c73dec96037609a607047a5509ade6f2747b880d53569157c5b6af","observation_id":"9109c435-2a1a-473e-8840-4007fa50134d","resolution":{"observed_at":"2026-08-10T06:02:28.525743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.503741Z","title":"Chain-of-Thought Reasoning without Prompting , booktitle =","venue":null,"work_id":"a7f6d312-0573-4dd0-8ad4-4475d4125b3d","year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.949480Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:fd47829d22d385711795a5336aa6e06ad470321bafa02c9600f1830968c71ad6","observation_id":"982db8d6-4ea8-41e2-be15-95c48e073422","resolution":{"observed_at":"2026-08-10T06:02:28.508631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13474","last_updated":"2023-02-27T21:26:48Z","snapshot_observed_at":"2026-07-06T12:52:16.992962Z","submitted_at":"2022-03-25T06:55:15Z","title":"CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.13474","snapshot_observed_at":"2026-08-10T06:02:27.954034Z","title":"Codegen:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.954034Z"},"links":{"cited_paper":"/paper/2203.13474","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:a35a685e76adad75e1e487b5752f78352cd5cef2fdca8267759b8ada0fcc9d6b","observation_id":"e8711cba-63a5-4c37-9fc9-959dd8e10b82","resolution":{"observed_at":"2026-08-10T06:02:27.954034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10677","last_updated":"2023-09-27T01:15:49Z","snapshot_observed_at":"2026-07-06T16:20:36.866744Z","submitted_at":"2023-09-19T15:02:58Z","title":"Estimating Contamination via Perplexity: Quantifying Memorisation in Language Model Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10677","snapshot_observed_at":"2026-08-10T06:02:27.958702Z","title":"Estimating Contamination via Perplexity:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.958702Z"},"links":{"cited_paper":"/paper/2309.10677","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:3be2909aceff485c54bd70c90341101b84f228cac306bb1a5d615d341f83630d","observation_id":"d04425ab-053e-4ec3-8b66-33e6ea411669","resolution":{"observed_at":"2026-08-10T06:02:27.958702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-10T06:02:27.963441Z","title":"Code Llama:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.963441Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:9a00d35390c6fe4ad3b8853f5744c7c4716cd5cd9f443e0abadd59f2996fdba7","observation_id":"c2f6011a-e862-4dd9-a037-b0586e67b740","resolution":{"observed_at":"2026-08-10T06:02:27.963441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.968263Z","title":"Proceedings of the 2024 Conference of the North American Chapter of the Association for Computational Linguistics:","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.968263Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:aa1ed8b4302d7e203655a46061939ce380b8c7a3edb47cace82a7954b718e2ca","observation_id":"49ed2925-d938-425b-9ee9-894ef6696f16","resolution":{"observed_at":"2026-08-10T06:02:27.968263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T06:02:27.973110Z","title":"Llama 2:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.973110Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:3964ecab997b497064d3e79d53706ddbcd69616817168caedbb3b089d9666c96","observation_id":"7ea003ac-6a3b-4bac-ae59-5b7313bfb4b8","resolution":{"observed_at":"2026-08-10T06:02:27.973110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.977880Z","title":"Towards Understanding Chain-of-Thought Prompting:","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.977880Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:42f7e5409e77f5e30713e668ddd9ad59f84de72f34ef15fa55eb3e433ae21a58","observation_id":"24e70c34-4774-402f-8899-bb1cd1f96b1e","resolution":{"observed_at":"2026-08-10T06:02:27.977880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-acl.644","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:28.045295Z","title":"Data Contamination Calibration for Black-Box","venue":null,"work_id":"53f63727-6a0d-46ce-89aa-3c2bc7c9a96b","year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.982120Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:6e1295bf2d08ac6d7e838ebbeeda8d162a14e378545c3327b1b766a324cc9052","observation_id":"e2096714-03e9-454d-a549-08df010e6e34","resolution":{"observed_at":"2026-08-10T06:02:28.052443Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.986129Z","title":"Self-Edit:","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.986129Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:18a8e131dc802a0a008551b48658d3aa773d0a2a182337772d0d8e47dc1ae0f4","observation_id":"6ed97392-827c-42cc-80aa-34d3ca1a2bb8","resolution":{"observed_at":"2026-08-10T06:02:27.986129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-09T21:05:48.710894Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-10T06:02:27.990201Z","title":"2024 , journal =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.990201Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:2fdf6bb622ebe096ea263c81b70e2c2d4ebbf993b05dd0f0db863fc6e3665850","observation_id":"b3051fb7-1264-46c2-ae22-5c473129c3d2","resolution":{"observed_at":"2026-08-10T06:02:27.990201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T06:02:27.994149Z","title":"Multilingual Machine Translation with Large Language Models:","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-10T06:02:27.994149Z"},"links":{"citing_paper":"/paper/2608.07341"},"observation_digest":"sha256:0bcc57346301604162cc92da803373f0ee16bbe98a83f1bc3f7b666779bf6d84","observation_id":"4038ac83-4f4f-4f91-928a-a3ac7bac5ec2","resolution":{"observed_at":"2026-08-10T06:02:27.994149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.07341","last_updated":"2026-08-07T15:37:03Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T19:11:37.830791Z","submitted_at":"2026-08-07T15:37:03Z","title":"Zero Gap Is Not Restoration: Stratified Per-Question Probability Evaluation and Step-wise Mitigation of Benchmark Contamination"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":4,"verified_fuzzy":17},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2608.07341."}