{"as_of":"2026-08-23T23:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:209320f2ed9c02f86aba982ff640e21de3914553e819120489e3f031bb40af49","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":50,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:57:15.748808Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":5,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.18824","doi":"10.48550/arxiv.2404.18824","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"input\": {","venue":"arXiv (Cornell University)","work_id":"0b8337c0-cbf0-49a5-abeb-b4b3c990d133","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-16T19:47:24.627230Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:030805de1a38b0e710cc5d7eac563285980a7d383c8941055b4e90c923e529f9","observation_id":"35845f36-317b-421a-94c2-f2807d182c79","resolution":{"observed_at":"2026-05-15T09:09:15.062242Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-12T21:07:09.658023Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.09105","last_updated":"2025-07-01T03:47:15Z","snapshot_observed_at":"2026-08-18T05:23:07.849839Z","submitted_at":"2024-11-14T00:26:26Z","title":"VideoCogQA: A Controllable Benchmark for Evaluating Cognitive Abilities in Video-Language Models","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-12T21:07:09.658023Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2411.09105"},"observation_digest":"sha256:e84bcac51f983aa30f5f667eff3f3f2365d2928eb789461b97dcdc956a85dbb8","observation_id":"e6a2f3b7-9e67-434d-96b4-8ebd827c55a1","resolution":{"observed_at":"2026-08-12T21:07:09.658023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-12T16:38:42.284289Z","title":"Benchmarking benchmark leakage in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13323","last_updated":"2025-03-31T13:02:51Z","snapshot_observed_at":"2026-08-18T19:43:16.893044Z","submitted_at":"2024-11-20T13:46:04Z","title":"Are Large Language Models Memorizing Bug Benchmarks?","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T16:38:42.284289Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2411.13323"},"observation_digest":"sha256:b95e2b98083021c3e507c1c825fe57077f9c80b19cfb429a9a93da1e8076b66c","observation_id":"91903aa1-6de5-4571-be83-ce728ec2225b","resolution":{"observed_at":"2026-08-12T16:38:42.284289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-11T23:09:32.524149Z","title":"嗤啦","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02819","last_updated":"2025-06-02T11:31:07Z","snapshot_observed_at":"2026-08-14T00:07:41.817666Z","submitted_at":"2024-12-03T20:35:57Z","title":"CNNSum: Exploring Long-Context Summarization with Large Language Models in Chinese Novels","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T23:09:32.524149Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2412.02819"},"observation_digest":"sha256:41912cdd9dc5b82bbcaca61f9d1629c2aea6ef4e15afb567247455e85b85d363","observation_id":"de6c23c1-c11c-4110-9e8a-2f8e4e62b384","resolution":{"observed_at":"2026-08-11T23:09:32.524149Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-11T14:40:29.599620Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11763","last_updated":"2024-12-16T13:28:29Z","snapshot_observed_at":"2026-08-21T04:33:39.642850Z","submitted_at":"2024-12-16T13:28:29Z","title":"QUENCH: Measuring the gap between Indic and Non-Indic Contextual General Reasoning in LLMs","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T14:40:29.599620Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2412.11763"},"observation_digest":"sha256:1595d2c605f06f2900bb2513dfdecf474f1afcaf7dc7753f0d3d441b575104ba","observation_id":"f589d2df-966e-4b15-a73d-9f80d7ae1311","resolution":{"observed_at":"2026-08-11T14:40:29.599620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-10T23:27:39.903073Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00059","last_updated":"2024-12-28T20:37:55Z","snapshot_observed_at":"2026-08-16T18:20:02.358558Z","submitted_at":"2024-12-28T20:37:55Z","title":"Large Language Models for Mathematical Analysis","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T23:27:39.903073Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2501.00059"},"observation_digest":"sha256:de1d8a0e4ff27eb592781d6f087ae3fefec8f3349b6a9a840d864e4b925827cc","observation_id":"b0987000-d762-46b5-9b84-d3d3b0efc085","resolution":{"observed_at":"2026-08-10T23:27:39.903073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-10T20:44:33.033248Z","title":"Benchmarking benchmark leakage in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.07493","last_updated":"2025-01-13T17:12:38Z","snapshot_observed_at":"2026-08-15T14:44:39.390234Z","submitted_at":"2025-01-13T17:12:38Z","title":"Exploring and Mitigating Adversarial Manipulation of Voting-Based Leaderboards","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:44:33.033248Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2501.07493"},"observation_digest":"sha256:adef9c8a4045e826e2170528bc5b2fb5e907c92456cf73df355319c1250c5814","observation_id":"c062c923-6be8-43bf-878c-a578ffa12f7a","resolution":{"observed_at":"2026-08-10T20:44:33.033248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-10T15:04:55.640338Z","title":"Benchmarking benchmark leakage in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14851","last_updated":"2025-05-09T05:26:43Z","snapshot_observed_at":"2026-08-16T20:15:33.207365Z","submitted_at":"2025-01-24T15:49:10Z","title":"JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T15:04:55.640338Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2501.14851"},"observation_digest":"sha256:206aacecd5f0169919e424762d20ec466e20de9a2fe308659f323c8e1498d64d","observation_id":"3730f6b9-d06d-41b0-b116-0aca4d3b5cc3","resolution":{"observed_at":"2026-08-10T15:04:55.640338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-09T19:27:46.877517Z","title":"Benchmarking benchmark leakage in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00334","last_updated":"2025-06-03T07:13:03Z","snapshot_observed_at":"2026-08-16T09:58:55.263084Z","submitted_at":"2025-02-01T06:42:02Z","title":"UGPhysics: A Comprehensive Benchmark for Undergraduate Physics Reasoning with Large Language Models","version":4},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-09T19:27:46.877517Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2502.00334"},"observation_digest":"sha256:be0009dfbce79469ed4bfaead71928805067071598fd5eb2029a31691021ab6b","observation_id":"fc7cd146-896d-4efd-88a2-9f264f2ea236","resolution":{"observed_at":"2026-08-09T19:27:46.877517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-08T15:06:55.379586Z","title":"Benchmarking Benchmark Leakage in Large Language Models , April 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06559","last_updated":"2025-05-25T23:36:47Z","snapshot_observed_at":"2026-08-19T05:02:22.089696Z","submitted_at":"2025-02-10T15:25:06Z","title":"Can We Trust AI Benchmarks? An Interdisciplinary Review of Current Issues in AI Evaluation","version":2},"reference_index":135,"source":"arxiv_source","source_observed_at":"2026-08-08T15:06:55.379586Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2502.06559"},"observation_digest":"sha256:6097b9bbbc1f0a5a2647150379fcbcedb2de435bc8e6fb6c431757de7965350c","observation_id":"f36a13b3-4485-4c8e-9e26-7ec039e89033","resolution":{"observed_at":"2026-08-08T15:06:55.379586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-16T11:57:15.748808Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14175","last_updated":"2025-06-04T09:32:19Z","snapshot_observed_at":"2026-08-19T12:23:21.127332Z","submitted_at":"2025-04-19T04:32:38Z","title":"Hypothetical Documents or Knowledge Leakage? Rethinking LLM-based Query Expansion","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-16T11:57:15.748808Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2504.14175"},"observation_digest":"sha256:a87d2c20113898f20a1890de2533e3c5390b731bb5b86a454608e2d17dda2bb8","observation_id":"e677b2b1-af21-474d-a58f-b061c5d09c2f","resolution":{"observed_at":"2026-08-16T11:57:15.748808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-07T13:09:24.597486Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22630","last_updated":"2025-05-30T02:10:54Z","snapshot_observed_at":"2026-08-18T04:08:15.093081Z","submitted_at":"2025-05-28T17:47:52Z","title":"Stochastic Chameleons: Irrelevant Context Hallucinations Reveal Class-Based (Mis)Generalization in LLMs","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:24.597486Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2505.22630"},"observation_digest":"sha256:25ad4538aa64a51fb0efbbef2b01af0f305fb2bc6b4ba1945d09e4539656ebf0","observation_id":"608bd7f2-ffaf-47f5-8cb9-d0a78d2b027b","resolution":{"observed_at":"2026-08-07T13:09:24.597486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-07T12:35:28.982799Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24263","last_updated":"2025-05-30T06:37:39Z","snapshot_observed_at":"2026-08-18T19:21:12.866566Z","submitted_at":"2025-05-30T06:37:39Z","title":"Simulating Training Data Leakage in Multiple-Choice Benchmarks for LLM Evaluation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:28.982799Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2505.24263"},"observation_digest":"sha256:e4e97dd3e657821ecf3aaf7c3ad5d67e72e785183d6480968a13273ea131910b","observation_id":"cbd67ca9-a106-43a1-a3b5-d6a351c50b4f","resolution":{"observed_at":"2026-08-07T12:35:28.982799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-07T12:45:46.260189Z","title":"Benchmarking benchmark leakage in large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00069","last_updated":"2025-05-29T16:09:32Z","snapshot_observed_at":"2026-08-15T08:32:08.398308Z","submitted_at":"2025-05-29T16:09:32Z","title":"Evaluating the Sensitivity of LLMs to Prior Context","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:46.260189Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2506.00069"},"observation_digest":"sha256:0d738ed5e20c13b29aeaaec7e4ee8a3bf4488fde460f8d16e8509c8cb765355b","observation_id":"e5f296d6-5c29-4bf5-a846-f1b33b22266a","resolution":{"observed_at":"2026-08-07T12:45:46.260189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-07T10:54:26.386550Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04142","last_updated":"2025-06-04T16:33:44Z","snapshot_observed_at":"2026-08-11T15:46:19.548845Z","submitted_at":"2025-06-04T16:33:44Z","title":"Establishing Trustworthy LLM Evaluation via Shortcut Neuron Analysis","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:26.386550Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2506.04142"},"observation_digest":"sha256:2e92697b48004753cf04412cb1f14c43901e918c97dab14b68aebdc1dc3ee136","observation_id":"61f9a667-6db2-4864-ae3c-66699921e2b4","resolution":{"observed_at":"2026-08-07T10:54:26.386550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-07T05:50:37.198751Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06982","last_updated":"2025-06-08T03:46:50Z","snapshot_observed_at":"2026-08-19T20:38:00.148251Z","submitted_at":"2025-06-08T03:46:50Z","title":"Chain of Methodologies: Scaling Test Time Computation without Training","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T05:50:37.198751Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2506.06982"},"observation_digest":"sha256:695f741223d9442fd1c159f48d1d807a38cb51467eff0c23e1080e201d38ecfe","observation_id":"79604d1c-895d-4767-aba9-8317fdb7eda2","resolution":{"observed_at":"2026-08-07T05:50:37.198751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-07T04:33:11.477391Z","title":"Benchmarking benchmark leakage in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10481","last_updated":"2025-06-12T08:33:38Z","snapshot_observed_at":"2026-08-17T19:26:42.531364Z","submitted_at":"2025-06-12T08:33:38Z","title":"OIBench: Benchmarking Strong Reasoning Models with Olympiad in Informatics","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:33:11.477391Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2506.10481"},"observation_digest":"sha256:0785c6679617400fd00a9b9a57c5fbd981bb3b53cdca478607f1c74eee137233","observation_id":"9a361e93-bc4a-4fe3-8ff8-29e3ba0a6029","resolution":{"observed_at":"2026-08-07T04:33:11.477391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-07T00:57:10.929888Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12376","last_updated":"2025-06-17T08:11:59Z","snapshot_observed_at":"2026-08-14T18:03:59.554747Z","submitted_at":"2025-06-14T07:18:33Z","title":"ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:10.929888Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2506.12376"},"observation_digest":"sha256:92f110da25e80733f0cd42493067f0ee9e093fde707d00d9dca1edf1fbef6307","observation_id":"5349fefa-a554-421c-82ef-0da9cf739b54","resolution":{"observed_at":"2026-08-07T00:57:10.929888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-07T00:23:50.139856Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21586","last_updated":"2025-08-07T04:59:32Z","snapshot_observed_at":"2026-08-14T13:11:56.557075Z","submitted_at":"2025-06-17T13:37:42Z","title":"Can Vision Language Models Understand Mimed Actions?","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-07T00:23:50.139856Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2506.21586"},"observation_digest":"sha256:f863f2c978fb232055522d973bb70c4007d42c58b23a204b038c42eaec5eb930","observation_id":"d9b1cdac-411b-4f68-9f04-6e3dc58cf728","resolution":{"observed_at":"2026-08-07T00:23:50.139856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-06T19:07:40.526852Z","title":"Benchmarking benchmark leakage in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06434","last_updated":"2025-07-08T22:29:06Z","snapshot_observed_at":"2026-08-19T16:15:23.665750Z","submitted_at":"2025-07-08T22:29:06Z","title":"Deprecating Benchmarks: Criteria and Framework","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T19:07:40.526852Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2507.06434"},"observation_digest":"sha256:ccb2f3a0dfeb52069db574e68c1a68d6c87e6e2f8f1af310a34edcb3a10b9e2f","observation_id":"ad11074b-4823-46d4-91e6-e3be25d48af1","resolution":{"observed_at":"2026-08-06T19:07:40.526852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-06T18:16:15.997858Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08983","last_updated":"2025-07-11T19:35:29Z","snapshot_observed_at":"2026-08-18T13:39:19.238601Z","submitted_at":"2025-07-11T19:35:29Z","title":"Exploiting Leaderboards for Large-Scale Distribution of Malicious Models","version":1},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-08-06T18:16:15.997858Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2507.08983"},"observation_digest":"sha256:e4c388bdc0bcd78a5578cee0edc4b05db26eab78b9de34fabc2d0f29a4bced5a","observation_id":"1481c7fa-2543-4237-a743-10a1e134b5b1","resolution":{"observed_at":"2026-08-06T18:16:15.997858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.18824","doi":"10.48550/arxiv.2404.18824","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"input\": {","venue":"arXiv (Cornell University)","work_id":"0b8337c0-cbf0-49a5-abeb-b4b3c990d133","year":2024},"citing_paper":{"arxiv_id":"2508.06226","last_updated":"2026-05-14T12:18:38Z","snapshot_observed_at":"2026-08-16T17:53:19.592430Z","submitted_at":"2025-08-08T11:11:37Z","title":"GeoLaux: A Benchmark for Evaluating MLLMs' Geometry Performance on Long-Step Problems Requiring Auxiliary Lines","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-19T00:38:43.897231Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2508.06226"},"observation_digest":"sha256:5f6ba7b679e04b228035bfea3fa6ff342748cbe1aeb4ca87fd2bef5a96085e30","observation_id":"e5a2ae8d-e388-4217-b3eb-eedbb3fa2312","resolution":{"observed_at":"2026-05-19T00:41:56.045788Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-04T11:19:50.832030Z","title":"Benchmarking benchmark leakage in large language models, April 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05709","last_updated":"2026-06-04T12:15:57Z","snapshot_observed_at":"2026-08-16T16:33:40.277640Z","submitted_at":"2025-10-07T09:22:22Z","title":"Correcting Prompt Dependence in LLM Benchmarks: A Bayesian Hierarchical Model with Embedding-Space Clustering","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-04T11:19:50.832030Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2510.05709"},"observation_digest":"sha256:4fe4d4c621b0d1d6b4625a784f30b0af71be6348f90a119a8d790745a85ee115","observation_id":"4cdd65dc-7dfe-4e5b-8d6e-e89609178a30","resolution":{"observed_at":"2026-08-04T11:19:50.832030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-04T10:00:42.785560Z","title":"category vector","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.12171","last_updated":"2026-06-08T05:05:53Z","snapshot_observed_at":"2026-08-14T14:02:26.051985Z","submitted_at":"2025-10-14T05:59:40Z","title":"MatSciBench: Benchmarking the Reasoning Ability of Large Language Models in Materials Science","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T10:00:42.785560Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2510.12171"},"observation_digest":"sha256:1a889f184f72872a8cba41fab49cced647984b0eadcb5871d2925f04e8955c2c","observation_id":"a2ede590-2b75-4e82-a160-b3e8b2954827","resolution":{"observed_at":"2026-08-04T10:00:42.785560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.18824","doi":"10.48550/arxiv.2404.18824","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"input\": {","venue":"arXiv (Cornell University)","work_id":"0b8337c0-cbf0-49a5-abeb-b4b3c990d133","year":2024},"citing_paper":{"arxiv_id":"2510.15746","last_updated":"2026-04-06T05:27:21Z","snapshot_observed_at":"2026-08-23T22:30:52.646610Z","submitted_at":"2025-10-17T15:34:25Z","title":"LLMs Judge Themselves: A Game-Theoretic Framework for Human-Aligned Evaluation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T06:16:01.603353Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2510.15746"},"observation_digest":"sha256:a212b3bf5dbcdb24ee2fda54e28ffc784df03437f35de0da415fe8b98755d289","observation_id":"9d533bd6-19d6-4c41-9c84-3633a1f2fddf","resolution":{"observed_at":"2026-05-18T06:20:59.061010Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-03T19:00:46.849166Z","title":"Samuel Yeom, Irene Giacomelli, Matt Fredrikson, and Somesh Jha","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.02786","last_updated":"2025-12-02T14:00:28Z","snapshot_observed_at":"2026-08-17T19:34:54.121548Z","submitted_at":"2025-12-02T14:00:28Z","title":"FiMMIA: scaling semantic perturbation-based membership inference across modalities","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T19:00:46.849166Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2512.02786"},"observation_digest":"sha256:78b6c42bb1b9fe98bcf148bae6b4eaab7ebac4491cf694a2538416e9f5f9df9e","observation_id":"a32d5988-584d-4f29-9cb3-540f7386a92a","resolution":{"observed_at":"2026-08-03T19:00:46.849166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.18824","doi":"10.48550/arxiv.2404.18824","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"input\": {","venue":"arXiv (Cornell University)","work_id":"0b8337c0-cbf0-49a5-abeb-b4b3c990d133","year":2024},"citing_paper":{"arxiv_id":"2601.02996","last_updated":"2026-04-16T20:06:10Z","snapshot_observed_at":"2026-08-11T06:53:13.709343Z","submitted_at":"2026-01-06T13:20:17Z","title":"Large Reasoning Models Are (Not Yet) Multilingual Latent Reasoners","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T17:24:05.849450Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2601.02996"},"observation_digest":"sha256:abec0efd20062f78e51567bbd65a601fc4cac6d674b2229996e012859b3be151","observation_id":"9ae0c76b-85e0-4c01-be3a-10fb040c358b","resolution":{"observed_at":"2026-05-16T17:28:10.516390Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-03T01:02:46.482669Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.10908","last_updated":"2026-06-10T14:49:59Z","snapshot_observed_at":"2026-08-19T12:23:21.720351Z","submitted_at":"2026-02-11T14:40:15Z","title":"SoftMatcha 2: A Fast and Soft Pattern Matcher for Trillion-Scale Corpora","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-03T01:02:46.482669Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2602.10908"},"observation_digest":"sha256:50936c549e796b62a93b95d6c13e272bcfd4424a3f93f9cd3c2afb323e3a0b45","observation_id":"5c566624-e304-4be1-af2a-30111054f033","resolution":{"observed_at":"2026-08-03T01:02:46.482669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-02T20:05:57.424441Z","title":"Benchmarking benchmark leakage in large language models.arXiv preprint arXiv:2404.18824,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:57.424441Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:e914e3efaade02a169d16ddd19e7e4b728825213df767df1c8cd5a89dd18dba7","observation_id":"d9ccfd0b-1ad1-45a5-8e21-17c30ff436fd","resolution":{"observed_at":"2026-08-02T20:05:57.424441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.18824","doi":"10.48550/arxiv.2404.18824","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"input\": {","venue":"arXiv (Cornell University)","work_id":"0b8337c0-cbf0-49a5-abeb-b4b3c990d133","year":2024},"citing_paper":{"arxiv_id":"2604.15203","last_updated":"2026-04-16T16:28:16Z","snapshot_observed_at":"2026-07-31T17:43:46.319715Z","submitted_at":"2026-04-16T16:28:16Z","title":"MADE: A Living Benchmark for Multi-Label Text Classification with Uncertainty Quantification of Medical Device Adverse Events","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T11:19:15.920545Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2604.15203"},"observation_digest":"sha256:42c866f1cbc39857776130a4739ce57406940316264eb15988b27ed469b7ab0a","observation_id":"c35f61c7-01d6-473a-9633-244972149695","resolution":{"observed_at":"2026-05-10T11:20:10.039975Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.18824","doi":"10.48550/arxiv.2404.18824","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"input\": {","venue":"arXiv (Cornell University)","work_id":"0b8337c0-cbf0-49a5-abeb-b4b3c990d133","year":2024},"citing_paper":{"arxiv_id":"2604.17771","last_updated":"2026-04-20T03:50:21Z","snapshot_observed_at":"2026-08-11T06:02:07.490505Z","submitted_at":"2026-04-20T03:50:21Z","title":"SPENCE: A Syntactic Probe for Detecting Contamination in NL2SQL Benchmarks","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-10T04:40:42.747298Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2604.17771"},"observation_digest":"sha256:04a0858f15ffa39e5fa9b23a3f9b8eaa6af7b3ccab6a873fcc042337d14c9bcd","observation_id":"bc4a7044-8616-4f93-b7da-af4e042ed8db","resolution":{"observed_at":"2026-05-10T12:05:23.386113Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.18824","doi":"10.48550/arxiv.2404.18824","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"input\": {","venue":"arXiv (Cornell University)","work_id":"0b8337c0-cbf0-49a5-abeb-b4b3c990d133","year":2024},"citing_paper":{"arxiv_id":"2604.21255","last_updated":"2026-04-23T03:48:56Z","snapshot_observed_at":"2026-08-12T17:52:45.443857Z","submitted_at":"2026-04-23T03:48:56Z","title":"When Agents Look the Same: Quantifying Distillation-Induced Similarity in Tool-Use Behaviors","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-09T22:07:58.614654Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2604.21255"},"observation_digest":"sha256:7bd730025fa59aae8b73cc3107864d9f215f4b97acecbddd6b67d951adb6d1d9","observation_id":"2a72359c-2c5f-47d6-a70a-8e728236879b","resolution":{"observed_at":"2026-05-11T14:16:18.734289Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.18824","doi":"10.48550/arxiv.2404.18824","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"input\": {","venue":"arXiv (Cornell University)","work_id":"0b8337c0-cbf0-49a5-abeb-b4b3c990d133","year":2024},"citing_paper":{"arxiv_id":"2604.22871","last_updated":"2026-04-23T19:37:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T19:37:48Z","title":"AutoRISE: Agent-Driven Strategy Evolution for Red-Teaming Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-09T20:59:23.365434Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2604.22871"},"observation_digest":"sha256:13d0a4b2170f7fbb2aa90736f1b06f18eb920e84249de1ca487673bd839ca208","observation_id":"b5e0477a-8a71-4b88-a2c8-c5c88ac8a16a","resolution":{"observed_at":"2026-05-11T14:51:05.376351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.18824","doi":"10.48550/arxiv.2404.18824","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"input\": {","venue":"arXiv (Cornell University)","work_id":"0b8337c0-cbf0-49a5-abeb-b4b3c990d133","year":2024},"citing_paper":{"arxiv_id":"2605.06327","last_updated":"2026-05-07T14:23:31Z","snapshot_observed_at":"2026-08-15T01:17:54.442017Z","submitted_at":"2026-05-07T14:23:31Z","title":"Measuring Evaluation-Context Divergence in Open-Weight LLMs: A Paired-Prompt Protocol with Pilot Evidence of Alignment-Pipeline-Specific Heterogeneity","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-08T10:23:02.697982Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2605.06327"},"observation_digest":"sha256:d88dccc3d627a8452eeef5b7e9cb1a68b0900577ea20dc838f9659c78b9b9ab1","observation_id":"79bdc75f-a803-40bf-8fcb-ae2fd06e01c5","resolution":{"observed_at":"2026-05-08T22:04:18.120684Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.18824","doi":"10.48550/arxiv.2404.18824","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"input\": {","venue":"arXiv (Cornell University)","work_id":"0b8337c0-cbf0-49a5-abeb-b4b3c990d133","year":2024},"citing_paper":{"arxiv_id":"2605.21930","last_updated":"2026-08-02T21:48:06Z","snapshot_observed_at":"2026-08-19T04:41:18.857974Z","submitted_at":"2026-05-21T02:59:19Z","title":"PITMuS: A Tool for Automated Bug Dataset Generation via Source-Level Mutant Reconstruction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T05:24:18.375671Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2605.21930"},"observation_digest":"sha256:dbeaf3fce61ef3d374b80e1711b743768e56e08d72133961f2daca66ac264f6e","observation_id":"88f9965b-edb3-4822-a956-bfb4c39b339f","resolution":{"observed_at":"2026-05-22T05:24:38.150937Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-04T05:04:55.845629Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.21930","last_updated":"2026-08-02T21:48:06Z","snapshot_observed_at":"2026-08-19T04:41:18.857974Z","submitted_at":"2026-05-21T02:59:19Z","title":"PITMuS: A Tool for Automated Bug Dataset Generation via Source-Level Mutant Reconstruction","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T05:04:55.845629Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2605.21930"},"observation_digest":"sha256:3e5864eb3c24e18ef4003eb702b55cafc8bec76259226ba5fcd2b96d85dafa4a","observation_id":"c7b760cf-d7b0-4618-b25d-e4cca102112c","resolution":{"observed_at":"2026-08-04T05:04:55.845629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.18824","doi":"10.48550/arxiv.2404.18824","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"input\": {","venue":"arXiv (Cornell University)","work_id":"0b8337c0-cbf0-49a5-abeb-b4b3c990d133","year":2024},"citing_paper":{"arxiv_id":"2605.22368","last_updated":"2026-05-21T12:00:45Z","snapshot_observed_at":"2026-08-21T12:22:13.512363Z","submitted_at":"2026-05-21T12:00:45Z","title":"VeriScale: Adversarial Test-Suite Scaling for Verifiable Code Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T08:17:03.221396Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2605.22368"},"observation_digest":"sha256:2854c6af6ca33dd423f322d1751e2a439ee75ef512c73f94b48d857b5ad2b643","observation_id":"110f064d-adfe-4ee6-af45-a46623d8e8eb","resolution":{"observed_at":"2026-05-22T08:21:16.994334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.18824","doi":"10.48550/arxiv.2404.18824","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"input\": {","venue":"arXiv (Cornell University)","work_id":"0b8337c0-cbf0-49a5-abeb-b4b3c990d133","year":2024},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-30T22:13:58.020838Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:f8d71aa51fa69c1e889fad9a7ff1257ec94095a68d883850356cf64d6d11b960","observation_id":"5e7df553-c4ce-4300-bb33-ea55a9c64edf","resolution":{"observed_at":"2026-06-30T22:15:04.884435Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.18824","doi":"10.48550/arxiv.2404.18824","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"input\": {","venue":"arXiv (Cornell University)","work_id":"0b8337c0-cbf0-49a5-abeb-b4b3c990d133","year":2024},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:420923b5b8fed94090c38b7f945ece3520d73b032e6c9db3dbadc3f3b1a5dd0d","observation_id":"3732a0e4-37ef-43f7-948a-ee90bf729cdc","resolution":{"observed_at":"2026-07-04T01:29:21.760196Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.18824","doi":"10.48550/arxiv.2404.18824","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"input\": {","venue":"arXiv (Cornell University)","work_id":"0b8337c0-cbf0-49a5-abeb-b4b3c990d133","year":2024},"citing_paper":{"arxiv_id":"2606.11337","last_updated":"2026-06-09T18:16:04Z","snapshot_observed_at":"2026-08-12T14:40:15.617322Z","submitted_at":"2026-06-09T18:16:04Z","title":"Can AI Agents Synthesize Scientific Conclusions?","version":1},"reference_index":132,"source":"pdf_text","source_observed_at":"2026-06-27T13:05:07.718882Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2606.11337"},"observation_digest":"sha256:3df5bf37ae10910892a3be4f082f9e656cffebc35b39b9d02e35623b0a73227d","observation_id":"7725151a-1a91-4028-a8ae-bdefd39a0a07","resolution":{"observed_at":"2026-07-03T05:47:41.425924Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.18824","doi":"10.48550/arxiv.2404.18824","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"input\": {","venue":"arXiv (Cornell University)","work_id":"0b8337c0-cbf0-49a5-abeb-b4b3c990d133","year":2024},"citing_paper":{"arxiv_id":"2606.17683","last_updated":"2026-06-16T08:49:56Z","snapshot_observed_at":"2026-08-13T21:22:44.536116Z","submitted_at":"2026-06-16T08:49:56Z","title":"Bridging Functional Correctness and Runtime Efficiency Gaps in LLM-Based Code Translation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T00:56:23.711897Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2606.17683"},"observation_digest":"sha256:e94304addc461551c04d194f2aadec4d9794112d8204d1c2dcf4c660ea910804","observation_id":"e5930678-901f-4aff-a538-6f425fcd1788","resolution":{"observed_at":"2026-07-03T21:08:57.953176Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.18824","doi":"10.48550/arxiv.2404.18824","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"input\": {","venue":"arXiv (Cornell University)","work_id":"0b8337c0-cbf0-49a5-abeb-b4b3c990d133","year":2024},"citing_paper":{"arxiv_id":"2606.23313","last_updated":"2026-06-22T13:26:29Z","snapshot_observed_at":"2026-08-09T15:51:59.239958Z","submitted_at":"2026-06-22T13:26:29Z","title":"Uncertainty-based Debiasing and Unlearning for Decontamination","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-26T05:57:44.576411Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2606.23313"},"observation_digest":"sha256:fc0aff94b4ec17660940ff04fb0c4879aafc10831571e5cc7a34c7b38cf906f5","observation_id":"8970d1b1-991c-44bf-aad8-faefee56bfd7","resolution":{"observed_at":"2026-07-04T12:49:52.411522Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.18824","doi":"10.48550/arxiv.2404.18824","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"input\": {","venue":"arXiv (Cornell University)","work_id":"0b8337c0-cbf0-49a5-abeb-b4b3c990d133","year":2024},"citing_paper":{"arxiv_id":"2606.26350","last_updated":"2026-06-24T19:42:55Z","snapshot_observed_at":"2026-08-13T04:48:02.836610Z","submitted_at":"2026-06-24T19:42:55Z","title":"OpenFinGym: A Verifiable Multi-Task Gym Environment for Evaluating Quant Agents","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-26T01:29:30.732471Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2606.26350"},"observation_digest":"sha256:9cdbdf3ecd5fec0a58e31a9aaf36d1f1505d35365e06b27bcf69b1b48695521c","observation_id":"027965fd-2235-4d53-a6cf-2e475773e4e1","resolution":{"observed_at":"2026-07-04T15:39:57.055022Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.18824","doi":"10.48550/arxiv.2404.18824","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"input\": {","venue":"arXiv (Cornell University)","work_id":"0b8337c0-cbf0-49a5-abeb-b4b3c990d133","year":2024},"citing_paper":{"arxiv_id":"2606.29815","last_updated":"2026-06-29T05:48:42Z","snapshot_observed_at":"2026-08-21T13:24:06.052219Z","submitted_at":"2026-06-29T05:48:42Z","title":"SrDetection: A Self-Referential Framework for Data Leakage Detection in Code Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-30T06:20:02.046020Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2606.29815"},"observation_digest":"sha256:ec6137d8b269734d666070a2b24d71e465c82b0fe83c0fcf41df99dfd6c21503","observation_id":"e127fd19-8449-43fe-89da-9f0f04b55cb4","resolution":{"observed_at":"2026-06-30T06:24:18.372738Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.18824","doi":"10.48550/arxiv.2404.18824","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"input\": {","venue":"arXiv (Cornell University)","work_id":"0b8337c0-cbf0-49a5-abeb-b4b3c990d133","year":2024},"citing_paper":{"arxiv_id":"2606.30989","last_updated":"2026-06-30T00:00:42Z","snapshot_observed_at":"2026-07-07T00:04:44.146481Z","submitted_at":"2026-06-30T00:00:42Z","title":"Wait, am I Being Fair? Characterizing Deductive Stereotyping and Mitigating It with Fair-GCG","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-07-01T01:13:13.329619Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2606.30989"},"observation_digest":"sha256:f43498d0fe9df520a27ed8f1c81ca9f9e2d009a9e86182a358e6dfd49614575e","observation_id":"c4746815-ff22-47ec-924e-2d076714c243","resolution":{"observed_at":"2026-07-01T01:15:13.184152Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.18824","doi":"10.48550/arxiv.2404.18824","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"input\": {","venue":"arXiv (Cornell University)","work_id":"0b8337c0-cbf0-49a5-abeb-b4b3c990d133","year":2024},"citing_paper":{"arxiv_id":"2607.01740","last_updated":"2026-07-02T05:52:32Z","snapshot_observed_at":"2026-07-07T00:07:19.026006Z","submitted_at":"2026-07-02T05:52:32Z","title":"Meta-Benchmarks for Financial-Services LLM Evaluation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-03T14:08:20.432931Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2607.01740"},"observation_digest":"sha256:f99a4e8e62d1dc2938606af695ba96d95322a2fa7da874c53729e3ceb69e180d","observation_id":"71a2da4b-1397-486a-9975-79a067ba5313","resolution":{"observed_at":"2026-07-03T14:18:22.673308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-07-14T10:58:56.777252Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10538","last_updated":"2026-07-12T02:43:00Z","snapshot_observed_at":"2026-08-19T12:23:25.070397Z","submitted_at":"2026-07-12T02:43:00Z","title":"Navigating the Open-Source Model Ecosystem: An Empirical Study of Creator Practices in Artistic Image Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-14T10:58:56.777252Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2607.10538"},"observation_digest":"sha256:aac6e65f295367962de7f8179285ba76000f2f8e8dfffbf916440fb224d6b013","observation_id":"f0c8bc16-9060-40f1-86cf-5ceed93a0191","resolution":{"observed_at":"2026-07-14T10:58:56.777252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-01T23:44:37.126253Z","title":"WhoisXML API","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15263","last_updated":"2026-07-27T17:42:56Z","snapshot_observed_at":"2026-08-14T19:21:42.926170Z","submitted_at":"2026-07-16T17:54:47Z","title":"Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T23:44:37.126253Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2607.15263"},"observation_digest":"sha256:02da510340ea38d2cb247339097f25a5742963a5cfa3b809624e4733f622f216","observation_id":"f42e648e-7f65-4ff9-8770-9e6a013df65d","resolution":{"observed_at":"2026-08-01T23:44:37.126253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-01T11:16:11.626141Z","title":"Benchmarking benchmark leakage in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19949","last_updated":"2026-08-07T04:37:38Z","snapshot_observed_at":"2026-08-20T11:26:19.773264Z","submitted_at":"2026-07-22T09:25:47Z","title":"SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T11:16:11.626141Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2607.19949"},"observation_digest":"sha256:74d6d104fc59ca3408ee3b74d773934d0c376acf9294253fbd3ffb3764cb75aa","observation_id":"403211e6-ef5c-494e-a568-3b88a48bfefb","resolution":{"observed_at":"2026-08-01T11:16:11.626141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-15T14:34:14.741919Z","title":"arXiv preprint arXiv:2404.18824 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06867","last_updated":"2026-08-07T06:46:58Z","snapshot_observed_at":"2026-08-20T04:51:28.575652Z","submitted_at":"2026-08-07T06:46:58Z","title":"LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM Routers","version":1},"reference_index":236,"source":"arxiv_source","source_observed_at":"2026-08-15T14:34:14.741919Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2608.06867"},"observation_digest":"sha256:aeed46d556696a88bee77a680a7ad6d8453c292b6662956eb1ad316fbbd7d509","observation_id":"1e3a030c-b9bf-4faf-a812-f2a6152c4c70","resolution":{"observed_at":"2026-08-15T14:34:14.741919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2404.18824/citation-record","integrity":"/paper/2404.18824/integrity","json":"/paper/2404.18824/citation-record.json","paper":"/paper/2404.18824"},"outbound":[],"paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 50 inbound Pith citation observations for arXiv:2404.18824."}