{"as_of":"2026-08-05T20:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f5373cfc2e5f5e71a2fce60158a47b027469f3d0d0c9d1ad42762f04faae45f5","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T22:31:50.438762Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":22,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T00:44:43.810112Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"cited_work":{"arxiv_id":"2602.16763","doi":"10.48550/arxiv.2602.16763","metadata_source":"pith","pith_arxiv_id":"2602.16763","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","venue":"cs.AI","work_id":"fb4bcdcb-e72f-4428-8d2a-fd34a4437e50","year":2026},"citing_paper":{"arxiv_id":"2604.07733","last_updated":"2026-04-09T02:29:20Z","snapshot_observed_at":"2026-07-06T22:57:00.904627Z","submitted_at":"2026-04-09T02:29:20Z","title":"CivBench: Progress-Based Evaluation for LLMs' Strategic Decision-Making in Civilization V","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-10T17:59:21.887765Z"},"links":{"cited_paper":"/paper/2602.16763","citing_paper":"/paper/2604.07733"},"observation_digest":"sha256:f16454d0eff106bc2d68c42a24b2b2e5d74654f38244b4f51e380eb6719c992e","observation_id":"0ff38621-70b3-4256-99ff-a37b2003e43a","resolution":{"observed_at":"2026-06-02T02:03:39.349559Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:02.919694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:02.919694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"cited_work":{"arxiv_id":"2602.16763","doi":"10.48550/arxiv.2602.16763","metadata_source":"pith","pith_arxiv_id":"2602.16763","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","venue":"cs.AI","work_id":"fb4bcdcb-e72f-4428-8d2a-fd34a4437e50","year":2026},"citing_paper":{"arxiv_id":"2605.09826","last_updated":"2026-05-15T19:33:36Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T00:04:19Z","title":"EnactToM: An Evolving Benchmark for Functional Theory of Mind in Embodied Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T04:59:52.659739Z"},"links":{"cited_paper":"/paper/2602.16763","citing_paper":"/paper/2605.09826"},"observation_digest":"sha256:d9b35540663e2dbfcd1cc6264cc2b618ec05dea35d5ea6a83be902fa742c52d3","observation_id":"dd1e38d5-1178-4239-81e7-289640d2962e","resolution":{"observed_at":"2026-06-02T02:03:39.349559Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:02.919694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:02.919694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"cited_work":{"arxiv_id":"2602.16763","doi":"10.48550/arxiv.2602.16763","metadata_source":"pith","pith_arxiv_id":"2602.16763","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","venue":"cs.AI","work_id":"fb4bcdcb-e72f-4428-8d2a-fd34a4437e50","year":2026},"citing_paper":{"arxiv_id":"2605.09826","last_updated":"2026-05-15T19:33:36Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T00:04:19Z","title":"EnactToM: An Evolving Benchmark for Functional Theory of Mind in Embodied Agents","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T23:27:45.394730Z"},"links":{"cited_paper":"/paper/2602.16763","citing_paper":"/paper/2605.09826"},"observation_digest":"sha256:0b695c9d8f25a4dcd6934972c4ce816a822f9aeb9c71920db71d3309a87f57b4","observation_id":"86092544-6e25-4ac5-b058-7c02897280f1","resolution":{"observed_at":"2026-06-02T02:03:39.349559Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:02.919694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:02.919694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"cited_work":{"arxiv_id":"2602.16763","doi":"10.48550/arxiv.2602.16763","metadata_source":"pith","pith_arxiv_id":"2602.16763","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","venue":"cs.AI","work_id":"fb4bcdcb-e72f-4428-8d2a-fd34a4437e50","year":2026},"citing_paper":{"arxiv_id":"2605.10851","last_updated":"2026-05-11T17:00:18Z","snapshot_observed_at":"2026-08-03T03:33:06.244554Z","submitted_at":"2026-05-11T17:00:18Z","title":"The Generalized Turing Test: A Foundation for Comparing Intelligence","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-12T03:25:48.145137Z"},"links":{"cited_paper":"/paper/2602.16763","citing_paper":"/paper/2605.10851"},"observation_digest":"sha256:eaf896ccd4338af6c4b6b2cfb823fc83f370561126fca64ac1d5e5b2519a881c","observation_id":"763dee6d-0f07-42ea-8c09-275be3dac9dc","resolution":{"observed_at":"2026-06-02T02:03:39.349559Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:02.919694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:02.919694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"cited_work":{"arxiv_id":"2602.16763","doi":"10.48550/arxiv.2602.16763","metadata_source":"pith","pith_arxiv_id":"2602.16763","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","venue":"cs.AI","work_id":"fb4bcdcb-e72f-4428-8d2a-fd34a4437e50","year":2026},"citing_paper":{"arxiv_id":"2605.18840","last_updated":"2026-05-23T21:01:39Z","snapshot_observed_at":"2026-08-02T23:16:16.703906Z","submitted_at":"2026-05-13T03:19:38Z","title":"The Growing Pains of Frontier Models: When Leaderboards Stop Separating and What to Measure Next","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T21:58:28.944652Z"},"links":{"cited_paper":"/paper/2602.16763","citing_paper":"/paper/2605.18840"},"observation_digest":"sha256:1ff3e764c80b5fd0e6a97d5f50829d816725a4528e343363709397e8ed70be4d","observation_id":"71a81c9b-6d6b-4739-a23d-19f2c11535c1","resolution":{"observed_at":"2026-06-30T22:05:05.992220Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:02.919694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:02.919694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"cited_work":{"arxiv_id":"2602.16763","doi":"10.48550/arxiv.2602.16763","metadata_source":"pith","pith_arxiv_id":"2602.16763","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","venue":"cs.AI","work_id":"fb4bcdcb-e72f-4428-8d2a-fd34a4437e50","year":2026},"citing_paper":{"arxiv_id":"2605.30104","last_updated":"2026-05-28T15:46:54Z","snapshot_observed_at":"2026-08-01T18:03:53.013091Z","submitted_at":"2026-05-28T15:46:54Z","title":"SEAL: Can Saturated Benchmarks Be Revived by LLM-as-a-Meta-Judge?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T07:58:00.119722Z"},"links":{"cited_paper":"/paper/2602.16763","citing_paper":"/paper/2605.30104"},"observation_digest":"sha256:5819f2adfb04d60efa46634c6ecffc75ad7e16a67fd674a7e113484e203e4886","observation_id":"c5c2ab9c-19c2-4394-b5b6-86a5fc0ecd4f","resolution":{"observed_at":"2026-06-29T08:03:14.390117Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:02.919694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:02.919694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"cited_work":{"arxiv_id":"2602.16763","doi":"10.48550/arxiv.2602.16763","metadata_source":"pith","pith_arxiv_id":"2602.16763","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","venue":"cs.AI","work_id":"fb4bcdcb-e72f-4428-8d2a-fd34a4437e50","year":2026},"citing_paper":{"arxiv_id":"2606.00359","last_updated":"2026-05-29T21:01:42Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:01:42Z","title":"Next-Billion AI Index: The compass for AI utility and adoption in the global majority","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-28T19:41:14.664207Z"},"links":{"cited_paper":"/paper/2602.16763","citing_paper":"/paper/2606.00359"},"observation_digest":"sha256:0b226b6e96bcf3fc655ef53f48dbaef5c7223f9412bf4feba1a7e4cf4f423d81","observation_id":"68d7a209-0531-400c-8e56-717a8098c3e6","resolution":{"observed_at":"2026-06-28T19:42:35.715339Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:02.919694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:02.919694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"cited_work":{"arxiv_id":"2602.16763","doi":"10.48550/arxiv.2602.16763","metadata_source":"pith","pith_arxiv_id":"2602.16763","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","venue":"cs.AI","work_id":"fb4bcdcb-e72f-4428-8d2a-fd34a4437e50","year":2026},"citing_paper":{"arxiv_id":"2606.02907","last_updated":"2026-06-03T23:53:39Z","snapshot_observed_at":"2026-07-06T23:43:12.737017Z","submitted_at":"2026-06-01T21:22:15Z","title":"Linear Probes Detect Task Format, Not Reasoning Mode in Language Model Hidden States","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T14:21:35.807504Z"},"links":{"cited_paper":"/paper/2602.16763","citing_paper":"/paper/2606.02907"},"observation_digest":"sha256:f4886d6d8424f07a9a80a2369f9ef2af73d5ebc206f6cae314b305a08ba3dce5","observation_id":"11ff3c2c-543c-4597-97c8-eff206659c08","resolution":{"observed_at":"2026-07-01T23:26:22.730237Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:02.919694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:02.919694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"cited_work":{"arxiv_id":"2602.16763","doi":"10.48550/arxiv.2602.16763","metadata_source":"pith","pith_arxiv_id":"2602.16763","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","venue":"cs.AI","work_id":"fb4bcdcb-e72f-4428-8d2a-fd34a4437e50","year":2026},"citing_paper":{"arxiv_id":"2606.07020","last_updated":"2026-06-05T08:09:46Z","snapshot_observed_at":"2026-07-06T23:46:42.693840Z","submitted_at":"2026-06-05T08:09:46Z","title":"MADE: Beyond Scoring via a Multilingual Agentic Diagnosing Engine for Fine-Grained Evaluation Insights","version":1},"reference_index":114,"source":"arxiv_source","source_observed_at":"2026-06-27T22:16:42.836058Z"},"links":{"cited_paper":"/paper/2602.16763","citing_paper":"/paper/2606.07020"},"observation_digest":"sha256:40c11eadf67bd41e756adb6e2469d85c5e4f35f9cf2422e21eb5de118d398df2","observation_id":"b27cd14a-2eab-4087-a0e9-8ae7384aa83b","resolution":{"observed_at":"2026-07-02T16:57:09.907025Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:02.919694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:02.919694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"cited_work":{"arxiv_id":"2602.16763","doi":"10.48550/arxiv.2602.16763","metadata_source":"pith","pith_arxiv_id":"2602.16763","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","venue":"cs.AI","work_id":"fb4bcdcb-e72f-4428-8d2a-fd34a4437e50","year":2026},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"cited_paper":"/paper/2602.16763","citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:aa999b1c50d7b1b5ff99f415e24db53852fbb363a0d92db11d9e068069fd4256","observation_id":"768ab1bc-4dd9-4f56-856c-e3874910ec0a","resolution":{"observed_at":"2026-07-03T01:57:32.210991Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:02.919694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:02.919694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"cited_work":{"arxiv_id":"2602.16763","doi":"10.48550/arxiv.2602.16763","metadata_source":"pith","pith_arxiv_id":"2602.16763","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","venue":"cs.AI","work_id":"fb4bcdcb-e72f-4428-8d2a-fd34a4437e50","year":2026},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"cited_paper":"/paper/2602.16763","citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:d7f8bce4a84302b4819b26e558e8fba24e34c8e12cf38c2e70b53b614840c262","observation_id":"c69b331e-a486-4646-9b76-1644549805b2","resolution":{"observed_at":"2026-07-03T16:58:43.251838Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:02.919694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:02.919694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"cited_work":{"arxiv_id":"2602.16763","doi":"10.48550/arxiv.2602.16763","metadata_source":"pith","pith_arxiv_id":"2602.16763","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","venue":"cs.AI","work_id":"fb4bcdcb-e72f-4428-8d2a-fd34a4437e50","year":2026},"citing_paper":{"arxiv_id":"2606.26158","last_updated":"2026-06-23T22:30:44Z","snapshot_observed_at":"2026-08-01T02:19:45.706411Z","submitted_at":"2026-06-23T22:30:44Z","title":"Life After Benchmark Saturation: A Case Study of CORE-Bench","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T01:17:50.141575Z"},"links":{"cited_paper":"/paper/2602.16763","citing_paper":"/paper/2606.26158"},"observation_digest":"sha256:a9f4c53c5272611fed32abce72b8b481c9c2e66816bf95aa8b61cbac8c021a3c","observation_id":"8f1fe2fe-1b85-4555-beb6-214553e819df","resolution":{"observed_at":"2026-07-04T15:49:57.824105Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:02.919694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:02.919694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"cited_work":{"arxiv_id":"2602.16763","doi":"10.48550/arxiv.2602.16763","metadata_source":"pith","pith_arxiv_id":"2602.16763","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","venue":"cs.AI","work_id":"fb4bcdcb-e72f-4428-8d2a-fd34a4437e50","year":2026},"citing_paper":{"arxiv_id":"2606.30219","last_updated":"2026-07-31T12:14:44Z","snapshot_observed_at":"2026-08-05T20:18:04.402492Z","submitted_at":"2026-06-29T12:33:06Z","title":"EvalSafetyGap: A Hybrid Survey and Conceptual Framework for LLM Evaluation-Safety Failures","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T06:19:18.061309Z"},"links":{"cited_paper":"/paper/2602.16763","citing_paper":"/paper/2606.30219"},"observation_digest":"sha256:693a11b5c5531e64bc38af797f8d6c44daa353bb67644bcacf22ed6aa960233a","observation_id":"b1520a68-7236-423e-be5f-cdc32214bf66","resolution":{"observed_at":"2026-06-30T06:24:18.527542Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:02.919694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:02.919694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.16763","snapshot_observed_at":"2026-08-02T09:38:57.339813Z","title":"S., Rawal, R., Zouhar, V., Yadav, S., Whitehouse, C., Ki, D., Mickel, J., Choshen, L., Šuppa, M., Batzner, J., Chim, J., Sania, J., Long, Y., Rahmani, H","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.30219","last_updated":"2026-07-31T12:14:44Z","snapshot_observed_at":"2026-08-05T20:18:04.402492Z","submitted_at":"2026-06-29T12:33:06Z","title":"EvalSafetyGap: A Hybrid Survey and Conceptual Framework for LLM Evaluation-Safety Failures","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T09:38:57.339813Z"},"links":{"cited_paper":"/paper/2602.16763","citing_paper":"/paper/2606.30219"},"observation_digest":"sha256:c68321340c74c3cfb2a8dc535df1cc50587cd3fd168d11267a10edeb8639f454","observation_id":"a41c46dd-78f5-4178-a2c8-60645e838e5f","resolution":{"observed_at":"2026-08-02T09:38:57.339813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.16763","snapshot_observed_at":"2026-08-03T02:07:27.890189Z","title":"S., Rawal, R., Zouhar, V., Yadav, S., Whitehouse, C., Ki, D., Mickel, J., Choshen, L., Šuppa, M., Batzner, J., Chim, J., Sania, J., Long, Y., Rahmani, H","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.30219","last_updated":"2026-07-31T12:14:44Z","snapshot_observed_at":"2026-08-05T20:18:04.402492Z","submitted_at":"2026-06-29T12:33:06Z","title":"EvalSafetyGap: A Hybrid Survey and Conceptual Framework for LLM Evaluation-Safety Failures","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T02:07:27.890189Z"},"links":{"cited_paper":"/paper/2602.16763","citing_paper":"/paper/2606.30219"},"observation_digest":"sha256:03dfab8159330d791b9c35789a8b4e422fdaa446dc38f2def2989f917c160862","observation_id":"0247edde-e7ae-4f33-85a2-4f787075ae99","resolution":{"observed_at":"2026-08-03T02:07:27.890189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.16763","snapshot_observed_at":"2026-07-15T08:35:47.870083Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11999","last_updated":"2026-07-15T02:43:14Z","snapshot_observed_at":"2026-08-02T23:32:24.396963Z","submitted_at":"2026-07-13T17:48:25Z","title":"Underwriting the Agent Economy: The Blueprint for an AI Insurance Stack","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-15T08:35:47.870083Z"},"links":{"cited_paper":"/paper/2602.16763","citing_paper":"/paper/2607.11999"},"observation_digest":"sha256:2f5b8bf5a7646f768a085ca08b7a4f51f3c5e70a08f17d20e19fcb4a74a3a03a","observation_id":"e8e411ce-4fa7-4a8a-99a5-e184655474aa","resolution":{"observed_at":"2026-07-15T08:35:47.870083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.16763","snapshot_observed_at":"2026-08-02T06:46:18.128226Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11999","last_updated":"2026-07-15T02:43:14Z","snapshot_observed_at":"2026-08-02T23:32:24.396963Z","submitted_at":"2026-07-13T17:48:25Z","title":"Underwriting the Agent Economy: The Blueprint for an AI Insurance Stack","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T06:46:18.128226Z"},"links":{"cited_paper":"/paper/2602.16763","citing_paper":"/paper/2607.11999"},"observation_digest":"sha256:767bbb680b2571349a61efc6946f8d2be84c9bf9407ec8dda590e989b7d61367","observation_id":"691aeb6c-63af-4bcb-95c6-a49321aeaea5","resolution":{"observed_at":"2026-08-02T06:46:18.128226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.16763","snapshot_observed_at":"2026-08-02T14:45:34.486904Z","title":"Akhtar, A","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14112","last_updated":"2026-05-08T06:06:18Z","snapshot_observed_at":"2026-08-05T09:11:41.468130Z","submitted_at":"2026-05-08T06:06:18Z","title":"Information-Theoretic Limits of Reliability and Scaling in Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T14:45:34.486904Z"},"links":{"cited_paper":"/paper/2602.16763","citing_paper":"/paper/2607.14112"},"observation_digest":"sha256:4d4e42fecc72b26cbacb0f470ff8297b39badfd655438eb9cb0261e6c2df5e3e","observation_id":"5e9f13b0-9a8a-424b-9b86-33930f4e895e","resolution":{"observed_at":"2026-08-02T14:45:34.486904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.16763","snapshot_observed_at":"2026-08-01T22:57:58.877253Z","title":"When AI benchmarks plateau: A systematic study of benchmark saturation.arXiv preprint arXiv:2602.16763,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15587","last_updated":"2026-07-17T03:18:17Z","snapshot_observed_at":"2026-08-03T21:14:30.487558Z","submitted_at":"2026-07-17T03:18:17Z","title":"Rethinking Transfer in Continual Learning: A Replay-Based Realisation","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-01T22:57:58.877253Z"},"links":{"cited_paper":"/paper/2602.16763","citing_paper":"/paper/2607.15587"},"observation_digest":"sha256:4a9bbaca63928ca8a81ca0144a41deb4f67d486f23b67f9647437ec789c5ab83","observation_id":"74817a94-953e-4b35-8b49-f3ecd1261629","resolution":{"observed_at":"2026-08-01T22:57:58.877253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.16763","snapshot_observed_at":"2026-08-02T09:51:05.944741Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19375","last_updated":"2026-06-26T22:26:40Z","snapshot_observed_at":"2026-08-05T19:43:59.996887Z","submitted_at":"2026-06-26T22:26:40Z","title":"Economic Evaluations of Language Models","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-02T09:51:05.944741Z"},"links":{"cited_paper":"/paper/2602.16763","citing_paper":"/paper/2607.19375"},"observation_digest":"sha256:78ed03e1678d065bcd6d3d94538b69ef3a4f1dbe4afc02b88d4899063914a4a7","observation_id":"280fc8e5-0241-40c8-a4c8-56bde827c6d3","resolution":{"observed_at":"2026-08-02T09:51:05.944741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.16763","snapshot_observed_at":"2026-08-04T00:44:35.676493Z","title":", author Reuel, A","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00680","last_updated":"2026-08-01T14:01:17Z","snapshot_observed_at":"2026-08-05T19:45:52.701782Z","submitted_at":"2026-08-01T14:01:17Z","title":"Multi-Dimensional Assessment for AI Cognition (MAAC): A Theoretical Framework for Process-Oriented Cognitive Evaluation of Text-Based AI Systems","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T00:44:35.676493Z"},"links":{"cited_paper":"/paper/2602.16763","citing_paper":"/paper/2608.00680"},"observation_digest":"sha256:137607e0c82fa2817d8bb8ec3d8fd43e5767b9c390b5d0d237019ff6fd41103f","observation_id":"8d8cc822-fd72-44de-a898-d4e60d06251f","resolution":{"observed_at":"2026-08-04T00:44:35.676493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.16763","snapshot_observed_at":"2026-08-04T00:44:43.810112Z","title":"arXiv preprint arXiv:2602.16763 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00680","last_updated":"2026-08-01T14:01:17Z","snapshot_observed_at":"2026-08-05T19:45:52.701782Z","submitted_at":"2026-08-01T14:01:17Z","title":"Multi-Dimensional Assessment for AI Cognition (MAAC): A Theoretical Framework for Process-Oriented Cognitive Evaluation of Text-Based AI Systems","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-04T00:44:43.810112Z"},"links":{"cited_paper":"/paper/2602.16763","citing_paper":"/paper/2608.00680"},"observation_digest":"sha256:c0a77cfe96e423d75b70579e6d533c76ee6f88696ef3bf1f88bd78828e8fede9","observation_id":"94b0b308-281c-4648-966f-60f6308eeddf","resolution":{"observed_at":"2026-08-04T00:44:43.810112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2602.16763/citation-record","integrity":"/paper/2602.16763/integrity","json":"/paper/2602.16763/citation-record.json","paper":"/paper/2602.16763"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-02T22:31:49.493953Z","title":"ISBN 979-8-89176-256-5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:49.493953Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2602.16763"},"observation_digest":"sha256:bbebec3ad522e35065acb99e775cadd8b6d44fa6539e6d2cba5acdef5db4efae","observation_id":"f3c806a3-43e1-43bd-abe2-0adaa5c2aa63","resolution":{"observed_at":"2026-08-02T22:31:49.493953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.13081","last_updated":"2020-09-28T05:07:51Z","snapshot_observed_at":"2026-08-01T00:01:44.041077Z","submitted_at":"2020-09-28T05:07:51Z","title":"What Disease does this Patient Have? A Large-scale Open Domain Question Answering Dataset from Medical Exams","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.13081","snapshot_observed_at":"2026-08-02T22:31:49.712067Z","title":"Jin, D., Pan, E., Oufattole, N., Weng, W.-H., Fang, H., and Szolovits, P","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:49.712067Z"},"links":{"cited_paper":"/paper/2009.13081","citing_paper":"/paper/2602.16763"},"observation_digest":"sha256:62f7f33e22df172a018cb5926fbcd6845223ada45cf350e63f4a8bbea17bd706","observation_id":"7b58905e-cc33-4c8e-be5d-b61d9360f42b","resolution":{"observed_at":"2026-08-02T22:31:49.712067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19314","last_updated":"2025-04-18T19:36:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-27T16:47:42Z","title":"LiveBench: A Challenging, Contamination-Limited LLM Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19314","snapshot_observed_at":"2026-08-02T22:31:50.310505Z","title":"White, C., Dooley, S., Roberts, M., Pal, A., Feuer, B., Jain, S., Shwartz-Ziv, R., Jain, N., Saifullah, K., Dey, S., Shubh-Agrawal, Sandha, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:50.310505Z"},"links":{"cited_paper":"/paper/2406.19314","citing_paper":"/paper/2602.16763"},"observation_digest":"sha256:05d17856b2b3c1b30186cf29ae9e918fe5d7fdd96fa06599ffb9767be27c9f8b","observation_id":"b40a0510-7c23-4b12-afc3-ef30a00e6805","resolution":{"observed_at":"2026-08-02T22:31:50.310505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07982","last_updated":"2025-06-09T17:52:18Z","snapshot_observed_at":"2026-07-06T21:39:13.304260Z","submitted_at":"2025-06-09T17:52:18Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07982","snapshot_observed_at":"2026-08-02T22:31:49.155720Z","title":"Barres, V ., Dong, H., Ray, S., Si, X., and Narasimhan, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:49.155720Z"},"links":{"cited_paper":"/paper/2506.07982","citing_paper":"/paper/2602.16763"},"observation_digest":"sha256:8bf0be1bf4fa2dc6caa69cf04ccea084a2669b76b2605d360ac73bb404a0f099","observation_id":"0417d2f9-5519-4c5f-b5bc-6099c4622281","resolution":{"observed_at":"2026-08-02T22:31:49.155720Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-02T22:31:50.438762Z","title":"shortcuts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"reference_index":149,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:50.438762Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2602.16763"},"observation_digest":"sha256:0d3b2129b7022d7ac45ae26b95f3172d53326f8535566bbae57cfc1a54d55112","observation_id":"3b6ef3d5-a115-45dc-9148-6bee456752b1","resolution":{"observed_at":"2026-08-02T22:31:50.438762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:49.362316Z","title":"naacl-long.235/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"reference_index":235,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:49.362316Z"},"links":{"citing_paper":"/paper/2602.16763"},"observation_digest":"sha256:27bfd36d296d4235cb12fd06583c91e663ea9271903f3dc1773bed053d0682d7","observation_id":"a06aebcd-19f3-4aa5-a0cf-5b7b1c528a6a","resolution":{"observed_at":"2026-08-02T22:31:49.362316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-02T22:31:50.154870Z","title":"findings-acl.349","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"reference_index":349,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:50.154870Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2602.16763"},"observation_digest":"sha256:9596cc2674a71107b93b0f9398a7f2736206f0ecfddb59d89f2b0c6c2c75ba66","observation_id":"caeb7d52-bc16-4fac-a8f0-5664799f36bc","resolution":{"observed_at":"2026-08-02T22:31:50.154870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06031","last_updated":"2016-06-20T09:37:17Z","snapshot_observed_at":"2026-08-05T16:27:22.031013Z","submitted_at":"2016-06-20T09:37:17Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06031","snapshot_observed_at":"2026-08-02T22:31:49.912866Z","title":"naacl-main.391/","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"reference_index":391,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:49.912866Z"},"links":{"cited_paper":"/paper/1606.06031","citing_paper":"/paper/2602.16763"},"observation_digest":"sha256:e87793e0c4195e9e146aed18cc95f7878a2f4e934dbfda68671e267f4a762803","observation_id":"5136f8e4-b6ad-4574-bb8c-b19f221d02e0","resolution":{"observed_at":"2026-08-02T22:31:49.912866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:49.093951Z","title":"acl-long.744/","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"reference_index":744,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:49.093951Z"},"links":{"citing_paper":"/paper/2602.16763"},"observation_digest":"sha256:13dba754550f25d7d0ab381a5fd5a1340468d119ce7eb85592d752dfd63639dc","observation_id":"65a4a9a5-6d7b-4775-9165-ffad68427178","resolution":{"observed_at":"2026-08-02T22:31:49.093951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.14858","last_updated":"2022-07-01T02:15:12Z","snapshot_observed_at":"2026-08-05T15:41:22.691461Z","submitted_at":"2022-06-29T18:54:49Z","title":"Solving Quantitative Reasoning Problems with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.14858","snapshot_observed_at":"2026-08-02T22:31:49.798678Z","title":"URL https:// aclanthology.org/Q19-1026/","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:49.798678Z"},"links":{"cited_paper":"/paper/2206.14858","citing_paper":"/paper/2602.16763"},"observation_digest":"sha256:ed84db4612db7c843691aa221b5377a358e99ae69982d748413953a61971903e","observation_id":"525c5edd-54fd-4ea3-8071-1cf2c1945008","resolution":{"observed_at":"2026-08-02T22:31:49.798678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03304","last_updated":"2025-02-19T13:30:23Z","snapshot_observed_at":"2026-07-06T20:01:32.313250Z","submitted_at":"2024-12-04T13:27:09Z","title":"Global MMLU: Understanding and Addressing Cultural and Linguistic Biases in Multilingual Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03304","snapshot_observed_at":"2026-08-02T22:31:50.017966Z","title":"Siddhant, A., Hu, J., Johnson, M., Firat, O., and Ruder, S","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:50.017966Z"},"links":{"cited_paper":"/paper/2412.03304","citing_paper":"/paper/2602.16763"},"observation_digest":"sha256:2b432b4c83eb26b85438384e5ae10bd004709aa152d7e2eec5564d335a41c022","observation_id":"9185ab9c-7987-4f7e-bc58-a4d9312e495b","resolution":{"observed_at":"2026-08-02T22:31:50.017966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03200","last_updated":"2025-01-06T18:28:04Z","snapshot_observed_at":"2026-07-06T20:17:11.484017Z","submitted_at":"2025-01-06T18:28:04Z","title":"The FACTS Grounding Leaderboard: Benchmarking LLMs' Ability to Ground Responses to Long-Form Input","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03200","snapshot_observed_at":"2026-08-02T22:31:49.587447Z","title":"Google Deep- Mind, Google Research, Google Cloud, Kaggle","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:49.587447Z"},"links":{"cited_paper":"/paper/2501.03200","citing_paper":"/paper/2602.16763"},"observation_digest":"sha256:3cc3401870deb5262834630ebe53d9540943d207cb356f11e8e0fa4121a8dc91","observation_id":"a2d6b555-5801-431f-b0a6-01762320e696","resolution":{"observed_at":"2026-08-02T22:31:49.587447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:31:49.259990Z","title":"ISBN 979-8-89176-189-6","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T22:31:49.259990Z"},"links":{"citing_paper":"/paper/2602.16763"},"observation_digest":"sha256:ecd67964b1fa42087e22f50235487742cf72c8d543fd6924eb322acdcee58465","observation_id":"8c9315ac-3235-43f6-9ad2-c51a545d6aa8","resolution":{"observed_at":"2026-08-02T22:31:49.259990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 22 inbound Pith citation observations for arXiv:2602.16763."}