{"as_of":"2026-08-08T01:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3b9161de5f566379bfaf6841896b148b274d5df5d1c299bbca59f42f69521502","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:44:36.904062Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06202/citation-record","integrity":"/paper/2608.06202/integrity","json":"/paper/2608.06202/citation-record.json","paper":"/paper/2608.06202"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:31.564761Z","title":"2026 , note=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:31.564761Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:934c5ab67cafa39cb557c8b63bdaed845db539c33c951aef52d88cf92f7dab35","observation_id":"26221a13-0976-4b7c-8ff5-babd1a283942","resolution":{"observed_at":"2026-08-07T12:44:31.564761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:07.932513Z","title":"Findings of the","venue":null,"work_id":"3b47edd5-0141-4e59-8410-875d0e1e734f","year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:31.623981Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:7b4573a0294a2571121f378a3e8741566aa71f62bb063b250f7ec0d91e48843e","observation_id":"622a2c7a-90e9-427b-bd74-9178d043a17c","resolution":{"observed_at":"2026-08-07T12:45:07.990676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:07.779774Z","title":"Proceedings of the 62nd","venue":null,"work_id":"13d089b4-6045-4e1d-8214-1bb513fe9aa9","year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:31.700906Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:e8dc46567cbbe1a7754767d6ab30e79c40a6f79985eb96040d9151605954b82b","observation_id":"462ca983-a498-4f75-b75c-16294ff53ff8","resolution":{"observed_at":"2026-08-07T12:45:07.837480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:07.622801Z","title":"Proceedings of the 10th SIGHAN Workshop on Chinese Language Processing (SIGHAN-10) , pages=","venue":null,"work_id":"5dca8a7c-7e1f-4adc-b711-f60402307c93","year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:31.813047Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:d3785ac5b060ba8fc7d1b7e5b9301594f4f42c922ff13a11449abb1a7446511c","observation_id":"dee58e1d-f0a9-4e4e-8c85-9406f8f71f35","resolution":{"observed_at":"2026-08-07T12:45:07.677459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14851","last_updated":"2025-05-09T05:26:43Z","snapshot_observed_at":"2026-07-06T20:25:49.871084Z","submitted_at":"2025-01-24T15:49:10Z","title":"JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14851","snapshot_observed_at":"2026-08-07T12:44:31.930407Z","title":"arXiv preprint arXiv:2501.14851 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:31.930407Z"},"links":{"cited_paper":"/paper/2501.14851","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:9736232b913a8a542c88a1edb6907879751515a293d93842cc5dc3262d1a41c1","observation_id":"1d6aa5bc-2a07-47f9-8374-28c6e9e277b0","resolution":{"observed_at":"2026-08-07T12:44:31.930407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:07.457602Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":"325bd4e9-ca91-42aa-afef-0945116300a1","year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:32.026529Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:dd4e9ed2cfe5b7cf105bd92000bd569d8bb2bf28812387cbdc61da06e32979df","observation_id":"71b7280e-9268-4942-ae0b-d9bd554abc3b","resolution":{"observed_at":"2026-08-07T12:45:07.547709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02735","last_updated":"2025-05-05T15:37:00Z","snapshot_observed_at":"2026-08-07T23:36:07.412083Z","submitted_at":"2025-05-05T15:37:00Z","title":"FormalMATH: Benchmarking Formal Mathematical Reasoning of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02735","snapshot_observed_at":"2026-08-07T12:44:32.091734Z","title":"arXiv preprint arXiv:2505.02735 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:32.091734Z"},"links":{"cited_paper":"/paper/2505.02735","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:6ebdc3304395ba2ecfb9fa0c30be44c2a3cb33d24d87493e7cbbece43c34954a","observation_id":"60b402ce-04b2-4459-b5f6-e38590f0a660","resolution":{"observed_at":"2026-08-07T12:44:32.091734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:07.228929Z","title":"European Semantic Web Conference , pages=","venue":null,"work_id":"9bc5f375-39a8-4ab5-a3c2-7ce6b5ac437a","year":2023},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:32.198014Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:edabff42c863f053a92510d1030f9429de8a74621810e50d12434a5be88cd9fe","observation_id":"f4f4de7f-479c-4700-a2e9-6569fef31de5","resolution":{"observed_at":"2026-08-07T12:45:07.332701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:32.295139Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:32.295139Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:6db2f473dc0836f3acffc89bece41e2341a2c85478744b23af53df1be19f5c51","observation_id":"8c2e8861-ca7c-4252-972b-efc4ed7283d9","resolution":{"observed_at":"2026-08-07T12:44:32.295139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:32.383467Z","title":"Proceedings of the 60th annual meeting of the association for computational linguistics (volume 1: long papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:32.383467Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:9bb038339af94d16734e5f11a82b2b8bda1db9bfb3eecc2f893cb63148319f46","observation_id":"94a50989-6931-4d0e-a9fa-d8b75f58de0a","resolution":{"observed_at":"2026-08-07T12:44:32.383467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T12:44:32.454833Z","title":"arXiv preprint arXiv:2107.03374 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:32.454833Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:141deca9d7b138507cf478d2591756ffaa74a78ca19a61cb574d91cceac16e91","observation_id":"68e4a836-098f-4d8f-b437-4c400f68a726","resolution":{"observed_at":"2026-08-07T12:44:32.454833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:06.804754Z","title":"Proceedings of the 2021 conference of the North American chapter of the association for computational linguistics: human language technologies , pages=","venue":null,"work_id":"bbfe9f83-ae5e-41a5-877a-dee865ef74ad","year":2021},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:32.497238Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:946c23766f86859002921858f9fd3efa279eaeb55493c44f32fa73ac6e6ad90a","observation_id":"70309c71-8603-499e-99da-07f30a0a32c8","resolution":{"observed_at":"2026-08-07T12:45:06.985875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:32.549221Z","title":"Findings of the association for computational linguistics: EMNLP 2020 , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:32.549221Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:c11e349ff1424ae8c16cc9604cae26b9c15d30c71bb6415009aea0c54184634c","observation_id":"cfb01546-9fc0-4fbd-97f4-7857da88a24e","resolution":{"observed_at":"2026-08-07T12:44:32.549221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:06.456394Z","title":"Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":"45d8032e-37a5-40d1-bcd9-0fef064d672e","year":2022},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:32.617451Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:587f4de230a7a995932268f1714afa19c6f030d4207443b5314c3bd246fc3abf","observation_id":"a7228e6f-6477-4bf1-98c1-836015154b6f","resolution":{"observed_at":"2026-08-07T12:45:06.595044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:06.281891Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":"f168172b-396c-4fd5-89a0-c60dd07c6f02","year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:32.703087Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:2e042bc4c9025f3c517e153cd12009b1b44d3159a5a677969993ea2b5f7e673f","observation_id":"2d72a67a-258c-4fa6-8534-0578564f6b3c","resolution":{"observed_at":"2026-08-07T12:45:06.360053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:32.795670Z","title":"C row S -Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:32.795670Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:d98a7303330f119785796f4a2e51245c2e091d4fd05754a78d6704934b51666c","observation_id":"e8d60a6d-d40b-46f5-8eb6-d5ffcf91416b","resolution":{"observed_at":"2026-08-07T12:44:32.795670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:06.209312Z","title":"Transactions on Machine Learning Research , doi =","venue":null,"work_id":"98019e76-d756-4e03-a8fb-16e9c149bbf3","year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:32.882722Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:59f9785ccea7a9a0fe8bfa7d69ccb83bf1f7c64f722f1e5698d24ac2e16aa1b8","observation_id":"b47d6d3e-4761-4dc4-a5f8-a6b66cf1012b","resolution":{"observed_at":"2026-08-07T12:45:06.241243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:32.978703Z","title":"ACM transactions on intelligent systems and technology , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:32.978703Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:ae2ab0285e679e0071c9ab82cfec67b35f196958946e5f8a15b727784977e7ad","observation_id":"8ef6a630-248e-4bea-aecf-078d979fbb64","resolution":{"observed_at":"2026-08-07T12:44:32.978703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:33.102903Z","title":"Transactions on machine learning research , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:33.102903Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:8ac7493d5299ed1fd40f6f20320540279ebcdcf4b46661f6bc633e680f2583d4","observation_id":"7776f9c7-d798-446f-a516-ba187f2bbd87","resolution":{"observed_at":"2026-08-07T12:44:33.102903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T12:44:33.168261Z","title":"arXiv preprint arXiv:2009.03300 , year=","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:33.168261Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:c3f476ea697b9078473c43fe06ce042b8ef1e26cc19a1d163551dad5ed3bee25","observation_id":"83be2d93-8c2c-4244-b90c-003d12d088db","resolution":{"observed_at":"2026-08-07T12:44:33.168261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:33.260360Z","title":"Findings of the Association for Computational Linguistics: NAACL 2024 , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:33.260360Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:77946229d0927cfc978c9d8c12761349ce007d012f89bf78d14e12ace80bd7e6","observation_id":"fe0054e4-ac38-4184-9bbe-44a120d787cb","resolution":{"observed_at":"2026-08-07T12:44:33.260360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:33.369494Z","title":"P ro SA : Assessing and Understanding the Prompt Sensitivity of LLM s","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:33.369494Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:51656c4bba148387a8e05d0c4b8876da02d2265749f560fbf624128e28314da5","observation_id":"086b3cad-130d-45e1-8776-16f61cd85221","resolution":{"observed_at":"2026-08-07T12:44:33.369494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:33.461520Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:33.461520Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:ee3b22d1194d233fae97c6b10cfcb126684b1cbd80ecc270f38fea7c0fde67ac","observation_id":"f92216a6-268c-4b31-bd92-8fc6e0a4b4bb","resolution":{"observed_at":"2026-08-07T12:44:33.461520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:05.804763Z","title":"Proceedings of the 1st ACM workshop on large AI systems and models with privacy and safety analysis , pages=","venue":null,"work_id":"27ae2031-3d3f-4be6-9678-07a4bbf9df55","year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:33.550095Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:ecb112534d26c4f2c60671e431c332f276ad9b211b95e99f1fbcdf8d9114ea21","observation_id":"1e24bf35-9c64-4a7b-aa78-09c43b5ead4d","resolution":{"observed_at":"2026-08-07T12:45:05.861608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08329","last_updated":"2024-01-16T12:49:00Z","snapshot_observed_at":"2026-07-06T17:16:08.962172Z","submitted_at":"2024-01-16T12:49:00Z","title":"Understanding User Experience in Large Language Model Interactions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08329","snapshot_observed_at":"2026-08-07T12:44:33.653851Z","title":"arXiv preprint arXiv:2401.08329 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:33.653851Z"},"links":{"cited_paper":"/paper/2401.08329","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:46f1a8b418d77e12a75997ca5ba78b9802e0f2c9675cbfc168362aeb14faa96a","observation_id":"fe0a5809-6866-4f94-a79c-1da3448024a0","resolution":{"observed_at":"2026-08-07T12:44:33.653851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-07T12:44:33.736893Z","title":"arXiv preprint arXiv:2403.04132 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:33.736893Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:b956911a73cd505516197af91345980481081cc52cf0b24229d89155405c251d","observation_id":"d46bb22a-b864-4e17-9d3f-89312334bcac","resolution":{"observed_at":"2026-08-07T12:44:33.736893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:05.562104Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"010dacb5-5262-49c2-87b5-7e0dab963a7d","year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:33.804536Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:e1217ab4c000ddab514280afd6158ffaf04de18b0f9ad4047e4a8b9dc3684e60","observation_id":"a8b092d3-0c98-4656-96af-edda0a1640e5","resolution":{"observed_at":"2026-08-07T12:45:05.649164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:33.856791Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:33.856791Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:983b7eccad4558fcdc2f93ff8dead2e3fd9643f766b37ee9807ea464d9e1d88b","observation_id":"0c553b29-49b6-4375-aa24-bdf47c7ce632","resolution":{"observed_at":"2026-08-07T12:44:33.856791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:33.930656Z","title":"arXiv preprint arXiv:2509.19364 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:33.930656Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:620e66e27072dcf0653e5fc5f23438683a519545e5590c1d1c4a9d98df0c76c3","observation_id":"da414d8c-eecd-4044-b747-d975df546e44","resolution":{"observed_at":"2026-08-07T12:44:33.930656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:05.324508Z","title":null,"venue":null,"work_id":"d1ead390-f188-41ce-ab63-ecc49ae4b2f5","year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:33.991547Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:ecb3e190b4617f4fc6c50b387847257bbf99d0cd3dc265f749fd5de8b324a5a7","observation_id":"2e3f3f2b-b54d-4663-a092-ccc87aea3b80","resolution":{"observed_at":"2026-08-07T12:45:05.404673Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:34.071960Z","title":"2023 , isbn =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:34.071960Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:3884861aeb099d1e4620a927ef55732de93a42bff79b86fcc0de793d100d6304","observation_id":"9a9935d0-f7b6-46d0-acd9-2b2a9276d937","resolution":{"observed_at":"2026-08-07T12:44:34.071960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12095","last_updated":"2023-08-29T05:34:25Z","snapshot_observed_at":"2026-08-05T13:57:45.408890Z","submitted_at":"2023-02-22T11:01:20Z","title":"On the Robustness of ChatGPT: An Adversarial and Out-of-distribution Perspective","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12095","snapshot_observed_at":"2026-08-07T12:44:34.189426Z","title":"arXiv preprint arXiv:2302.12095 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:34.189426Z"},"links":{"cited_paper":"/paper/2302.12095","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:69f0b47cf9a0b8ab9ee8bed26878a38256939bd3144e9cc95d4968b01136d6dc","observation_id":"6161cf9b-f2c6-4a51-bb84-19e368a3ece4","resolution":{"observed_at":"2026-08-07T12:44:34.189426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:34.260166Z","title":"Ask Again, Then Fail: Large Language Models' Vacillations in Judgment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:34.260166Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:4c4188920a189b7200ec45bcd5a48b4c6f06300585e3cde6f1125af8caa7f558","observation_id":"9dccb30e-fa97-4f3c-9bda-fba0e3b7e762","resolution":{"observed_at":"2026-08-07T12:44:34.260166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:34.316712Z","title":"S iren ' s Song in the AI Ocean: A Survey on Hallucination in Large Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:34.316712Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:2361b58bf982e2e87c1f84da599167c47ad4758b1cb015a613f5e180a7086277","observation_id":"c0b012f5-87a5-48b6-bcab-0b05fd694512","resolution":{"observed_at":"2026-08-07T12:44:34.316712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:34.409924Z","title":"Proceedings of the 2021 ACM conference on fairness, accountability, and transparency , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:34.409924Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:2740061c563ae88c43e265dc6bd210f939889ffe2d339aeae2a835f56ee4605e","observation_id":"b346a3ab-f126-4e6a-bc5c-5e514e1e25f6","resolution":{"observed_at":"2026-08-07T12:44:34.409924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03738","last_updated":"2023-11-13T17:50:22Z","snapshot_observed_at":"2026-08-07T07:55:04.700807Z","submitted_at":"2023-04-07T17:14:00Z","title":"Should ChatGPT be Biased? Challenges and Risks of Bias in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03738","snapshot_observed_at":"2026-08-07T12:44:34.503503Z","title":"arXiv preprint arXiv:2304.03738 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:34.503503Z"},"links":{"cited_paper":"/paper/2304.03738","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:f254922a400a0d672b9c9a69abe54f80e313b87af949d0bf821201fe32863350","observation_id":"15f074f6-1ad5-452b-af55-9103cc4219d2","resolution":{"observed_at":"2026-08-07T12:44:34.503503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06188","last_updated":"2026-02-20T15:48:56Z","snapshot_observed_at":"2026-07-06T22:54:44.656835Z","submitted_at":"2026-02-20T15:48:56Z","title":"LLM Spirals of Delusion: A Benchmarking Audit Study of AI Chatbot Interfaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.06188","snapshot_observed_at":"2026-08-07T12:44:34.565332Z","title":"arXiv preprint arXiv:2604.06188 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:34.565332Z"},"links":{"cited_paper":"/paper/2604.06188","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:2d25294491951a92b9c2a8c95404f594b881119b2a3c6b02133707fbf5893b37","observation_id":"1313c07f-0d7c-4d4e-9d24-d81a7fb31217","resolution":{"observed_at":"2026-08-07T12:44:34.565332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:05.062391Z","title":"Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society , number=","venue":null,"work_id":"8f32e741-31c6-4ddd-9c46-1a1b2a1ee41f","year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:34.623847Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:2e158b775b7d25035068b70e39c11e3a5c6c80ffa3f4bc7b5b8c8952251220e7","observation_id":"a458f07a-0ffa-4f31-865f-231be2c48040","resolution":{"observed_at":"2026-08-07T12:45:05.151838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:04.835565Z","title":"Practices for","venue":null,"work_id":"f7adf6e7-f238-4eab-9e63-39710f768f4b","year":2026},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:34.700820Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:af7317a78e4d53b89c32093b2e848bac4c0705738b5e3a120716223b82661f7c","observation_id":"96133c27-3520-4a5a-9715-6591749ebe40","resolution":{"observed_at":"2026-08-07T12:45:04.934779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:04.590969Z","title":null,"venue":null,"work_id":"a30fd396-9d4f-462e-b3de-13e65634add7","year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:34.816885Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:ddf0c5bb1d7661961ccf6b3e723f2ef3bea8d555933b5502bcf8a53945b3b545","observation_id":"856bbd95-784c-4347-abaf-daea68706d34","resolution":{"observed_at":"2026-08-07T12:45:04.655486Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.02275","last_updated":"2023-02-17T16:08:22Z","snapshot_observed_at":"2026-08-06T11:22:24.347810Z","submitted_at":"2020-08-05T17:59:16Z","title":"Aligning AI With Shared Human Values","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.02275","snapshot_observed_at":"2026-08-07T12:44:34.935769Z","title":"arXiv preprint arXiv:2008.02275 , year=","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:34.935769Z"},"links":{"cited_paper":"/paper/2008.02275","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:356b252416d87fae57eb1e5086235cf8cfa863ca31912a848e25ffce09dc57a5","observation_id":"f43044d6-d349-4364-bbd8-fb8fb3bedbbb","resolution":{"observed_at":"2026-08-07T12:44:34.935769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05336","last_updated":"2025-03-13T00:09:08Z","snapshot_observed_at":"2026-08-07T17:22:23.185186Z","submitted_at":"2025-03-07T11:23:48Z","title":"Toward an Evaluation Science for Generative AI Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05336","snapshot_observed_at":"2026-08-07T12:44:35.042357Z","title":"arXiv preprint arXiv:2503.05336 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:35.042357Z"},"links":{"cited_paper":"/paper/2503.05336","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:0605626c30501be707876fd3c03b0a765e109d4d0628aeefa04721e8adf7dea3","observation_id":"d834dcae-40d0-4cbc-95ab-648cf68eb808","resolution":{"observed_at":"2026-08-07T12:44:35.042357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:35.125805Z","title":"Science , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:35.125805Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:2bcc24eb124cb61840e92ff64372da4de70155fb2b192c82b94ffb98dea984ba","observation_id":"daa23e92-20a0-4295-a933-fcdb476df63d","resolution":{"observed_at":"2026-08-07T12:44:35.125805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.24963/ijcai.2022/392","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:02.893684Z","title":null,"venue":null,"work_id":"991cdf2e-a8ae-426c-b087-b33bae58e32e","year":2022},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:35.232606Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:437cc63414a003367ce6b1513c477ea734141e9d1792b760d089d083b28ce362","observation_id":"0ca37549-c4c5-45e5-970c-15f40d1808ec","resolution":{"observed_at":"2026-08-07T12:45:02.931158Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03597","last_updated":"2024-12-02T20:49:21Z","snapshot_observed_at":"2026-08-05T12:03:49.244891Z","submitted_at":"2024-12-02T20:49:21Z","title":"The Vulnerability of Language Model Benchmarks: Do They Accurately Reflect True LLM Performance?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03597","snapshot_observed_at":"2026-08-07T12:44:35.307850Z","title":"arXiv preprint arXiv:2412.03597 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:35.307850Z"},"links":{"cited_paper":"/paper/2412.03597","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:3dbc6e990ed70628bc7f4196286546c59aee2eb58742c720801f515289a6f543","observation_id":"7bcf96d0-68e2-4d3c-b056-ed6c588043bb","resolution":{"observed_at":"2026-08-07T12:44:35.307850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:35.393890Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:35.393890Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:802c9e42a5a0676162572cb6c4bf179f133a8cb1ef259710b485f569e0f3fc02","observation_id":"05b8b964-fc11-4886-a522-ddbc7f20ed3f","resolution":{"observed_at":"2026-08-07T12:44:35.393890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.15366","last_updated":"2021-11-26T19:39:34Z","snapshot_observed_at":"2026-08-07T00:21:07.584753Z","submitted_at":"2021-11-26T19:39:34Z","title":"AI and the Everything in the Whole Wide World Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.15366","snapshot_observed_at":"2026-08-07T12:44:35.451657Z","title":"and Paullada, Amandalynne and Denton, Emily and Hanna, Alex , year = 2021, month = nov, eprint =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:35.451657Z"},"links":{"cited_paper":"/paper/2111.15366","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:25b7428d2ea3d988655bbb1ffcd17299a23a61cd2350d81d3cb08ae65f90e8d7","observation_id":"09ebe1db-820d-48ac-9d25-7ef4f3d17a2b","resolution":{"observed_at":"2026-08-07T12:44:35.451657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:35.498690Z","title":"Proceedings of the 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:35.498690Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:e7bf41775f4a0ab9392a2f9e13c9f72e5669e772521551548a3a68726c308ca3","observation_id":"c3f7131e-5e38-46df-9f2a-7ea4c19805f0","resolution":{"observed_at":"2026-08-07T12:44:35.498690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:35.593629Z","title":"Rethinking","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:35.593629Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:b680f59be719a0d967c407d2fb95e6dbfc4c93fcf406b3b47884312c7f94acdd","observation_id":"2808b874-9e30-4988-997d-b30941a981eb","resolution":{"observed_at":"2026-08-07T12:44:35.593629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00561","last_updated":"2025-06-06T22:15:14Z","snapshot_observed_at":"2026-07-06T20:29:36.154633Z","submitted_at":"2025-02-01T21:09:51Z","title":"Position: Evaluating Generative AI Systems Is a Social Science Measurement Challenge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00561","snapshot_observed_at":"2026-08-07T12:44:35.707630Z","title":"arXiv preprint arXiv:2502.00561 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:35.707630Z"},"links":{"cited_paper":"/paper/2502.00561","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:1438aaf493ef0f034dfb8bf01b205eca1246e3ccfac6468bdda6f6d94633c360","observation_id":"90fdb2a7-d6a1-4bdf-a364-b147057f1c14","resolution":{"observed_at":"2026-08-07T12:44:35.707630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:35.776696Z","title":"Outsider","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:35.776696Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:aea8cb14024dd639b7dce63f2ad82d921531aa0640715ded1441fa933df3661a","observation_id":"2ff3cc6b-80e4-4297-a894-ab5196b95f4d","resolution":{"observed_at":"2026-08-07T12:44:35.776696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11986","last_updated":"2023-10-31T18:23:32Z","snapshot_observed_at":"2026-08-02T09:23:01.679296Z","submitted_at":"2023-10-18T14:13:58Z","title":"Sociotechnical Safety Evaluation of Generative AI Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11986","snapshot_observed_at":"2026-08-07T12:44:35.836468Z","title":"arXiv preprint arXiv:2310.11986 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:35.836468Z"},"links":{"cited_paper":"/paper/2310.11986","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:d6a6690883a29de997f6a3cb007dc9690ab3b31f7d430cb252444ae69de9098e","observation_id":"7a18bd0c-da49-4965-981a-f5c1d621b604","resolution":{"observed_at":"2026-08-07T12:44:35.836468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14782","last_updated":"2026-05-31T00:04:33Z","snapshot_observed_at":"2026-08-07T18:21:12.072228Z","submitted_at":"2024-05-23T16:50:49Z","title":"Lessons from the Trenches on Reproducible Evaluation of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14782","snapshot_observed_at":"2026-08-07T12:44:35.911671Z","title":"arXiv preprint arXiv:2405.14782 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:35.911671Z"},"links":{"cited_paper":"/paper/2405.14782","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:153c92c7ad427974d00ca8713d663651745c29ec7a65880f6f2bf10078860e92","observation_id":"3825143f-fd23-4b60-8b37-122987b4325c","resolution":{"observed_at":"2026-08-07T12:44:35.911671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:04.334647Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"705a2d5b-f6df-4604-bd7d-6484c930db09","year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:35.996295Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:e30ed6ad0af76b2e0cba3a1c7c31213cb8d7b5bfb63756c932c73dc3b6a4e123","observation_id":"095f31e1-3024-4640-83ae-201405d6b4e2","resolution":{"observed_at":"2026-08-07T12:45:04.439156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:04.095112Z","title":"Proceedings of the 29th international conference on computational linguistics , pages=","venue":null,"work_id":"c430b6c7-ea6f-4299-b8cd-73f758be2b5e","year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:36.106520Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:c2d581b30ed94f6afc273f16912752a90a4399815927e703e2b5018e1114411f","observation_id":"19b54a70-5013-4aab-b741-c30f055a0581","resolution":{"observed_at":"2026-08-07T12:45:04.212267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:36.193313Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:36.193313Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:a186af29dbef31d557382d6820e9b7dd8524abc274368cfa3473ee3ff0da532e","observation_id":"b7ea2215-28e0-437e-82e8-bb84696ebfb7","resolution":{"observed_at":"2026-08-07T12:44:36.193313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:36.278667Z","title":"Findings of the Association for Computational Linguistics: ACL 2024 , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:36.278667Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:870c3c3e3647f82901d51e87de87a7ed5930881e3c7e883889ec8430d3a7d849","observation_id":"4e9c0f34-3323-44d4-89bd-3ce922ffa349","resolution":{"observed_at":"2026-08-07T12:44:36.278667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12516","last_updated":"2025-04-16T22:27:45Z","snapshot_observed_at":"2026-08-03T00:43:33.338074Z","submitted_at":"2025-04-16T22:27:45Z","title":"BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12516","snapshot_observed_at":"2026-08-07T12:44:36.345910Z","title":"arXiv preprint arXiv:2504.12516 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:36.345910Z"},"links":{"cited_paper":"/paper/2504.12516","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:a336d80f6e3d2106fc497fda4b7af2a2c2618b6cf746a1680a7f7d20b6f58f57","observation_id":"d7b4a3c1-3323-44c2-8021-4b673020cabd","resolution":{"observed_at":"2026-08-07T12:44:36.345910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2506.05334","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:37.315551Z","title":"and Darrell, Trevor and Norouzi, Narges and Gonzalez, Joseph E","venue":null,"work_id":"21eb19dc-1554-441e-a6ef-71c0bd4d5b19","year":2026},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:36.435665Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:be68d95db8ab46014f34de60903d6aa5664458c9bb1c7b9e425de7ff7d16eba2","observation_id":"91789132-3150-4b20-8918-30ab698702b7","resolution":{"observed_at":"2026-08-07T12:45:02.704440Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2511.18931","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:37.089214Z","title":null,"venue":null,"work_id":"8c1d3714-9da1-463f-afa4-58ce954b7130","year":2025},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:36.563039Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:7420a075ef404c9c256619bb65eddd3aae8e2731716062a5c374848788a2e5d7","observation_id":"198004bf-5cd5-4244-8dbd-4afd50b28c74","resolution":{"observed_at":"2026-08-07T12:44:37.153884Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:03.871126Z","title":"Sacred or","venue":null,"work_id":"483fcab3-fb0d-4167-825f-b12812784147","year":2025},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:36.672670Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:a423817235ad1e1da2807b57b642d47a53a975697df751461c5e4d4c6daef067","observation_id":"26b99a95-b552-483f-91de-7b8bd9d9cc69","resolution":{"observed_at":"2026-08-07T12:45:03.955485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09038","last_updated":"2025-06-10T17:57:30Z","snapshot_observed_at":"2026-08-07T04:54:28.526685Z","submitted_at":"2025-06-10T17:57:30Z","title":"AbstentionBench: Reasoning LLMs Fail on Unanswerable Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09038","snapshot_observed_at":"2026-08-07T12:44:36.752949Z","title":", year = 2025, month = jun, number =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:36.752949Z"},"links":{"cited_paper":"/paper/2506.09038","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:c4d18547e3abb6dbb3b3dfcf15e2d512c3092b5315a5e8f5b9cf36ba4483cbf9","observation_id":"5a6ad17b-8612-40c6-a6b1-a94cab07c62f","resolution":{"observed_at":"2026-08-07T12:44:36.752949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7887.37630","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:03.255950Z","title":"and Metaxa, Dana","venue":null,"work_id":"4b145654-89c5-43ec-9cac-50dbb28cc04d","year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:36.796636Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:fc14053c00fb5305be8700aed825fd1c06933f214980730eced5aa93ee073163","observation_id":"b1e89b97-aa78-4cdf-87ea-310d3df49387","resolution":{"observed_at":"2026-08-07T12:45:03.305534Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:44:36.850378Z","title":"Proceedings of the 2020 conference on fairness, accountability, and transparency , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:36.850378Z"},"links":{"citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:a5c95602125f7e7763fc181ae3a13570bbc863ee8b43d9c5e4bc2a7b78737b35","observation_id":"af29f3f7-4e3a-4bc3-9c8a-b23f72efdb87","resolution":{"observed_at":"2026-08-07T12:44:36.850378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16861","last_updated":"2025-03-25T05:12:04Z","snapshot_observed_at":"2026-08-07T16:47:29.242326Z","submitted_at":"2025-03-21T05:09:46Z","title":"In-House Evaluation Is Not Enough: Towards Robust Third-Party Flaw Disclosure for General-Purpose AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16861","snapshot_observed_at":"2026-08-07T12:44:36.904062Z","title":"arXiv preprint arXiv:2503.16861 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T12:44:36.904062Z"},"links":{"cited_paper":"/paper/2503.16861","citing_paper":"/paper/2608.06202"},"observation_digest":"sha256:5ef19ffa6f41c431db76b4606caaa86e1034a8096148773d4dca6685dea00ef0","observation_id":"4b748991-47bb-4794-885b-a35805ba49ce","resolution":{"observed_at":"2026-08-07T12:44:36.904062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06202","last_updated":"2026-08-06T15:58:32Z","latest_version":1,"primary_category":"cs.HC","snapshot_observed_at":"2026-08-08T01:18:09.485324Z","submitted_at":"2026-08-06T15:58:32Z","title":"What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":1,"unresolved":44,"verified_exact":3,"verified_fuzzy":16},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2608.06202."}