{"as_of":"2026-08-09T22:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1736168fd58e39c5f17960d3ca2cae4a43c5aec07b8e22f612e687bc6662ec7a","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:45:25.334279Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03340/citation-record","integrity":"/paper/2608.03340/integrity","json":"/paper/2608.03340/citation-record.json","paper":"/paper/2608.03340"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:33.470519Z","title":null,"venue":null,"work_id":"8d709ef1-4d9a-4a4b-9749-7860fca2359b","year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:20.449417Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:c6048bcfb5fdb139647f5fccb30597acd150544f3d86edd81efccf7635d9c1e1","observation_id":"aa26d19c-07a0-4ccb-8212-206ecd3ff29c","resolution":{"observed_at":"2026-08-05T20:45:33.624847Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:33.301511Z","title":null,"venue":null,"work_id":"fea0d73b-b99b-4697-8745-ed22840c27bf","year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:20.550110Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:d240fd59fa6b917471b41ac6d7407b22477888ac83a5c5407ba7cbde5c0ae840","observation_id":"afb8098b-667d-4ded-baee-5e717cb87a17","resolution":{"observed_at":"2026-08-05T20:45:33.337602Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:33.132108Z","title":"2026 , month = apr, url =","venue":null,"work_id":"5fc7bc64-f082-406b-952a-28174f8b1254","year":2026},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:20.658346Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:77d2d13a728f57968c78507efce49607d52d2e0239ec19bce4e071f67d935b13","observation_id":"2a135fc8-f5ec-4625-b6f3-7c38ef41eae2","resolution":{"observed_at":"2026-08-05T20:45:33.203841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:20.763940Z","title":"When Benchmarks are Targets: Revealing the Sensitivity of Large Language Model Leaderboards","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:20.763940Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:4d48c65f9a9dd3d438542b82cd8f72c353dc5167f420e6d0fd1f4187d374147e","observation_id":"2e939414-952f-4a61-a5f7-ae748decb158","resolution":{"observed_at":"2026-08-05T20:45:20.763940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:20.845031Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:20.845031Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:3a21b8a978dd49cd1962e2920d9774bdf772180e7e7074d0a3274aa83674163f","observation_id":"de45cbaf-98e6-4ad1-b2ca-d258a1fb85c6","resolution":{"observed_at":"2026-08-05T20:45:20.845031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:32.903586Z","title":"2026 , month = apr, url =","venue":null,"work_id":"448c662c-9687-46e9-9b4f-3c1ea29a9a16","year":2026},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:20.922632Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:e304abfdbb8d398074a28af7d26d18c81f85bb7382b24206b5b51fbc6b62d186","observation_id":"5282a702-3aa6-4dd0-b274-c032aa99ae9c","resolution":{"observed_at":"2026-08-05T20:45:33.008976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:32.705258Z","title":"Or Not? , author=","venue":null,"work_id":"87101842-fe4a-4d51-ba1c-7055ae09446d","year":2025},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:20.995809Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:2f1e7dfb9298486fa9a4b9c09965f6c4c98f53043d7d0e5ed2607e3bced9c026","observation_id":"43ec1675-4301-409e-8cb1-e5d1bfc2bc60","resolution":{"observed_at":"2026-08-05T20:45:32.790256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/d19-1335","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:25.435417Z","title":"How Reasonable are Common-Sense Reasoning Tasks: A Case-Study on the W inograd Schema Challenge and SWAG","venue":null,"work_id":"2a52b03f-1f14-4e93-8d1b-f2ccb64a404e","year":2019},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:21.108941Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:4009028484c6faf5d08408ca64747c15d6c5905e87953fe22c55fc95a21948cc","observation_id":"01fef925-c661-4b57-90f2-304a50d79323","resolution":{"observed_at":"2026-08-05T20:45:25.518534Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:32.522724Z","title":"Benchmark\\^","venue":null,"work_id":"e0458d86-3466-411b-8e46-ed0a26469748","year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:21.186853Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:2e947d9fc5aecff67e58aa5f2f56b1ccdbe4b62755f859dce76fc1be4101fa81","observation_id":"127e310a-6821-4188-8f0c-d2facd005688","resolution":{"observed_at":"2026-08-05T20:45:32.604562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:32.341408Z","title":"Findings of the Association for Computational Linguistics: ACL 2025 , pages=","venue":null,"work_id":"fd406c2f-5676-4689-bb4c-9e120faa4f8a","year":2025},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:21.263902Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:68991017c60c235874afb0370bbc645a2e616250dbfa201453497e5e5df856c3","observation_id":"5397c555-4833-4e7e-ac7a-dcebfe4fb56a","resolution":{"observed_at":"2026-08-05T20:45:32.424635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.10657","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:26.059375Z","title":"arXiv preprint arXiv:2602.10657 , year=","venue":null,"work_id":"bdd1362a-0026-44db-9a4c-3df8484941fc","year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:21.316558Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:0bfb91ecebc835a791de16635eb7dbc4340244bcc5aaa225db604a039e5455b9","observation_id":"db2dd29a-4624-4216-882a-828003b9b3a0","resolution":{"observed_at":"2026-08-05T20:45:26.143824Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06221","last_updated":"2026-04-20T16:34:51Z","snapshot_observed_at":"2026-08-03T00:24:15.099765Z","submitted_at":"2026-02-05T21:57:50Z","title":"BenchMarker: An Education-Inspired Toolkit for Highlighting Flaws in Multiple-Choice Benchmarks","version":2},"cited_work":{"arxiv_id":"2602.06221","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.06221","snapshot_observed_at":"2026-08-05T20:45:25.842992Z","title":"BenchMarker: An Education-Inspired Toolkit for Highlighting Flaws in Multiple-Choice Benchmarks","venue":"cs.CL","work_id":"badadf9f-1236-48a0-a184-4bbc9753e723","year":2026},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:21.383348Z"},"links":{"cited_paper":"/paper/2602.06221","citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:80c136add77b674fbefeaad910f6808d17c5c73f0dc501a9f7d034a861eaf2d6","observation_id":"0160079d-44a8-449a-b2be-c9a8af6fa2d3","resolution":{"observed_at":"2026-08-05T20:45:25.924443Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:32.152113Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":"87f5f228-4979-461c-914c-2e947ace7ccb","year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:21.444789Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:db941214c34a57e7491d050ae3717de11feb96a811e241f4ba45af7abf066a08","observation_id":"56379f78-0bb1-4456-978f-6501e01a31ab","resolution":{"observed_at":"2026-08-05T20:45:32.241564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:32.008107Z","title":"My answer is C","venue":null,"work_id":"9addd864-6019-41f6-a406-743b8222f49c","year":2024},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:21.505260Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:762c5d44c9c98cc3dfcce1d41efab37801edd26fb5639077bca8c877f1551d05","observation_id":"ca020e86-6664-42d7-9928-97f3e0eab768","resolution":{"observed_at":"2026-08-05T20:45:32.058435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:31.833503Z","title":"Findings of the Association for Computational Linguistics: EMNLP 2024 , pages=","venue":null,"work_id":"fce16cbb-574b-450d-8c62-556cfba6a68a","year":2024},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:21.603442Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:ed11687307e50b49dd5f54a4886928b87e867e0bca6401d92376326c7f270500","observation_id":"733952c6-b42d-4a14-80ea-6fc49a159c37","resolution":{"observed_at":"2026-08-05T20:45:31.905048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:31.668058Z","title":"PNAS nexus , volume=","venue":null,"work_id":"abab1430-566d-48c3-aac2-2043add5f0bf","year":2026},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:21.676758Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:4e1ec8bb5abb9874764b8a11c2eaf4ea16e4e6e5df8608ec63da7502a298a152","observation_id":"9e96d133-b9c0-4a7d-b1d1-6637c9cbba91","resolution":{"observed_at":"2026-08-05T20:45:31.763326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:31.528078Z","title":"Scientific Reports , volume=","venue":null,"work_id":"db0bb53a-50e7-47f8-8de3-1287aa4a5f56","year":2024},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:21.724056Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:88af3ad2cf87a592f0fa0b7ab2c96222264292f3cb868c7a750d1d7fab38fb33","observation_id":"88e24ca8-4eed-4a48-a8ae-7ffbf82131b4","resolution":{"observed_at":"2026-08-05T20:45:31.537238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.20520","last_updated":"2026-05-19T21:42:32Z","snapshot_observed_at":"2026-08-03T02:30:24.579386Z","submitted_at":"2026-05-19T21:42:32Z","title":"Open-World Evaluations for Measuring Frontier AI Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.20520","snapshot_observed_at":"2026-08-05T20:45:21.806249Z","title":"arXiv preprint arXiv:2605.20520 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:21.806249Z"},"links":{"cited_paper":"/paper/2605.20520","citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:be81feb22c953cc1941340d2d91aa233ec303d361c62c09d88eac5c21eaf483b","observation_id":"229af391-81c8-4443-b82d-06b4295f31fc","resolution":{"observed_at":"2026-08-05T20:45:21.806249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:21.881351Z","title":"arXiv preprint arXiv:2502.14359 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:21.881351Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:75c74939103040096e6849a57e8b6568b5a6d29287ec960b9ae2bc081bbc6254","observation_id":"a9ae06f8-1a30-4c7d-a166-8bd9fa0cd825","resolution":{"observed_at":"2026-08-05T20:45:21.881351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:31.324459Z","title":"Proceedings of the Teddington Conference on the Mechanization of Thought Processes , pages =","venue":null,"work_id":"49ed1ab3-a4f4-4278-89e5-226c6207781d","year":1959},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:21.988606Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:ea41ab1216fe50948edac41d69022b6658504244918e16ffaa0cea1fe459135f","observation_id":"ab190fd9-26ea-4b1e-9164-de9af70698f2","resolution":{"observed_at":"2026-08-05T20:45:31.406129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:22.050562Z","title":"Communications of the ACM , volume=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:22.050562Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:567907633262ac004805174c06349ef536b3328300fcdffb03ab4e58d4c5bafb","observation_id":"06981e3a-8a59-40fd-8f30-9fd20198ea41","resolution":{"observed_at":"2026-08-05T20:45:22.050562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:22.129241Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:22.129241Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:dc882980d94c45ca2f7b17ac1bf6ca03864de830024e6da8b6aa7c87727680b2","observation_id":"db2dff29-6f6d-4a1d-87b7-d3f9368acb1a","resolution":{"observed_at":"2026-08-05T20:45:22.129241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:22.203610Z","title":"Communications of the ACM , volume=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:22.203610Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:3d9b13f9c85af298e2d5da97f8f7d347b912e9e92753ddb880d2bc7a47fde095","observation_id":"52719735-10b8-45f1-868b-0fcd1b6670fe","resolution":{"observed_at":"2026-08-05T20:45:22.203610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:22.268373Z","title":"Proceedings of the 57th annual meeting of the association for computational linguistics , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:22.268373Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:d47da83d2e6a295994cf34f03fd2da5b6232b11f9b8422216589bed71ef08d16","observation_id":"4ec8f9f7-b2bc-4807-8087-fa7e1402fe32","resolution":{"observed_at":"2026-08-05T20:45:22.268373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:22.341993Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:22.341993Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:4ffbbc27700a69d2d9b074bc427fd7ba722cc5b02bfd9d1133f15adfc68cf246","observation_id":"7eac5cff-975f-4b49-ba7c-e35f7aca30af","resolution":{"observed_at":"2026-08-05T20:45:22.341993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:22.417617Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:22.417617Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:2c7285be7ea606a2b3e8f4a723ba878e57f5cfa3d93e95ecc066c687b03a8aef","observation_id":"2294bfab-459e-4110-ac5c-71ea8238e437","resolution":{"observed_at":"2026-08-05T20:45:22.417617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:30.995611Z","title":null,"venue":null,"work_id":"b435beb8-ab43-4ac7-befc-2101fbd9c3a7","year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:22.512162Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:cb47b2ef8936915030f1dbcd99ce759991605f47e48e4fe9ccea3ea3229073a8","observation_id":"0421babf-0f9c-4a70-9d31-da33b8c21e3d","resolution":{"observed_at":"2026-08-05T20:45:31.127482Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:22.595110Z","title":"Proceedings of the National Academy of Sciences , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:22.595110Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:fad97dd19ef3c8dc9dc3030b7cbb64d1e5d7eeae45ae28de39550f4bc6551ec8","observation_id":"f75f59ed-422a-4043-ad8a-b7b3b8e06dee","resolution":{"observed_at":"2026-08-05T20:45:22.595110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:30.798783Z","title":"Nature human behaviour , volume=","venue":null,"work_id":"d966ef30-932e-4d95-8ff1-6618eb202e83","year":2024},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:22.693317Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:5887364a8e8af85bdb5a957d273af83dc4f7b3b18f0ed5fcc3307efd0cfce9df","observation_id":"48271d95-d7f6-4b66-b52c-923a698f89b8","resolution":{"observed_at":"2026-08-05T20:45:30.891981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:30.512129Z","title":"Proceedings of the Second Workshop on Insights from Negative Results in NLP , pages=","venue":null,"work_id":"c7ad42d8-739d-4322-899a-d7db623c9b8f","year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:22.773396Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:d2183f9539c6095f6ddc1785aa56bd09decbe6241e16c3a17975e2498794988a","observation_id":"58550614-5a60-412d-9396-d7a0fe37dd61","resolution":{"observed_at":"2026-08-05T20:45:30.682265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:30.197373Z","title":null,"venue":null,"work_id":"535d633c-1331-443e-992e-18986e0bf128","year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:22.867977Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:bb15ce3957cd6c54c9e8ba2f361e7e41a051717929a1fb2cd02830bdb87b66a6","observation_id":"5002aff7-5756-4581-85ed-c1810b55e424","resolution":{"observed_at":"2026-08-05T20:45:30.347897Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:22.910903Z","title":"Speech acts , pages=","venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:22.910903Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:3d23784ad10835893f34e74e31556cacdb75a31b28f9a927bb9384f09b1ce9c1","observation_id":"c9e7186c-6e95-4e8f-8c91-66001519c0ee","resolution":{"observed_at":"2026-08-05T20:45:22.910903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:29.848675Z","title":"Linguistics and philosophy , volume=","venue":null,"work_id":"e1f9d189-4aa1-46a6-ab75-6b052daf8c34","year":2002},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:23.019090Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:f0fcd73df10f63450a773648417326910cb3537091e55aa81c55bcfd54ee5afb","observation_id":"de5ab4dc-791a-4f89-8024-4038d17feb4c","resolution":{"observed_at":"2026-08-05T20:45:30.011257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:29.582363Z","title":"The Stanford Encyclopedia of Philosophy , editor=","venue":null,"work_id":"fff25b6d-ba50-4f78-9621-af4c871e2aa8","year":2024},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:23.114665Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:b11db1c9599ae8274482e97e323675d1c7285099b74cd339779140aafa11b4a9","observation_id":"1bf4a69f-2297-4daf-b649-28a88359af36","resolution":{"observed_at":"2026-08-05T20:45:29.675791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:29.354307Z","title":"Proceedings of the 21st International Conference on Natural Language Processing (ICON) , pages=","venue":null,"work_id":"27b4ca00-9dbf-454b-8d6c-1ace255c0e53","year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:23.181949Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:3c1abd076f89f7f1954b57a936634fead9eb9ac20229594db0a70b424cf6423d","observation_id":"240b3dd8-878e-4115-b473-bc08330fae02","resolution":{"observed_at":"2026-08-05T20:45:29.424806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:29.067118Z","title":null,"venue":null,"work_id":"9015a589-ae46-43a0-a7a7-9401982a3f78","year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:23.249941Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:2906e07adcf83bd00d31969be653509ae9eb098fe95dd9a12ad4996840331aab","observation_id":"91ed73d1-4662-4d14-98b0-fad4713952e3","resolution":{"observed_at":"2026-08-05T20:45:29.151850Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:28.917758Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":"cf8b8a76-a022-4516-b890-f770cefb40df","year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:23.336492Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:9e78ab4a1c6326705824906400e65312a34676c689fa8c7b909fa3f0b10bdd11","observation_id":"f61ccf09-b85f-4386-8058-b9b243eefe7b","resolution":{"observed_at":"2026-08-05T20:45:28.970581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:28.760296Z","title":null,"venue":null,"work_id":"c90083cb-8d8e-4d9c-889f-f99e3742555b","year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:23.447424Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:ff314fed7faa040e6c692788d0135139f13bc66f9c8c1779fa14b56c5c72bd6f","observation_id":"fd920a19-0991-495e-a77d-fd2c7c3dbaf1","resolution":{"observed_at":"2026-08-05T20:45:28.818855Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:28.574771Z","title":"Findings of the Association for Computational Linguistics: EMNLP 2021 , pages=","venue":null,"work_id":"919d7e74-c8d7-4d80-95e8-975fadf05926","year":2021},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:23.555239Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:b6b6a676cac89dad280f8303518f02a62b30cc441372940d732ee697436917e4","observation_id":"0078b89e-1746-4d7e-bf5f-3c29e74fab64","resolution":{"observed_at":"2026-08-05T20:45:28.675032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:28.439290Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"5192bf2a-e88c-4ad8-9ff4-b41d4337e6ef","year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:23.618974Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:5831a0e17d4a27163caa6c191b1a41a9f5a0cb81d22296941822c99370cbf71e","observation_id":"6873148c-fe7f-467b-a6f8-8f5722991a1b","resolution":{"observed_at":"2026-08-05T20:45:28.497198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:23.717026Z","title":"arXiv preprint arXiv:2602.17594 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:23.717026Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:29bcbb8c89643d3a4b18749751cca8f0d82a947a3d774038cd1f06170fde28a5","observation_id":"12c4f787-7c6d-4bbe-84f2-2285d4aa93d6","resolution":{"observed_at":"2026-08-05T20:45:23.717026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:23.795013Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:23.795013Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:445ba45a77dc265f8352361c5a7d55c54624ac5f0f7a68564b1875f08e1ea579","observation_id":"bc39cb14-d273-4ff2-9027-d4f9655b9c73","resolution":{"observed_at":"2026-08-05T20:45:23.795013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:23.882802Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:23.882802Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:e3006e49d6f958a6ee360237d23fdb56b0948d283d0da712bf18d34528689cf0","observation_id":"84b1cb74-6818-459b-be54-daa536b16bac","resolution":{"observed_at":"2026-08-05T20:45:23.882802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:28.234961Z","title":"IEEE Access , year=","venue":null,"work_id":"9cc44854-d69c-4f97-a912-2d70fe269911","year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:23.930324Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:7d65f8596cd5e1972d7fae9255da97ffc01b6be91a34163ba1baa90d82067905","observation_id":"2c96cfc5-15b8-4a7f-b6c3-a30548af8fcb","resolution":{"observed_at":"2026-08-05T20:45:28.310393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:28.045334Z","title":"Proceedings of the 29th Conference on Computational Natural Language Learning , pages=","venue":null,"work_id":"674e1816-dc6f-4f90-a61d-7fee98f08c24","year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:24.008348Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:75e7fecd532631ad3107a24749e3c4ec3ac09cc4c4d2bffd73d39ae304d9b443","observation_id":"854b1981-6016-41b7-9e49-1ee231d6d212","resolution":{"observed_at":"2026-08-05T20:45:28.160734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07825","last_updated":"2025-04-10T15:01:46Z","snapshot_observed_at":"2026-08-07T16:06:49.692048Z","submitted_at":"2025-04-10T15:01:46Z","title":"What the HellaSwag? On the Validity of Common-Sense Reasoning Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07825","snapshot_observed_at":"2026-08-05T20:45:24.096011Z","title":"arXiv preprint arXiv:2504.07825 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:24.096011Z"},"links":{"cited_paper":"/paper/2504.07825","citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:7d1e00dd6e1eb5f1ab7ed01b3b31fdd058f7967e8578dc0b2e08db3f19f1716d","observation_id":"a38a459a-0d2f-4b6e-be60-1c74acd89b48","resolution":{"observed_at":"2026-08-05T20:45:24.096011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:27.888741Z","title":"Findings of the Association for Computational Linguistics: EACL 2026 , pages=","venue":null,"work_id":"701ab2ea-db3e-4cd8-9fd7-4949aec7d2dd","year":2026},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:24.184144Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:3a09699bf30c88e2e98bf09a875db7b5b5017b54b921a7fba6a58f6b75181411","observation_id":"b1a956fd-bbb9-4e7b-9c02-8668d5417fcf","resolution":{"observed_at":"2026-08-05T20:45:27.948372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11020","last_updated":"2024-06-16T17:26:44Z","snapshot_observed_at":"2026-08-09T20:15:23.957445Z","submitted_at":"2024-06-16T17:26:44Z","title":"RUPBench: Benchmarking Reasoning Under Perturbations for Robustness Evaluation in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11020","snapshot_observed_at":"2026-08-05T20:45:24.247556Z","title":"arXiv preprint arXiv:2406.11020 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:24.247556Z"},"links":{"cited_paper":"/paper/2406.11020","citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:fb645fce36b776329d855bee7184a15e93026eeb1bf2a138ce4a03fb26792ed8","observation_id":"311eb501-d071-4230-9228-4c7e3f35a4eb","resolution":{"observed_at":"2026-08-05T20:45:24.247556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-04T22:55:15.345443Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-05T20:45:24.328597Z","title":"arXiv preprint arXiv:2311.12022 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:24.328597Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:b037175aaa26a9449ad5c8df782060932cb65cdeebc4dd79309171eb30ef8d64","observation_id":"09932863-acc0-41ed-b01c-36e43225482e","resolution":{"observed_at":"2026-08-05T20:45:24.328597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:24.389948Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:24.389948Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:1b1a24f7c804c8770898d505facb032c93b46c651041493b31bb4c846d16ea25","observation_id":"1497d779-b546-44d7-b2dd-ab0c09bd559d","resolution":{"observed_at":"2026-08-05T20:45:24.389948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:27.725660Z","title":"Innovative Journal of Applied Science , pages=","venue":null,"work_id":"193439e4-84d6-488c-9903-40bacea5ccc2","year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:24.512569Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:1d143053bdee59ee569435ab63ad28ac42c215f39ec02d2b23eaee1381d42948","observation_id":"4f64fa96-73a0-4e9a-a269-273326984b0c","resolution":{"observed_at":"2026-08-05T20:45:27.808382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:27.523446Z","title":"Expert Systems , volume =","venue":null,"work_id":"5982abca-fde6-446c-9c97-4543b581805f","year":2023},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:24.612540Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:1170d5d25fb46deec9aaf63893ad195551d5166fdac740f5c6e7b14d47dd83c0","observation_id":"dc36a8b4-d02a-4906-9f36-a9568a5d8666","resolution":{"observed_at":"2026-08-05T20:45:27.626372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:27.349367Z","title":"2026 , eprint =","venue":null,"work_id":"47cc7af2-5530-4e48-9d50-91bef17d6300","year":2026},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:24.704523Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:3f26dc0b1cc760367696a7638f4b9b72f108f380dfd2b21b14cf658010870aa9","observation_id":"cfb00901-91b5-4d91-89b7-987a2f2881da","resolution":{"observed_at":"2026-08-05T20:45:27.427352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:27.164174Z","title":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics , year =","venue":null,"work_id":"dac50ac5-4003-4f4f-a737-ada4e998110f","year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:24.801821Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:dc63b615b6518099e70d939857015414316718bb697b9049d75c6c17a178ec71","observation_id":"08b8dbf1-42f4-4ea3-bb39-3c57b724d0f0","resolution":{"observed_at":"2026-08-05T20:45:27.245639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:26.988993Z","title":"Journal of the Royal Statistical Society: Series B (Methodological) , volume =","venue":null,"work_id":"3d763451-ebc7-48b7-8916-4ea09b223aa0","year":1995},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:24.926045Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:3b2d747ed5a5c42073b42b521e231f59823f6ace43934e32264b0cac5350164c","observation_id":"2839b1e6-23ef-42fb-bc6d-273e6745d3a4","resolution":{"observed_at":"2026-08-05T20:45:27.045407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:26.829128Z","title":"AI Magazine , volume=","venue":null,"work_id":"acd19bab-21b2-4b90-8e44-a42beabe8b86","year":2026},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:24.998130Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:458b3fd9ad6105d2999c5b736d820cbcdb4f848c67a22b664a6202945a8187ba","observation_id":"d02853ed-6643-44ce-84a4-2b90765cb88d","resolution":{"observed_at":"2026-08-05T20:45:26.893930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:26.681221Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":"d48953b7-01b3-428d-b849-1ca8d7aba21c","year":2021},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:25.082085Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:6ec518e32ba7bb3f0ecb0dd1804c336f4bfdb34bd2abeb860373c7aa7453c4ff","observation_id":"4e4206c7-0ba1-4179-a766-04f0138960dc","resolution":{"observed_at":"2026-08-05T20:45:26.734269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:26.522288Z","title":"Proceedings of the 9th Widening NLP Workshop , pages=","venue":null,"work_id":"1ef1daa9-f7f4-4c55-bda8-366bc9a9e87a","year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:25.171035Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:a7c1a24c8aed234f197e4bcc786ed72e5a25e25b33dd3ad6e001d84fcebd9aa4","observation_id":"e6832bf7-f5df-4d04-b6e8-73c470f1627f","resolution":{"observed_at":"2026-08-05T20:45:26.588331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:26.374777Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":"80505a62-b542-43a1-93f4-16971365ff65","year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:25.259248Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:a4ed766469c9fcab93de78527e5c94f41f848f1d08d400c10604db83965e7083","observation_id":"b9f74602-3860-44b0-9da1-e520bc2815a5","resolution":{"observed_at":"2026-08-05T20:45:26.430611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:45:26.218345Z","title":"Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics , pages=","venue":null,"work_id":"e7179b28-fd68-4c38-a080-cb6ee57dca77","year":null},"citing_paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-05T20:45:25.334279Z"},"links":{"citing_paper":"/paper/2608.03340"},"observation_digest":"sha256:b0d9e6d5db0c98c7e1b90eaee89f971b1013315f9fd378d3b0f5d19ee9dcc4ef","observation_id":"93664a2b-5556-4d70-8de5-bb9cd8492617","resolution":{"observed_at":"2026-08-05T20:45:26.280577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.03340","last_updated":"2026-08-04T08:49:34Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T20:15:35.964068Z","submitted_at":"2026-08-04T08:49:34Z","title":"Benchmarking the Benchmarks: Testing the Predictive Validity of Commonsense Benchmarks"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":25,"verified_exact":2,"verified_fuzzy":32},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2608.03340."}