{"as_of":"2026-08-22T04:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:04dfa08c708a4167916c9c7e98aca000b72bc91f9b55a847caca599afb4213eb","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:33:34.992330Z","state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08709/citation-record","integrity":"/paper/2608.08709/integrity","json":"/paper/2608.08709/citation-record.json","paper":"/paper/2608.08709"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-14T04:33:34.605882Z","title":"Concrete problems in ai safety.arXiv preprint arXiv:1606.06565,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08709","last_updated":"2026-08-09T13:44:26Z","snapshot_observed_at":"2026-08-19T09:14:49.427047Z","submitted_at":"2026-08-09T13:44:26Z","title":"AI Evaluation Should Measure Verification Cost, Not Correctness Alone","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T04:33:34.605882Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2608.08709"},"observation_digest":"sha256:ad610d9a1fd924863e81f2310728461f0148b5cc00d9cc6111774cc08f4255df","observation_id":"b1605f40-1a17-4c9a-8c0f-0af89339ed7b","resolution":{"observed_at":"2026-08-14T04:33:34.605882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-18T22:17:47.865607Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-14T04:33:34.689041Z","title":"Sparks of artificial general intelligence: Early experiments with gpt-4","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08709","last_updated":"2026-08-09T13:44:26Z","snapshot_observed_at":"2026-08-19T09:14:49.427047Z","submitted_at":"2026-08-09T13:44:26Z","title":"AI Evaluation Should Measure Verification Cost, Not Correctness Alone","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T04:33:34.689041Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2608.08709"},"observation_digest":"sha256:b68005ae5da0b0bde136e600c18d1bd55bd9db23b8c745bdbff77fc21fe631b2","observation_id":"75964956-e509-47b8-a7ea-4f16a366c623","resolution":{"observed_at":"2026-08-14T04:33:34.689041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:33:34.714599Z","title":"Susanne Förster and Yarden Skop","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08709","last_updated":"2026-08-09T13:44:26Z","snapshot_observed_at":"2026-08-19T09:14:49.427047Z","submitted_at":"2026-08-09T13:44:26Z","title":"AI Evaluation Should Measure Verification Cost, Not Correctness Alone","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T04:33:34.714599Z"},"links":{"citing_paper":"/paper/2608.08709"},"observation_digest":"sha256:944c90b6594d0433a163d3f48301453b7a9fe907926f05880067176fbe7e6493","observation_id":"052835b1-af32-4850-8f51-64849255884e","resolution":{"observed_at":"2026-08-14T04:33:34.714599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:33:34.728945Z","title":"Luyu Gao, Aman Madaan, Shuyan Zhou, Uri Alon, Pengfei Liu, Yiming Yang, Jamie Callan, and Graham Neubig","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08709","last_updated":"2026-08-09T13:44:26Z","snapshot_observed_at":"2026-08-19T09:14:49.427047Z","submitted_at":"2026-08-09T13:44:26Z","title":"AI Evaluation Should Measure Verification Cost, Not Correctness Alone","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T04:33:34.728945Z"},"links":{"citing_paper":"/paper/2608.08709"},"observation_digest":"sha256:07ddc3aa3de0d81a8727c9cd48d33d0eace6fd74a6325dd53ab9b9283645e9f1","observation_id":"81834d87-def8-4435-b782-347c01781d89","resolution":{"observed_at":"2026-08-14T04:33:34.728945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:33:34.744259Z","title":"Daniel Kahneman.Thinking, Fast and Slow","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08709","last_updated":"2026-08-09T13:44:26Z","snapshot_observed_at":"2026-08-19T09:14:49.427047Z","submitted_at":"2026-08-09T13:44:26Z","title":"AI Evaluation Should Measure Verification Cost, Not Correctness Alone","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T04:33:34.744259Z"},"links":{"citing_paper":"/paper/2608.08709"},"observation_digest":"sha256:98f05a46aba67bf14a4575c639015b35ad55c2c305897b8b88d4436feb92a08c","observation_id":"60f7ec44-764b-4fca-9202-b842061708ed","resolution":{"observed_at":"2026-08-14T04:33:34.744259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:33:34.899748Z","title":"Potsawee Manakul, Adian Liusie, and Mark J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08709","last_updated":"2026-08-09T13:44:26Z","snapshot_observed_at":"2026-08-19T09:14:49.427047Z","submitted_at":"2026-08-09T13:44:26Z","title":"AI Evaluation Should Measure Verification Cost, Not Correctness Alone","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T04:33:34.899748Z"},"links":{"citing_paper":"/paper/2608.08709"},"observation_digest":"sha256:51f778711ad76d14d118178b647568c656bdb5cab87ffc3a038e3a434a06cef8","observation_id":"1b6494b6-994d-4945-b546-7ea07615f41d","resolution":{"observed_at":"2026-08-14T04:33:34.899748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:33:34.970806Z","title":"Sewon Min, Kalpesh Krishna, Xinxi Lyu, Mike Lewis, Wen-tau Yih, Pang Wei Koh, Mohit Iyyer, Luke Zettlemoyer, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08709","last_updated":"2026-08-09T13:44:26Z","snapshot_observed_at":"2026-08-19T09:14:49.427047Z","submitted_at":"2026-08-09T13:44:26Z","title":"AI Evaluation Should Measure Verification Cost, Not Correctness Alone","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T04:33:34.970806Z"},"links":{"citing_paper":"/paper/2608.08709"},"observation_digest":"sha256:b9d005708fa0f229d51fec5b15e8edd6e0f0892aaaeeedb45aa9bc466c872cff","observation_id":"4d888af8-4f10-483a-8fc1-045a40d3b549","resolution":{"observed_at":"2026-08-14T04:33:34.970806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16666","last_updated":"2026-06-02T02:15:05Z","snapshot_observed_at":"2026-08-19T21:25:20.240103Z","submitted_at":"2026-02-18T18:05:44Z","title":"Towards a Science of AI Agent Reliability","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.16666","snapshot_observed_at":"2026-08-14T04:33:34.985430Z","title":"Murat Sariyar","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08709","last_updated":"2026-08-09T13:44:26Z","snapshot_observed_at":"2026-08-19T09:14:49.427047Z","submitted_at":"2026-08-09T13:44:26Z","title":"AI Evaluation Should Measure Verification Cost, Not Correctness Alone","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T04:33:34.985430Z"},"links":{"cited_paper":"/paper/2602.16666","citing_paper":"/paper/2608.08709"},"observation_digest":"sha256:8049eb31d7fe83bdcf2eef08f3e7507dbc4280550fd671593b050811c338924a","observation_id":"667a3ac3-32d1-4f8d-b107-a82685e74365","resolution":{"observed_at":"2026-08-14T04:33:34.985430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2026.16815","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:33:35.460456Z","title":"Bernhard Schölkopf, Francesco Locatello, Stefan Bauer, Nan Rosemary Ke, Nal Kalchbrenner, Anirudh Goyal, and Yoshua Bengio","venue":null,"work_id":"2ed1a57b-5392-47a6-b65c-34575ff6dc8e","year":2026},"citing_paper":{"arxiv_id":"2608.08709","last_updated":"2026-08-09T13:44:26Z","snapshot_observed_at":"2026-08-19T09:14:49.427047Z","submitted_at":"2026-08-09T13:44:26Z","title":"AI Evaluation Should Measure Verification Cost, Not Correctness Alone","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T04:33:34.992330Z"},"links":{"citing_paper":"/paper/2608.08709"},"observation_digest":"sha256:110d9fa621b3f02571ca2579816d52678357f120aea016a2802104cbaf7d6dc0","observation_id":"37589ff0-6b28-4539-b08e-461b640db4e9","resolution":{"observed_at":"2026-08-14T04:33:35.480668Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-14T04:33:34.799903Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2608.08709","last_updated":"2026-08-09T13:44:26Z","snapshot_observed_at":"2026-08-19T09:14:49.427047Z","submitted_at":"2026-08-09T13:44:26Z","title":"AI Evaluation Should Measure Verification Cost, Not Correctness Alone","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-14T04:33:34.799903Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2608.08709"},"observation_digest":"sha256:05d0bdae5a70f99b37e775089fa03b9315afe21bd9c08ca22416235c5194058a","observation_id":"747765ba-92eb-43ce-a1a4-a1b894d3504e","resolution":{"observed_at":"2026-08-14T04:33:34.799903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:33:34.859455Z","title":"URL https://aclanthology.org/2023.ijcnlp-main.20/","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08709","last_updated":"2026-08-09T13:44:26Z","snapshot_observed_at":"2026-08-19T09:14:49.427047Z","submitted_at":"2026-08-09T13:44:26Z","title":"AI Evaluation Should Measure Verification Cost, Not Correctness Alone","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-14T04:33:34.859455Z"},"links":{"citing_paper":"/paper/2608.08709"},"observation_digest":"sha256:151766fc7c0b64f9da5f956ad745574bbe2b28c6d9077676490b0ca30c7e1b4e","observation_id":"108c6eec-cab0-4005-852c-fcca86b584d7","resolution":{"observed_at":"2026-08-14T04:33:34.859455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:33:34.702807Z","title":"Chunyuan Deng, Yilun Zhao, Xiangru Tang, Mark Gerstein, and Arman Cohan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08709","last_updated":"2026-08-09T13:44:26Z","snapshot_observed_at":"2026-08-19T09:14:49.427047Z","submitted_at":"2026-08-09T13:44:26Z","title":"AI Evaluation Should Measure Verification Cost, Not Correctness Alone","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-14T04:33:34.702807Z"},"links":{"citing_paper":"/paper/2608.08709"},"observation_digest":"sha256:51121bdf4fd8736393152f1b7a9b1fef2b080b2387cc6560d92a4ef0fd831ff8","observation_id":"0abbdd35-a239-4609-bfe2-bff815ceb173","resolution":{"observed_at":"2026-08-14T04:33:34.702807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09089","last_updated":"2025-07-25T00:43:07Z","snapshot_observed_at":"2026-08-20T12:37:15.989838Z","submitted_at":"2025-07-12T00:16:33Z","title":"Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.09089","snapshot_observed_at":"2026-08-14T04:33:34.673519Z","title":"Rishi Bommasani, Drew A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08709","last_updated":"2026-08-09T13:44:26Z","snapshot_observed_at":"2026-08-19T09:14:49.427047Z","submitted_at":"2026-08-09T13:44:26Z","title":"AI Evaluation Should Measure Verification Cost, Not Correctness Alone","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-14T04:33:34.673519Z"},"links":{"cited_paper":"/paper/2507.09089","citing_paper":"/paper/2608.08709"},"observation_digest":"sha256:12ab6f52c43acd36a673ae7f283108615690a3ef86d69b4d671ff43893a9672f","observation_id":"30e3fe52-d0f5-4a0c-b6e2-d98b7ce69d92","resolution":{"observed_at":"2026-08-14T04:33:34.673519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1142/s1793351x26410011","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:33:35.137485Z","title":"URLhttps://www.worldscientific.com/doi/10.1142/S1793351X26410011","venue":null,"work_id":"633ad125-ab80-459b-bbc0-665ab5a7db59","year":2024},"citing_paper":{"arxiv_id":"2608.08709","last_updated":"2026-08-09T13:44:26Z","snapshot_observed_at":"2026-08-19T09:14:49.427047Z","submitted_at":"2026-08-09T13:44:26Z","title":"AI Evaluation Should Measure Verification Cost, Not Correctness Alone","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-14T04:33:34.738199Z"},"links":{"citing_paper":"/paper/2608.08709"},"observation_digest":"sha256:4c3329277550fcec150b21114d24d8f3bb452a428bb1227851373ebba71d94ee","observation_id":"1831bd58-92e3-4c0f-9c53-ac4e30fcc30c","resolution":{"observed_at":"2026-08-14T04:33:35.198209Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.08709","last_updated":"2026-08-09T13:44:26Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-19T09:14:49.427047Z","submitted_at":"2026-08-09T13:44:26Z","title":"AI Evaluation Should Measure Verification Cost, Not Correctness Alone"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":12,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 0 inbound Pith citation observations for arXiv:2608.08709."}