{"as_of":"2026-08-16T12:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6965f4e128d6fb982437dd3ab181fc88e187ae3a0dafb5678e138c71328cb35e","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:04:24.060625Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02786/citation-record","integrity":"/paper/2608.02786/integrity","json":"/paper/2608.02786/citation-record.json","paper":"/paper/2608.02786"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:26.223282Z","title":"AI, algorithmic, and automa- tion incidents and controversies (AIAAIC)","venue":null,"work_id":"c0d51cf9-b9af-4f83-bba0-6ac06c70ba89","year":2023},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.583205Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:58c0e478f89df942c4aee8326747d3a46ababfda9cba1e03eb1dd479bc1f05c0","observation_id":"2f35660b-2527-48d6-a312-425aad65e843","resolution":{"observed_at":"2026-08-15T15:04:26.230100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:26.168120Z","title":"Amershi, A","venue":null,"work_id":"374ded95-347a-469f-ad0d-73168e29f806","year":2019},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.615655Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:8f48711e10a8dbaf913cf1ae61bd79d84fda4cb3005f2cd854fef5907dcf8dcc","observation_id":"479a26f6-5d22-4eeb-98b5-ae8f76ca2e57","resolution":{"observed_at":"2026-08-15T15:04:26.188822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-15T15:04:23.627074Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.627074Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:649423d35ddd1111aa988c9ecad011f9bdf5fc7fda4ea0c954f790ab1ea30c70","observation_id":"946d5e6c-6ccd-400c-bf53-f37308b2cd25","resolution":{"observed_at":"2026-08-15T15:04:23.627074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:26.112472Z","title":null,"venue":null,"work_id":"7fe71cb6-b7b5-4cac-b594-ed48994bb417","year":2021},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.635747Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:8a7459e22b01a19bc2ea76ffec3b18dbe498cf22d697a10492f38ed697e3ec91","observation_id":"1a3e2fa3-0649-4a46-a5b7-c6696cc4c56e","resolution":{"observed_at":"2026-08-15T15:04:26.118990Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:26.072866Z","title":"Air canada chatbot liable for misin- formation on bereavement fares","venue":null,"work_id":"a2ee9760-72cc-4bdc-bf9f-f95aba5c894c","year":2023},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.656764Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:7a2f3d4eb1ff18122e78da1275e70342577340414862e70921bd64eb2045f52f","observation_id":"30c17db6-ca0f-41bc-9d90-4ac7a3cdd516","resolution":{"observed_at":"2026-08-15T15:04:26.088370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:26.028220Z","title":"Reg- ulation (EU) 2022/2554 on digital oper- ational resilience for the financial sector (DORA)","venue":null,"work_id":"361198b9-58ba-49df-8514-786a517cb658","year":2022},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.697745Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:477fdacbde0dcf5e9cba0372f9cb0e9b410e8c113402af6971c0840341fc3905","observation_id":"08c7f2d2-ff2d-481a-9a88-a8dba037ecf3","resolution":{"observed_at":"2026-08-15T15:04:26.044760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.991013Z","title":"Reg- ulation (EU) 2024/1689 of the european parliament and of the council laying down harmonised rules on artificial intelligence (Artificial Intelligence Act)","venue":null,"work_id":"639ed128-f1cb-4e87-abb4-27208e5a169c","year":2024},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.703996Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:d79fe0f383b6a1b57159d071acd18fb64553818a5fe3bbff0d544101f9ed36bb","observation_id":"73173ad7-777a-4743-b13a-3951cde5be8d","resolution":{"observed_at":"2026-08-15T15:04:26.009590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.920709Z","title":"Artificial in- telligence in financial services: Review of firms’ approaches to consumer duty com- pliance","venue":null,"work_id":"0a0640a4-d4c7-4f03-8881-c3b2c1f99017","year":2024},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.715153Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:469bcb80828e04a43701e67d1d3cae8e513c416686d21413f77151f1a6f783e6","observation_id":"fd5e9466-f582-4561-a164-a36cf9df61c0","resolution":{"observed_at":"2026-08-15T15:04:25.931900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.03238","last_updated":"2026-07-09T16:49:37Z","snapshot_observed_at":"2026-08-13T16:47:09.190218Z","submitted_at":"2026-06-02T06:55:52Z","title":"When RLHF Fails: A Mechanistic Taxonomy of Reward Hacking, Collapse, and Evaluator Gaming","version":2},"cited_work":{"arxiv_id":"2606.03238","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.03238","snapshot_observed_at":"2026-08-15T15:04:25.106719Z","title":"When RLHF Fails: A Mechanistic Taxonomy of Reward Hacking, Collapse, and Evaluator Gaming","venue":"cs.LG","work_id":"1158f860-e09e-47c7-8d40-f01c13b94fc0","year":2026},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.722499Z"},"links":{"cited_paper":"/paper/2606.03238","citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:fc8ad3de09d17a8b347a9b7c7e272d2f257fc3ecf4bf0705937870d4c82b0de5","observation_id":"3868427a-af40-4d44-b434-ca88c54d0745","resolution":{"observed_at":"2026-08-15T15:04:25.121819Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12173","last_updated":"2023-05-05T14:26:17Z","snapshot_observed_at":"2026-08-12T14:45:22.117576Z","submitted_at":"2023-02-23T17:14:38Z","title":"Not what you've signed up for: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12173","snapshot_observed_at":"2026-08-15T15:04:23.732184Z","title":"Greshake, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.732184Z"},"links":{"cited_paper":"/paper/2302.12173","citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:d71cf065fd923174ac7e3e040060b097ed33685064947a57771e4f60cc9a8091","observation_id":"6e003452-1c2d-4d95-92bf-4921e4227ea0","resolution":{"observed_at":"2026-08-15T15:04:23.732184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05232","last_updated":"2024-11-19T12:42:45Z","snapshot_observed_at":"2026-07-06T16:45:07.733095Z","submitted_at":"2023-11-09T09:25:37Z","title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05232","snapshot_observed_at":"2026-08-15T15:04:23.751900Z","title":"Huang, W","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.751900Z"},"links":{"cited_paper":"/paper/2311.05232","citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:fe478464f1106fccbb19889f37332bc1eff7830a39e2a94f10582cb8614953cf","observation_id":"dcce6e00-c871-4bc3-b890-26316eb67ae8","resolution":{"observed_at":"2026-08-15T15:04:23.751900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.879486Z","title":"Fix GRPO importance sampling ratio: Replace per-token with sequence-mean in KL bias correction (PR #6594)","venue":null,"work_id":"1e1109e6-1563-4abf-9977-1de9e1d9ba15","year":2024},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.771184Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:be5eb3e514cecafe10d40b05fb1e68f9ee7208dea5990503c857023ac0ce7c12","observation_id":"e6ae260f-227d-4d24-9c09-04f4a1e07920","resolution":{"observed_at":"2026-08-15T15:04:25.890032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.854964Z","title":null,"venue":null,"work_id":"830e10b5-987f-4bd5-8d0b-4c469f918417","year":2023},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.778382Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:817327daf4dad026053a28f2bec488a56bb9291c9ab0f6aacbce71bd25abb009","observation_id":"8ea11412-17b1-48bb-8b1d-54037b74223c","resolution":{"observed_at":"2026-08-15T15:04:25.862065Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.09999","last_updated":"2026-07-23T13:41:45Z","snapshot_observed_at":"2026-08-10T15:58:03.209700Z","submitted_at":"2026-07-10T21:55:05Z","title":"Silent Failures in Quantized LLM Reasoning: A Taxonomy-Based Analysis of Hollow Convergence and Failure Mode Shifts","version":2},"cited_work":{"arxiv_id":"2607.09999","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.09999","snapshot_observed_at":"2026-08-15T15:04:24.888530Z","title":"Silent Failures in Quantized LLM Reasoning: A Taxonomy-Based Analysis of Hollow Convergence and Failure Mode Shifts","venue":"cs.CL","work_id":"6b594e4a-9baa-4a47-90c4-3e53043572fa","year":2026},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.787393Z"},"links":{"cited_paper":"/paper/2607.09999","citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:55b957f90b3411f328881991816fb7bb4e6e0c6dc94139796f13dd5692686a7d","observation_id":"1e9592bc-eaf7-484e-8a31-af869452f654","resolution":{"observed_at":"2026-08-15T15:04:24.898299Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.820190Z","title":null,"venue":null,"work_id":"65786ef7-c818-495f-b89f-b19c46d0500a","year":2023},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.811590Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:b0ffcc6237656af1ad7f76b7ec42c665a0dd781e70e2bfe3a644f40371c7b669","observation_id":"7e93ba4a-09b0-49f6-8880-cefa28039590","resolution":{"observed_at":"2026-08-15T15:04:25.836662Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-15T15:04:23.826890Z","title":"Liang, R","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.826890Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:a03addd6cf96aa9aa659d3b9f6975533aee2afcf959c563f6a851abea45ef566","observation_id":"7188c347-094e-4816-9492-cfde6cdb6ca5","resolution":{"observed_at":"2026-08-15T15:04:23.826890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.09863","last_updated":"2026-06-01T00:13:23Z","snapshot_observed_at":"2026-08-16T01:26:19.355671Z","submitted_at":"2026-06-01T00:13:23Z","title":"From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents","version":1},"cited_work":{"arxiv_id":"2606.09863","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.09863","snapshot_observed_at":"2026-08-15T15:04:24.757452Z","title":"From Confident Closing to Silent Failure: Characterizing False Success in LLM Agents","venue":"cs.LG","work_id":"e6a046d8-2d15-4107-98e9-b32016234d39","year":2026},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.835249Z"},"links":{"cited_paper":"/paper/2606.09863","citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:53e40ff594967c6e2bb78f551f8ed4cc437dc544e2c6cad1d9f476e5cafd3772","observation_id":"0bf4dc3b-8337-4205-a0d8-964c4a3ee2fc","resolution":{"observed_at":"2026-08-15T15:04:24.778735Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.767456Z","title":"McGregor","venue":null,"work_id":"6edec65a-4d75-417a-96c7-5c824185d7ef","year":2021},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.852165Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:bdc9cfc3964dae61dc9f9c1eec6ee1aa84b8bb57fd64dd1a389738557956865c","observation_id":"2ad2f21b-f61a-4bfb-89ec-e7bc1e67c88e","resolution":{"observed_at":"2026-08-15T15:04:25.783024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.700255Z","title":"Ouyang, J","venue":null,"work_id":"8d3e0bfd-bd9d-4dde-9218-4a8a988e9340","year":2022},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.878401Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:99a630fceb85673fc1d821225d183107d0f922bd97dda4a0d9fa6f5af45d69b2","observation_id":"ff4080ba-0505-4e6c-96b2-e36dbdbafa8c","resolution":{"observed_at":"2026-08-15T15:04:25.723267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.642801Z","title":"Paleyes, R.-G","venue":null,"work_id":"8d561ba1-b841-40bb-91d4-81d67472ab2b","year":2022},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.885274Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:02ac2378ab099247e19b44ac0fb07dc5baddd3783228c80c0b43183ac166d71e","observation_id":"645fc9e2-ba59-4820-a3fb-d9520b6b5da2","resolution":{"observed_at":"2026-08-15T15:04:25.655400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.597348Z","title":null,"venue":null,"work_id":"ba45c56f-07c2-4c53-ba4e-19c9a6231986","year":null},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.922457Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:f93f8e33b82de0a220b85f67a19e3b611f9cd5d0cdb2c0cbca71ba2144856ff7","observation_id":"abfa905d-fb2e-466a-9b37-5a9e903819d5","resolution":{"observed_at":"2026-08-15T15:04:25.616113Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.561276Z","title":"Perez and I","venue":null,"work_id":"45892b29-6c18-4927-aaa8-7d4ff08c2d6a","year":2022},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.933902Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:e58c868dd6910f1d5bfcd8a5e60ad479cf0d8f1945bc1fb93f732eb95422e721","observation_id":"ac80d417-8ba3-4c16-89fc-5543f03d4a0d","resolution":{"observed_at":"2026-08-15T15:04:25.568302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.498261Z","title":"Post office Horizon IT inquiry: In- terim report","venue":null,"work_id":"c7a15a39-a2d4-4d28-9af9-ff5d779bb579","year":2024},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.943056Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:4c31227235182d4959377f342934ada7279b661cf6befc9865d78f58dc6e58c5","observation_id":"49e793f6-9d2d-4c04-8085-3fafaff01997","resolution":{"observed_at":"2026-08-15T15:04:25.514508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.466004Z","title":null,"venue":null,"work_id":"8f0a7949-00ce-4816-b8bb-64d479348239","year":2020},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.955095Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:402b8c00165956ebdadca0043449ff70fa976716db15a652183310c2db9e147a","observation_id":"54f32853-4833-4d07-9f12-3a6b47588d45","resolution":{"observed_at":"2026-08-15T15:04:25.471782Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.410337Z","title":"Sculley, G","venue":null,"work_id":"e6a3a85f-b634-45d3-8e2f-e2422bcebf60","year":2015},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.975336Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:6f4b5fd468b16316f16c3833107db7b458d2ec33063d9e403bf0479263013ffd","observation_id":"a523d257-e314-4f0c-b8b2-406b5a44572c","resolution":{"observed_at":"2026-08-15T15:04:25.437970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05051","last_updated":"2021-06-06T03:30:29Z","snapshot_observed_at":"2026-08-15T06:43:01.495091Z","submitted_at":"2020-06-09T05:02:44Z","title":"Constrained episodic reinforcement learning in concave-convex and knapsack settings","version":2},"cited_work":{"arxiv_id":"2006.05051","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.05051","snapshot_observed_at":"2026-08-15T15:04:24.622194Z","title":"Constrained episodic reinforcement learning in concave-convex and knapsack settings","venue":"cs.LG","work_id":"44679d15-b3e0-4691-96be-d2c7e67c42e2","year":2020},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.987308Z"},"links":{"cited_paper":"/paper/2006.05051","citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:dcd44986defc8658ba01a515a1a37b8153aadbe767ea116e9ff356e364d2cfc4","observation_id":"bba8414c-267b-4453-ac41-1c5a944201de","resolution":{"observed_at":"2026-08-15T15:04:24.633507Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T15:04:24.001635Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:24.001635Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:2c723ab04ee6dc151cb47f1ccd86a996d14605257bb066a7a2208959ad5eba3b","observation_id":"1bb434f8-16fd-45bd-9767-ebb0db64103e","resolution":{"observed_at":"2026-08-15T15:04:24.001635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2606.14589","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:24.461614Z","title":null,"venue":null,"work_id":"9fedb1e4-4c3c-4fbf-8509-0955456c1c56","year":2025},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:24.012658Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:70bd2b1d3063684c8134266e7a7d22511c83ed0a8a79c2fe545e032381e8af51","observation_id":"f2cf3119-0509-49f2-805a-fd38157d3be4","resolution":{"observed_at":"2026-08-15T15:04:24.477603Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16789","last_updated":"2024-03-09T22:26:06Z","snapshot_observed_at":"2026-08-08T18:07:29.632928Z","submitted_at":"2023-10-25T17:21:23Z","title":"Detecting Pretraining Data from Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16789","snapshot_observed_at":"2026-08-15T15:04:24.025493Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:24.025493Z"},"links":{"cited_paper":"/paper/2310.16789","citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:f85463d25387cd4bb6420963e81f06ac78350f5ef75d082e89c43ea2b229d4ae","observation_id":"361f4804-45fd-41c0-8157-5973a6fa9746","resolution":{"observed_at":"2026-08-15T15:04:24.025493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.322171Z","title":"Stiennon, L","venue":null,"work_id":"e6202313-7daa-48ae-ac73-f6d1715cedfb","year":2020},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:24.034929Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:7925283c9dc7ff4c8bd8bc23cbe66a42bc559d208980a648d59af1b5e0104a77","observation_id":"a5b0d093-908d-4481-8ee5-25223d23b81e","resolution":{"observed_at":"2026-08-15T15:04:25.339250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.273229Z","title":null,"venue":null,"work_id":"a87ff20e-ae30-4f4d-891b-59f91fc83d8c","year":2023},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:24.042808Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:7cf851ce646ccc48a50f8611ea115eb105568e6eea54196704d9a4376f7d69ae","observation_id":"90b12d60-1d60-4933-b82c-24b52976fa39","resolution":{"observed_at":"2026-08-15T15:04:25.290817Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02483","last_updated":"2023-07-05T17:58:10Z","snapshot_observed_at":"2026-08-15T10:16:52.688429Z","submitted_at":"2023-07-05T17:58:10Z","title":"Jailbroken: How Does LLM Safety Training Fail?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02483","snapshot_observed_at":"2026-08-15T15:04:24.049741Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:24.049741Z"},"links":{"cited_paper":"/paper/2307.02483","citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:615852c8bb28bf51ffee9236a88d6221a3a68120dd857a5df2987219ee923f38","observation_id":"4195bbd2-6cf9-4f1b-bd56-248690b08a9e","resolution":{"observed_at":"2026-08-15T15:04:24.049741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:04:25.217749Z","title":"Zheng, W.-L","venue":null,"work_id":"5b1d5601-7db6-446b-bbb9-e531fe8fb17d","year":2023},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:24.060625Z"},"links":{"citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:1af67b4f2b40e4a89ffdfdc475e862bc90af4cba433d3e8a9d875cbac7dac5e2","observation_id":"8ee3447a-3267-438d-8c7c-1682d9e6c6d8","resolution":{"observed_at":"2026-08-15T15:04:25.232661Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.01604","last_updated":"2026-05-02T21:02:08Z","snapshot_observed_at":"2026-08-15T05:41:02.814541Z","submitted_at":"2026-05-02T21:02:08Z","title":"Evaluating Agentic AI in the Wild: Failure Modes, Drift Patterns, and a Production Evaluation Framework","version":1},"cited_work":{"arxiv_id":"2605.01604","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.01604","snapshot_observed_at":"2026-08-15T15:04:24.687597Z","title":"Evaluating Agentic AI in the Wild: Failure Modes, Drift Patterns, and a Production Evaluation Framework","venue":"cs.AI","work_id":"77ca7ec8-fd68-4c17-b5c9-a251320cc8f5","year":2026},"citing_paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-15T15:04:23.928175Z"},"links":{"cited_paper":"/paper/2605.01604","citing_paper":"/paper/2608.02786"},"observation_digest":"sha256:cf0bcc2e13a05bda22a43742efe4a252272f1f58504c6bb14bf8954ca25a0962","observation_id":"4c9e9614-ac3a-42bb-9f4f-64a6db18cfb9","resolution":{"observed_at":"2026-08-15T15:04:24.702289Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.02786","last_updated":"2026-08-03T18:33:37Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T01:27:11.170701Z","submitted_at":"2026-08-03T18:33:37Z","title":"Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":6,"verified_fuzzy":14},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2608.02786."}