{"as_of":"2026-08-05T20:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7dd1a8b97081e9a806de253760db7a6c0b6b976d68b09e2733be89d9d7f1fe79","coverage":[{"denominator":155,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T16:11:36.483820Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.09809/citation-record","integrity":"/paper/2606.09809/integrity","json":"/paper/2606.09809/citation-record.json","paper":"/paper/2606.09809"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Developing and maintaining an open- source repository of AI evaluations: Challenges and insights","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:2412c6a32a366791825b1d4f03ae09212d4ae6e3e80bb8d8090ae45a7fa846ec","observation_id":"7b245c6e-5c7c-42ae-8c18-1581876bfa32","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"cited_work":{"arxiv_id":"2602.16763","doi":"10.48550/arxiv.2602.16763","metadata_source":"pith","pith_arxiv_id":"2602.16763","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","venue":"cs.AI","work_id":"fb4bcdcb-e72f-4428-8d2a-fd34a4437e50","year":2026},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"cited_paper":"/paper/2602.16763","citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:aa999b1c50d7b1b5ff99f415e24db53852fbb363a0d92db11d9e068069fd4256","observation_id":"768ab1bc-4dd9-4f56-856c-e3874910ec0a","resolution":{"observed_at":"2026-07-03T01:57:32.210991Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:02.919694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:02.919694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14046","last_updated":"2021-07-14T15:16:40Z","snapshot_observed_at":"2026-07-06T11:33:46.163810Z","submitted_at":"2021-07-14T15:16:40Z","title":"Audit and Assurance of AI Algorithms: A framework to ensure ethical algorithmic practices in Artificial Intelligence","version":1},"cited_work":{"arxiv_id":"2107.14046","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.14046","snapshot_observed_at":"2026-07-03T01:57:32.194258Z","title":"Audit and assurance of AI algorithms: A framework to ensure ethical algorithmic practices in artificial intelligence, 2021","venue":null,"work_id":"58a53e72-e302-422d-be16-ce2945b3da34","year":2021},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"cited_paper":"/paper/2107.14046","citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:5fbda812138a7eb63d50e74921323105576f8bfd16fe524c8f0365bc4fb0369e","observation_id":"09a70119-7f73-4524-a805-c41a03f73f33","resolution":{"observed_at":"2026-07-03T01:57:32.195823Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Lessons from the trenches on evaluating machine-learning systems in materials science.Computational Materi- als Science, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:77a0531861c6e799665d01bb89c9ee4998e2eb1422acbdf52d7b621b3ec894c8","observation_id":"300eba02-62bf-4e26-a423-27cb2c662207","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15931","last_updated":"2025-05-21T18:36:05Z","snapshot_observed_at":"2026-07-06T21:28:06.120576Z","submitted_at":"2025-05-21T18:36:05Z","title":"AllMetrics: A Unified Python Library for Standardized Metric Evaluation and Robust Data Validation in Machine Learning","version":1},"cited_work":{"arxiv_id":"2505.15931","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15931","snapshot_observed_at":"2026-07-03T01:57:32.203018Z","title":"Salmanpour","venue":null,"work_id":"24804260-912d-4ba5-bb49-4f4ac187840c","year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"cited_paper":"/paper/2505.15931","citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:ef532b9faf24c7b328335546c6e6b136a88beb113a1d8fbfb2264d51151b73fa","observation_id":"07de6629-35e0-4160-aa89-04d53f06453f","resolution":{"observed_at":"2026-07-03T01:57:32.204731Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Arnstein","venue":null,"work_id":null,"year":1969},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:fe5fbc884946b26513596ca8acba7f004d10bf187e81e9e0e77590898ba7b3c6","observation_id":"fddfe3a7-b55c-4ae0-9750-b4d84e401043","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Comparison of AI models across intelligence, performance, and price,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:141d48c1e23fbabb0c048ba226c041526a551077428a474d4de6da74bd3e0e2d","observation_id":"7d739621-4023-464d-a898-50de56e202e6","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:3912f17e111930240373b63f8d059925fbcbc4f13ff726aa32a24a07d11b5550","observation_id":"b5ca1dac-2be0-4b75-85b2-5cd6b57304d3","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05780","last_updated":"2025-07-09T12:28:00Z","snapshot_observed_at":"2026-07-06T20:48:45.592525Z","submitted_at":"2025-02-26T12:23:14Z","title":"AI Risk Atlas: Taxonomy and Tooling for Navigating AI Risks and Resources","version":2},"cited_work":{"arxiv_id":"2503.05780","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.05780","snapshot_observed_at":"2026-07-03T06:07:41.005783Z","title":"AI risk atlas: Taxonomy and tooling for navigating AI risks and resources,","venue":null,"work_id":"89b5290f-8952-432d-b67c-7b7deaa6c175","year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"cited_paper":"/paper/2503.05780","citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:257a5cb04921ef7056f5333b7d57af8e5bd47ef48b5c524e2d257dbefdf7c5d2","observation_id":"17a62291-90e3-4113-b81b-97ecc6dfe3ba","resolution":{"observed_at":"2026-07-03T01:57:32.198709Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Leak, cheat, repeat: Data contamination and evaluation malpractices in closed-source LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:f0e644af8576b46551a79f557a899912e2a26213c3b16adea53d43ee0761d6e0","observation_id":"ea6ae664-fb70-4f10-85d7-0fffb38b3ebc","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03913","last_updated":"2025-06-04T13:05:37Z","snapshot_observed_at":"2026-07-06T21:36:30.276761Z","submitted_at":"2025-06-04T13:05:37Z","title":"When Fairness Isn't Statistical: The Limits of Machine Learning in Evaluating Legal Reasoning","version":1},"cited_work":{"arxiv_id":"2506.03913","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03913","snapshot_observed_at":"2026-07-03T01:57:32.205982Z","title":"When fairness isn’t statistical: The limits of machine learning in evaluating legal reasoning, 2025","venue":null,"work_id":"ff2ac59c-901f-4157-9862-1bd71538d809","year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"cited_paper":"/paper/2506.03913","citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:f2a846ba0129db19fe3162d0043e67aab64cfe31017c02d5ddaf1b7a56d23516","observation_id":"2e6c38c0-6447-45b6-9866-3d149e859c37","resolution":{"observed_at":"2026-07-03T01:57:32.207757Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Every eval ever: Toward a common language for AI eval reporting","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:b23c5155acf7be94b165d61cab445cb07361581c0d7ca07ffa797e85b3794080","observation_id":"220186bc-b6cf-4092-87cc-f29cb8de6b89","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.04703","doi":"10.48550/arxiv.2511.04703","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2511.04703; presented at Neurips 2025 , year=","venue":"ArXiv.org","work_id":"dfbd1f62-7719-47db-97f9-5603a1f2dc22","year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:ee30f1ee170074e37d62577074eb49af95e60a78cb13d79f4ed7e367da801b96","observation_id":"c79f37c2-f434-48e5-8986-bb51d6b42e8d","resolution":{"observed_at":"2026-07-03T01:57:32.638182Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.03392","last_updated":"2025-07-04T08:53:08Z","snapshot_observed_at":"2026-07-06T21:52:18.525939Z","submitted_at":"2025-07-04T08:53:08Z","title":"Absolute Evaluation Measures for Machine Learning: A Survey","version":1},"cited_work":{"arxiv_id":"2507.03392","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.03392","snapshot_observed_at":"2026-07-03T02:07:33.292807Z","title":"arXiv preprint arXiv:2507.03392 , year=","venue":null,"work_id":"81116e8f-a790-4970-a4a6-34d1d67eadc8","year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"cited_paper":"/paper/2507.03392","citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:d1c5e9954748f61b7d000c96cc9739837a25cad99e3d4fe1bbd8269ac0f5a383","observation_id":"76c7d314-f787-4bf5-903c-8c0438e44c77","resolution":{"observed_at":"2026-07-03T02:07:33.294769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Open llm leaderboard (2023- 2024)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:86544f4f2a212418ade7f2af73a3a9654b26355c0c976b8f4e0cd18aa337daea","observation_id":"f60233f5-bd3c-45ba-bf68-fe3356b03fd0","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14782","last_updated":"2026-05-31T00:04:33Z","snapshot_observed_at":"2026-08-02T05:44:43.939336Z","submitted_at":"2024-05-23T16:50:49Z","title":"Lessons from the Trenches on Reproducible Evaluation of Language Models","version":3},"cited_work":{"arxiv_id":"2405.14782","doi":"10.48550/arxiv.2405.14782","metadata_source":"pith","pith_arxiv_id":"2405.14782","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Lessons from the Trenches on Reproducible Evaluation of Language Models","venue":"cs.CL","work_id":"47b597a2-a355-4305-b1e4-80666b394ccd","year":2024},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"cited_paper":"/paper/2405.14782","citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:e713833f9ed735f1fb25804cdf651859d3dd778f458740d6eb57e76961f01cb8","observation_id":"8159c697-2f6f-473f-a423-8e39246aa914","resolution":{"observed_at":"2026-07-03T02:07:33.240679Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:45.557591+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:45.557591+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"A metrological framework for uncertainty evaluation in machine learning classification models.Metrologia, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:524615c0716ec2edd5e44c05b81eadec99148da507f35415aba5c3595d49f18d","observation_id":"facbbe95-f13d-4bde-b884-df235d47cfd0","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"The impact of standardisation and standards on innovation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:54bfb58bcc58a70648ba491c7ea520afa6c524f7e9705c358382fc614393612f","observation_id":"52ce2210-9dc6-4fbe-af4d-2125cc502f24","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Assessing ai: Surveying the spectrum of approaches to understanding and auditing ai systems, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:c380a5bb58b3c0d1eb07717b3cc7bddb0c9afb18df86b9e08b54a3726c661592","observation_id":"41d0cab6-d5b4-422c-936d-348cc8619a9e","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Evaluation for change","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:54be811e7f74c0fb5b24e542182bb6d94586e73f92c75bf5e99f73985ad66260","observation_id":"3b8a0ff5-d55f-4092-b74e-5c7c4aa83d55","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.04062","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T16:58:43.258612Z","title":"Bordes, C","venue":null,"work_id":"f8c7b140-db16-4481-9f07-38382bb909ba","year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:a74d5ce91d59d2935fa6adaddc15c2f3efe67b09f3afd1c5ee7ca3c0a03cb90b","observation_id":"b784dba0-3e0f-4119-9cf7-790e0f2aeffa","resolution":{"observed_at":"2026-07-03T02:07:33.244421Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":null,"venue":null,"work_id":null,"year":1968},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:9c574cee5b150b3837f520be25d554efd7d30f67880f2744a2bdd3b50235ecbc","observation_id":"3756fd09-6a51-404c-a723-06998069018d","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Cohn, and Jose Hernandez- Orallo","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:112868fb577d3e2deda7ae613fa0a11b998725c56858c3a519ddbd64b59fff90","observation_id":"809552e1-9e2c-49d6-a9ce-34459b9f84be","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"best fit","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:27f4e27460a79e6b03bb69ff9c118aa62438221be219d62e4e9f10b0348c99c3","observation_id":"9562ffa5-7302-4efd-937f-cd72e94c3bb2","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Black-box access is insufficient for rigorous AI audits, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:628772fa13b4751a454a6eac052bd79d15ab1be049c989ab6804935d9a3c1444","observation_id":"a8fcc0fc-ff7a-4583-9ce0-3a662040d04d","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5627.337581","doi":"10.1145/3375627.3375811","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ISBN 978-1-4503-7110-0","venue":"Proceedings of the AAAI/ACM Conference on AI Ethics and Society","work_id":"f0f47d11-23b0-411f-8ce3-b43a70f619bc","year":2020},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:4318dc2517b9fb00bd41a3bfb43f635b5a7264eca6b6d44861b68b4a1e85b6d8","observation_id":"fea5f83f-3ffc-4564-a951-9d7608954e35","resolution":{"observed_at":"2026-06-27T16:21:02.278927Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Managing misuse risk for dual-use foundation models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:556e97b9df937c1ffeca01d12ee7151bbc9e0b9a8fcdd1e62ac79e4d6c4f8eb4","observation_id":"d5236e58-a0c7-4cc9-a54f-dd3d2d21c171","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06800","last_updated":"2023-10-10T17:11:14Z","snapshot_observed_at":"2026-07-06T16:30:37.867641Z","submitted_at":"2023-10-10T17:11:14Z","title":"Test & Evaluation Best Practices for Machine Learning-Enabled Systems","version":1},"cited_work":{"arxiv_id":"2310.06800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.06800","snapshot_observed_at":"2026-07-03T02:07:33.271701Z","title":"Test & evaluation best practices for machine learning-enabled systems, 2023","venue":null,"work_id":"c1fbe39e-9eac-48bd-bd91-ab25a2df01c4","year":2023},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"cited_paper":"/paper/2310.06800","citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:7c793077f2329ddba8d87b1c930114f1eb4a8fc9455ee8e46637490439011482","observation_id":"c7ff8246-6aca-4a75-a1ad-594b2a8564d1","resolution":{"observed_at":"2026-07-03T02:07:33.273535Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Evaluating machine expertise: How graduate students develop frameworks for assessing GenAI content, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:ae6a54826e4d498dd08ff4d8ad7ac2984d0bb1220f4c248c426a00c817ffb2ce","observation_id":"738ae33f-8811-4c89-8585-260ba7a98ee0","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:a724d1fa62a090d11d010c86ebd1afba1ef4bb4fbf8c250fae5cea87324002a2","observation_id":"613320f0-72c3-489b-ae48-3616f67f4de5","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Collins, Karel G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:e03e5d47cff18ef84f408f12652329d69229de4587b24437ddc2803129ca418c","observation_id":"c7dd991b-4739-4eaf-a6d5-4b1e569a3d21","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02521","last_updated":"2023-10-04T01:40:03Z","snapshot_observed_at":"2026-07-06T16:27:26.971077Z","submitted_at":"2023-10-04T01:40:03Z","title":"Who Audits the Auditors? Recommendations from a field scan of the algorithmic auditing ecosystem","version":1},"cited_work":{"arxiv_id":"2310.02521","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.02521","snapshot_observed_at":"2026-07-03T02:07:33.269110Z","title":"Who audits the auditors? recommendations from a field scan of the algorithmic auditing ecosystem, 2023","venue":null,"work_id":"c69e3190-e37b-45bf-b3ad-62dc5e4dd484","year":2023},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"cited_paper":"/paper/2310.02521","citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:ab4a9511ed49b3dd4d2bbc710f0e701a408d5a489afcd0d8e0ce3ad564d7351b","observation_id":"4728629b-1ad2-4939-99cc-83d70a6f65f9","resolution":{"observed_at":"2026-07-03T02:07:33.270816Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Evalcards: A framework for standardized evaluation reporting, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:aed6a6dabfe6eabca21291085e04f329983eca603e004ab1688c42fb232b7428","observation_id":"52dda918-d769-4483-b073-651ec09383ea","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Nahab, and Xiao Hu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:3762eb78eaf036bcc795980989d2b2ee9f07ad2bd8e7b81f7d40e88de93beb9b","observation_id":"5287ce39-eb69-4e26-8f6b-e5a182d71ff0","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02300","last_updated":"2023-12-04T19:34:08Z","snapshot_observed_at":"2026-07-06T16:56:53.868165Z","submitted_at":"2023-12-04T19:34:08Z","title":"Reconsideration on evaluation of machine learning models in continuous monitoring using wearables","version":1},"cited_work":{"arxiv_id":"2312.02300","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02300","snapshot_observed_at":"2026-07-03T01:57:32.633917Z","title":null,"venue":null,"work_id":"265e7929-7c8e-421a-bb76-1cd7148b3a1a","year":null},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"cited_paper":"/paper/2312.02300","citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:8d3014e5bd9daa1fa366d0cc582251337cfdbbe7e60cbcf503e54a09ecc7cc31","observation_id":"a57e7f02-52f4-4b32-bcc2-485640696c9e","resolution":{"observed_at":"2026-07-03T01:57:32.635442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Introducing Epoch AI’s AI benchmarking hub, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:86e1854ddd5aa7dee5ac084ccb1d74959e2fec697f0aa2292694afa53db87afd","observation_id":"de13c229-28b5-460e-8bc0-67b9e5c9cf20","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Can we trust AI benchmarks? An interdisci- plinary review of current issues in AI evaluation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:6741a31be2baa9456858c86620cbc912d97aed2c5cabc9a8d838a89a0415a5c4","observation_id":"2b4b035c-af93-4529-9ec6-f64841e35e2b","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"The general-purpose AI code of practice: Safety & security chapter, July 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:a688c60b8abc9f36f39bae325485816c479f71e9efdbdde046d0e68b59b24441","observation_id":"53ada467-ae6f-44a5-a908-1db68dcba33c","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"The general-purpose AI code of practice: Trans- parency chapter, July 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:d0c5c08beaaed62b11290de24d532bb09d8c1523a69b019d2c9d4e6ee1389762","observation_id":"f400d197-4754-4cab-bf45-ba0286b68d98","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"EvalEval: Every eval ever shared task, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:5b7b7cd4102f03c74e7c030f7c29b139ca7fe670d8aafd620c96c2f7621e3c2e","observation_id":"ae0b8826-358a-44c9-ba96-fc0b3c821c9c","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03700","last_updated":"2024-12-04T20:30:16Z","snapshot_observed_at":"2026-07-06T20:01:50.356653Z","submitted_at":"2024-12-04T20:30:16Z","title":"Good practices for evaluation of machine learning systems","version":1},"cited_work":{"arxiv_id":"2412.03700","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03700","snapshot_observed_at":"2026-07-03T01:57:32.628243Z","title":"Good practices for evaluation of machine learning systems, 2024","venue":null,"work_id":"d86f76b0-61af-4b1d-8a81-568d0c347dad","year":2024},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"cited_paper":"/paper/2412.03700","citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:4627405bf0c7e31677f177d19243df71aec1faa7e1d4b63a0deea2d72ccda2f3","observation_id":"9b10e715-edaf-4f83-8432-d3c49d9e84c8","resolution":{"observed_at":"2026-07-03T01:57:32.629761Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Frontier capability assessment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:29af3a03e930b421c30e45b38e210709c04043a332f9129687e006bbadfa8b62","observation_id":"16a21a07-681d-48d3-8186-bdb157931f7d","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Datasheets for datasets.Commun","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:5316fea72c67cb2b8c4e10c36669952e2fa46f0bf1b804f7f62fb6c0fe69cb1e","observation_id":"e977c2d2-ef7f-4c93-8630-5dc0dd0dd403","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Repairing the cracked foundation: A survey of obstacles in evaluation practices for generated text.Journal of Artificial Intelligence Research, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:2165f02a411af09ce24db02e24be441bf029a96515f3a941e1874f93582cc60f","observation_id":"69090bd6-e9ac-4361-bbef-53f3c68e9e69","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05731","last_updated":"2025-04-18T22:04:46Z","snapshot_observed_at":"2026-08-03T00:17:33.673917Z","submitted_at":"2025-02-19T05:58:52Z","title":"AILuminate: Introducing v1.0 of the AI Risk and Reliability Benchmark from MLCommons","version":2},"cited_work":{"arxiv_id":"2503.05731","doi":"10.48550/arxiv.2503.05731","metadata_source":"pith","pith_arxiv_id":"2503.05731","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Artificial intelligence - carrying us into the future","venue":"cs.CY","work_id":"73705ad9-26b2-4cea-89f1-e2348125148b","year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"cited_paper":"/paper/2503.05731","citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:fa4d8dcf6510eb259c48b062833fee2fe5943d7e28eddc869658dc381319f3a6","observation_id":"187eaf4c-0767-4ac9-9c9c-5e6dd4e50397","resolution":{"observed_at":"2026-07-03T01:57:32.632648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19550","last_updated":"2024-05-29T22:26:26Z","snapshot_observed_at":"2026-07-06T18:22:18.644161Z","submitted_at":"2024-05-29T22:26:26Z","title":"Stress-Testing Capability Elicitation With Password-Locked Models","version":1},"cited_work":{"arxiv_id":"2405.19550","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.19550","snapshot_observed_at":"2026-07-03T10:48:02.313626Z","title":"2024 , journal =","venue":null,"work_id":"9c5c03f8-06ff-4c95-a48f-db5277dc59d0","year":2024},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"cited_paper":"/paper/2405.19550","citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:b2507fb44567dccdc9e240dc6aa62daa9f90d4f5f4a038d4536131cbd3ecbf92","observation_id":"5247466e-5473-45ad-8301-eddc3cce436b","resolution":{"observed_at":"2026-07-03T02:07:33.261481Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Olmes: A standard for language model evaluations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:332cf294e7031371fcfc9d329be94c2d9d90ade62bc7c40ca158cc86da9ab225","observation_id":"6d2dc62f-528e-4866-81d7-d551b8797e4c","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Gupta, Jessica Hullman, and Hari Subramonyam","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:4ffedbb83e9588b8c898a10036d3b024f766b0c32f07461e55ea996937526e68","observation_id":"0742dfa1-161e-4604-b4f6-09fc8b534b28","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04754","last_updated":"2022-08-31T19:57:55Z","snapshot_observed_at":"2026-08-03T21:07:17.128864Z","submitted_at":"2022-03-01T18:56:45Z","title":"System Cards for AI-Based Decision-Making for Public Policy","version":2},"cited_work":{"arxiv_id":"2203.04754","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.04754","snapshot_observed_at":"2026-07-03T01:57:32.622598Z","title":"Kakadiaris","venue":null,"work_id":"d7ba4cad-e295-447b-b062-70967e5ea943","year":2022},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"cited_paper":"/paper/2203.04754","citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:7fc95edaab8e0396c2ab068605034cc9eea395508e36825f3412b97d0c18682c","observation_id":"a4dba60e-6eb6-47b0-b0a5-a631bcea00bc","resolution":{"observed_at":"2026-07-03T01:57:32.624032Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12451","last_updated":"2024-11-19T12:19:28Z","snapshot_observed_at":"2026-08-05T08:52:26.097450Z","submitted_at":"2024-11-19T12:19:28Z","title":"Empirical Privacy Evaluations of Generative and Predictive Machine Learning Models -- A review and challenges for practice","version":1},"cited_work":{"arxiv_id":"2411.12451","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.12451","snapshot_observed_at":"2026-07-03T02:07:33.278279Z","title":"Empirical privacy evaluations of generative and predictive machine learning models – a review and challenges for practice, 2024","venue":null,"work_id":"6f5f7673-5602-4e21-a8da-4508604baec4","year":2024},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"cited_paper":"/paper/2411.12451","citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:47437793968f923a75196e31ff412192677c00899bf26ae04ce08b2a439cdb74","observation_id":"f6cabc94-c87a-4c08-90a0-e8c0dc6df617","resolution":{"observed_at":"2026-07-03T02:07:33.280148Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Bernstein, and Mykel John Kochenderfer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:d8e465e33f57f09f04ccd27a6a156cbf2df102ecd702f78443e9fd2ed87f744e","observation_id":"88aeeb68-936f-43be-a5db-b62d9ca0884f","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"A sober look at progress in language model reasoning: Pitfalls and paths to reproducibility","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:ceab897da366525fe4ec743e117e9c963162e217298725b734a75ebdbe4bb024","observation_id":"e2d40dca-467b-4097-86e9-7d10adf88655","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v40i48.42352","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Auto-benchmarkcard: Automated synthesis of benchmark documentation","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"4a3cba0e-0d03-4f5e-89fc-bb35a4547323","year":2026},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:39e733530ab41ddc5a07a80530f0d2cad15f98baa1b3c84689040bc6df69c312","observation_id":"846636de-5d90-4d31-a485-24fe2a3e4881","resolution":{"observed_at":"2026-06-27T16:21:02.272109Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15236","last_updated":"2025-04-21T17:13:16Z","snapshot_observed_at":"2026-07-06T21:12:37.115803Z","submitted_at":"2025-04-21T17:13:16Z","title":"Values in the Wild: Discovering and Analyzing Values in Real-World Language Model Interactions","version":1},"cited_work":{"arxiv_id":"2504.15236","doi":"10.48550/arxiv.2504.15236","metadata_source":"pith","pith_arxiv_id":"2504.15236","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Values in the wild: Discovering and analyzing values in real-world language model interactions","venue":"cs.CL","work_id":"33cfb0f5-7924-4313-af70-71e4a15f680d","year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"cited_paper":"/paper/2504.15236","citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:5ab12ae9996f40ce6bc89bdfe8472f143efa4e1ad7c50da118b308930ef95328","observation_id":"e7d06c8c-206c-475b-a101-3bc49ba1521a","resolution":{"observed_at":"2026-07-03T01:57:32.627001Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Evaluation gaps in machine learning practice","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:69b6db8e6f064e4258846310bf021b902698329605f1fade6812cb7ba87a5800","observation_id":"c838f560-df5b-48bf-b216-70c9b87f9898","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05205","last_updated":"2022-04-18T16:20:38Z","snapshot_observed_at":"2026-07-06T12:59:12.318367Z","submitted_at":"2022-04-11T15:49:12Z","title":"Rethinking Machine Learning Model Evaluation in Pathology","version":3},"cited_work":{"arxiv_id":"2204.05205","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2204.05205","snapshot_observed_at":"2026-07-03T01:57:32.618742Z","title":"Rethinking machine learning model evaluation in pathology, 2022","venue":null,"work_id":"d5e7ba07-cf58-4ab8-b03e-f55fc7b584f3","year":2022},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"cited_paper":"/paper/2204.05205","citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:5e2007c9e2b8d9c2d1b71f855eb57fbaea4b36cdc1aad5a813db4d49be0303d4","observation_id":"78aaf0f0-e42a-45c9-a479-6b23b4a90f84","resolution":{"observed_at":"2026-07-03T01:57:32.620424Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Deprecating benchmarks: Criteria and framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:70063c4196d1b708cc839df30f61ff77707302d47d250e67ec8c19abd84c0ac8","observation_id":"10fa77d5-1123-4b07-b294-40ba69195ff5","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Cantrell, Keiran Peng, Thanh Huy Pham, Christopher A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:afa66dbfd70ca2d3e0d663ee9ef35585419e23545dc8d90e0f7e288db3d7804e","observation_id":"5ec1306f-fbf5-46f7-8e94-18bfe0825f5d","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.01232","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T02:07:33.295133Z","title":"Benchmark profiling: Mechanistic diagnosis of LLM benchmarks, 2025","venue":null,"work_id":"554d1696-e6b2-4c25-ae25-935535985dfe","year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:35270a62a195d7f379275ea96d58d2b2c8f0f4cfd2cf2c6419166301a747d8ee","observation_id":"8c8c2b13-2bfe-4c2e-9801-167b8ec3a8a8","resolution":{"observed_at":"2026-07-03T02:07:33.296898Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Had- field, Lukas Heim, Marianela Rodriguez, Jonas B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:77b544f1592079d383060f6277cbb5469354a8ef7f5e66e9054585d924b5a415","observation_id":"3525567a-a7c4-416d-b5e0-5c026955eac2","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Richard Landis and Gary G","venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:07058190172c0338be6687176503c4cf4b97aa8c775cdf4e85ec33cce7aa836a","observation_id":"abb5f37e-6155-4945-96e0-c23b990aeb37","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Towards explainable evaluation metrics for machine translation.Journal of Machine Learning Research, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:9b7fe33936df1358fc2ee0e43e99a67b4e96b0e6bb31fd0fd5d8524f92d04358","observation_id":"a58b9389-fa75-416b-b92b-fe1336010982","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Frangi, Antonio R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:b423c4bee0311c2f0bc66438a87168880d07e858f46846b05234f22c224b50e0","observation_id":"c99d7223-2015-4d88-a724-58467ba04a48","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-01T19:14:56.803459Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:3d29eac4250227257d931d43a0451a0713509400fe8b09b693e2f5849cd608da","observation_id":"b84f8a9e-b3a1-44d0-a18d-336e07395aad","resolution":{"observed_at":"2026-07-03T02:07:33.254030Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Manning, Christopher Ré, Diana Acosta-Navas, Drew A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:6c0bc6a6f760e2cd5eb269dc1cd1aea904b6b852a63f5e19a0c6dc279e6b3c81","observation_id":"fa987c16-36fc-4970-98eb-7890c5f31ba9","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Are we learning yet? a meta review of evaluation failures across machine learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:b50194345f59c06ad508e8cc20828ac51604ad4d6ebfc880fe20907b1ba2cd05","observation_id":"ab6b7e59-b904-4f46-b24d-3c8807e41fa3","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"A safe harbor for AI evaluation and red teaming","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:bd9a3b7006db2986ea7e7ad6b1f79f6de384439690935143b862e97da5953402","observation_id":"f7a96ef9-77b9-4134-88d0-e5db5a517309","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"LLM cyber evaluations don’t capture real-world risk,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:4556fea2185869e98ec9e3207c8e6c5ea21aa610e4ca439ff4a13e08d577df3f","observation_id":"b25eb4e2-3da2-4935-97cf-bf1dda8b9930","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00072","last_updated":"2025-01-31T05:33:48Z","snapshot_observed_at":"2026-07-06T20:29:16.557656Z","submitted_at":"2025-01-31T05:33:48Z","title":"LLM Cyber Evaluations Don't Capture Real-World Risk","version":1},"cited_work":{"arxiv_id":"2502.00072","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.00072","snapshot_observed_at":"2026-07-03T02:07:33.281632Z","title":"Llm cyber evaluations don’t capture real-world risk.arXiv preprint arXiv:2502.00072","venue":null,"work_id":"cdef5924-6528-474f-a938-fcf70870e189","year":null},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"cited_paper":"/paper/2502.00072","citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:08c411295e3530cb894da6761c972b588194d3a6dc819cd0c97b89ecb8865bfe","observation_id":"dd764713-2be5-4852-b2a9-32a041fabb52","resolution":{"observed_at":"2026-07-03T02:07:33.283723Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Data contamination: From memorization to exploitation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:8f5e643448946ed0f6abee14626ba017b35983568a9b362788ed819b7c0291aa","observation_id":"e7404c52-2c9e-4187-8065-84534df7ec12","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Building less-flawed metrics: Understanding and creating better measurement and incentive systems.Patterns, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:94488d00f40a2f3151275473e4a226dfdc0796065f3e72a63c11cd78935c4f05","observation_id":"6790727a-79ba-4a09-953a-7d2c552da715","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Oard, Luca Soldaini, Ian Soboroff, Orion Weller, Efsun Kayi, Kate Sanders, Marc Mason, and Noah Hibbler","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:3e4709657db3083dca74e6264cd022ace948ba4e2b2a32c179867ef932688eab","observation_id":"3aae7fab-7a26-4247-9fd2-fda3ad46b397","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09853","last_updated":"2025-09-03T12:52:33Z","snapshot_observed_at":"2026-07-06T22:12:26.366922Z","submitted_at":"2025-08-13T14:36:36Z","title":"STREAM (ChemBio): A Standard for Transparently Reporting Evaluations in AI Model Reports","version":2},"cited_work":{"arxiv_id":"2508.09853","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09853","snapshot_observed_at":"2026-07-03T02:07:33.274522Z","title":"STREAM (chembio): A standard for transparently reporting evaluations in AI model reports","venue":null,"work_id":"54c9b1f7-41da-4051-87e2-ba96a8b47ba2","year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"cited_paper":"/paper/2508.09853","citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:ad7155c92a00bc50ca2aff2a6645f2e3014044d7f9e51aadaf278fa5fc09341a","observation_id":"5f0053b5-d011-4038-8aaf-224e8c215a18","resolution":{"observed_at":"2026-07-03T02:07:33.277542Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Adding error bars to evals: A statistical approach to language model evaluations,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:5532745b2f0c959959efbff92022e6f275d6fc45438dd085e0a7504d437160c4","observation_id":"e96cffc0-b2b3-4478-b5be-ecdd3c63ba0c","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00640","last_updated":"2024-11-01T14:57:16Z","snapshot_observed_at":"2026-07-06T19:43:37.792643Z","submitted_at":"2024-11-01T14:57:16Z","title":"Adding Error Bars to Evals: A Statistical Approach to Language Model Evaluations","version":1},"cited_work":{"arxiv_id":"2411.00640","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.00640","snapshot_observed_at":"2026-07-08T07:04:44.500362Z","title":"arXiv preprint arXiv:2411.00640 , url=","venue":"stat.AP","work_id":"11131858-380f-4d55-8d34-f895b9196892","year":2024},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"cited_paper":"/paper/2411.00640","citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:9baa2675c73ca5cfe705a99dfe1683cede6b00c49523dfa2333364294aca0800","observation_id":"74551f00-3c90-46f7-ba22-fef4cc9354a3","resolution":{"observed_at":"2026-07-03T02:07:33.250825Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Model cards for model reporting","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:c9050aa139997350c52fbfa4e75652e56d7334472c055a3c6046b6b04a52030f","observation_id":"aa00e479-e585-4cb3-a540-baa559133031","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00595","last_updated":"2024-05-06T10:20:26Z","snapshot_observed_at":"2026-07-06T17:10:24.956257Z","submitted_at":"2023-12-31T22:21:36Z","title":"State of What Art? A Call for Multi-Prompt LLM Evaluation","version":3},"cited_work":{"arxiv_id":"2401.00595","doi":"10.48550/arxiv.2401.00595","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.00595","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CoRR, abs/2401.00595","venue":"arXiv (Cornell University)","work_id":"9571587f-84df-407b-baa8-6c9557faa0c7","year":2024},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"cited_paper":"/paper/2401.00595","citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:5abbce715321ff9006bf4de8d7dde8e416d3e64f812498ff1826dc787394c540","observation_id":"7d68ccd6-9171-44d5-b05f-9d322032e90c","resolution":{"observed_at":"2026-07-03T02:07:33.257770Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Extrinsic evaluation of machine translation metrics","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:c9d8db5b16713f8b51fe47ac19b1a552d33d6ade1dd42bdcdb09db71ea3cdba7","observation_id":"ba2db502-f4e6-4dc8-9bb7-9b329e9e870b","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:b0cbcc639221190abc1ed3177eab208ab8429b825dbe4e5512845acfd235392b","observation_id":"f4d3c5ae-5318-4bc0-bbe8-66ad1d569c5b","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15361","last_updated":"2025-08-21T08:43:35Z","snapshot_observed_at":"2026-08-05T17:59:24.133258Z","submitted_at":"2025-08-21T08:43:35Z","title":"A Survey on Large Language Model Benchmarks","version":1},"cited_work":{"arxiv_id":"2508.15361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.15361","snapshot_observed_at":"2026-07-04T05:09:36.772485Z","title":"A survey on large language model benchmarks, 2025a","venue":null,"work_id":"8d88765b-fed2-44c6-9298-d24da64f7f20","year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"cited_paper":"/paper/2508.15361","citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:dbb6656f03f73a92902d1c4778cfb1f64300f9d286767e256b8e03ade3fcbd51","observation_id":"b4546810-6750-4ab7-ab34-ec27b1103b63","resolution":{"observed_at":"2026-07-03T01:57:32.617219Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Evaluation of DeepSeek AI models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:5809f987df73cb21579793760e1d3158ee0328ad27ebfc3c071dde0959b5bb2f","observation_id":"f5e1abd3-f75f-4508-bd04-b077584b989f","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:fee31c61aa0e525b9b8ee784c939e14b2dc0fd9fbb02debc23138c7ae02eaf38","observation_id":"eda49157-95e1-4994-ac0a-88e683ced263","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Byun, Kevin Wei, and Toby Webster","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:8c09160ac5e60f2ee23bef04bcf2f88814c1cb090606357a0c01e9b5b1e6e57e","observation_id":"447529a4-fd12-4e37-8abf-2c6f998706cb","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:00aecbde5d27c1030a71c72e90298535a80ab30d8845c988ae7182f21384eb8f","observation_id":"bf33c5a0-7ccf-490a-9ae6-53808fd41cfb","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Toward best practices for AI evaluation and governance: A proposal for a european union general-purpose AI model evaluation standards task force","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:d215cea1b01009b69b8eb195ec12f4c65404757524ece6a799f848a5db87972b","observation_id":"f8ddff62-d616-403d-9d3b-f918f010c1ca","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Data cards: Purposeful and transparent dataset documentation for responsible ai","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:31204ced8b7442d092420ec34a161f07f703a6fc8943f653f3fddd5e60a1ace0","observation_id":"81a91e57-c3b8-4afd-ba90-afd8f2d8b6eb","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16672","last_updated":"2025-08-21T07:07:41Z","snapshot_observed_at":"2026-08-05T17:59:47.367039Z","submitted_at":"2025-08-21T07:07:41Z","title":"The AI Model Risk Catalog: What Developers and Researchers Miss About Real-World AI Harms","version":1},"cited_work":{"arxiv_id":"2508.16672","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.16672","snapshot_observed_at":"2026-07-03T02:07:33.245306Z","title":null,"venue":null,"work_id":"66f8de38-c030-47b7-883c-26bfaaac8ab0","year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"cited_paper":"/paper/2508.16672","citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:51e8c05eba90b9f46ca304391a5e2b316361c969fd3c1930b1cf634da4adffcd","observation_id":"34d37655-022d-4497-b11e-0505caafc797","resolution":{"observed_at":"2026-07-03T02:07:33.246972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Mellor, Jonathan Uesato, Po-Sen Huang, Johannes Welbl, Laura Weidinger, Sumanth Dathathri, Amelia Glaese, Geoffrey Irving, Iason Gabriel, William Isaac, and Lisa Anne Hendricks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:f07abe65fc760a4f6523b6d4fa8e3100b45d10b2c6aa65a5bfbb3d1d54c4eaa0","observation_id":"34f6a5ad-d167-4e2d-b9d4-a22bf6d56317","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21792","last_updated":"2024-12-27T17:36:21Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:59:24Z","title":"Safetywashing: Do AI Safety Benchmarks Actually Measure Safety Progress?","version":3},"cited_work":{"arxiv_id":"2407.21792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.21792","snapshot_observed_at":"2026-07-04T21:10:09.315037Z","title":"Kim, Stephen Fitz, and Dan Hendrycks","venue":null,"work_id":"fd35e7b1-cc17-41e8-b857-f311b6dc7a00","year":2024},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"cited_paper":"/paper/2407.21792","citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:9a630fd01bd61a7c6cd77a338dd8c08c59061566bef0e2836f67ba7e0970e462","observation_id":"34045775-d44e-43ae-bedc-d26990cc8319","resolution":{"observed_at":"2026-07-03T02:07:33.268541Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Kochenderfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:01e0f98d55998b47eafb560194e390f52cd1c5095b4b668fdebc7c18374c833d","observation_id":"2327c442-bf51-4758-a333-70bcceac9caf","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Measur- ing what matters: Connecting ai ethics evaluations to system attributes, hazards, and harms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:1926a0fd691a78df974b9aac00a6fa3c8619a4344b0e75abc2bf4e7d48381181","observation_id":"76033481-4fb4-41c0-90c1-3edb3c4d1ca4","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Measurement to meaning: A validity-centered framework for AI evaluation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:c46d9cef365487caec57874553b1bd5bfd7880ea96de9338046ea1392499cd95","observation_id":"2e89ba13-7217-408b-81c6-8bc2f39aeee6","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.2196/54704","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Interactive Journal of Medical Research","work_id":"1ffb653f-decc-4a21-a975-ad3fede25e27","year":2024},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:81c4f1984f9416be0ae9eb8358470f4dbc11a93f7d54b79cc58d6e7867e84581","observation_id":"78190728-5411-439c-a543-619cec0a4454","resolution":{"observed_at":"2026-06-27T16:21:02.273864Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:7b2d6798a27833bb3c8831013bbd6264b8535261245c742caa73d7a35a87e6ad","observation_id":"241f9a46-824b-4056-b059-6e49503cc97a","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Reality check: A new evaluation ecosystem is necessary to understand ai’s real world effects, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:76b07402ae3b9afbe4893bee0ad79843312ee01f907370c879b37806695fc793","observation_id":"1e2dd374-9a2f-4173-96dd-0a61d0dfe4e9","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Improving methodologies for agentic evaluations across domains: Leakage of sensitive information, fraud and cybersecurity threats, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:17718c98cba35959788ccde15a597034e060e54e30ec85da543f770e12fb11f6","observation_id":"6616e616-cfbf-45a5-802e-8df446a2038d","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15324","last_updated":"2023-09-22T18:48:42Z","snapshot_observed_at":"2026-07-06T15:32:39.787935Z","submitted_at":"2023-05-24T16:38:43Z","title":"Model evaluation for extreme risks","version":2},"cited_work":{"arxiv_id":"2305.15324","doi":"10.48550/arxiv.2305.15324","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model evaluation for extreme risks","venue":"arXiv (Cornell University)","work_id":"12dff4e7-a81d-4b95-aba7-885a457042c6","year":2023},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"cited_paper":"/paper/2305.15324","citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:1ae4cda0a038fe4e8b4df273ac4d592150eb5dbb4b3f0e3dc745fb86a3d5c0ee","observation_id":"2aad5fe4-fc00-42c9-9231-205c1d2855b6","resolution":{"observed_at":"2026-07-03T02:07:33.287703Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:52:16.870575+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Smith, Beyza Ermis, Marzieh Fadaee, and Sara Hooker","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:a8a149db0bf89e23943f1b2a286ee3db6257ea4dce8294a715bfa73596804cb9","observation_id":"55f2fff8-51cc-4ae6-958c-cbabd9dabc08","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:11:36.483820Z","title":"Daly, Michael Hind, David Piorkowski, Xiangliang Zhang, Nuno Moniz, and Nitesh V Chawla","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:5e6a8c850126c47c76358cd685035a08536dec2a6580ffe3a14b160575723f85","observation_id":"02c5708e-1869-4364-9c27-a627fa4201ce","resolution":{"observed_at":"2026-06-27T16:11:36.483820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02675","last_updated":"2024-05-22T17:36:47Z","snapshot_observed_at":"2026-08-03T19:47:13.010781Z","submitted_at":"2024-02-05T02:21:11Z","title":"Verifiable evaluations of machine learning models using zkSNARKs","version":2},"cited_work":{"arxiv_id":"2402.02675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.02675","snapshot_observed_at":"2026-07-03T01:57:32.613339Z","title":"Verifiable evaluations of machine learning models using zkSNARKs","venue":null,"work_id":"60542d9e-9bc4-4598-98c8-f4498f5edba8","year":2024},"citing_paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-06-27T16:11:36.483820Z"},"links":{"cited_paper":"/paper/2402.02675","citing_paper":"/paper/2606.09809"},"observation_digest":"sha256:5578a55c4304e0038dc0d18c0c68a4d76457b37eac5a8fd870076d49e52c74d5","observation_id":"83d0a000-3cbf-4c26-9c86-6e7225b07dc3","resolution":{"observed_at":"2026-07-03T01:57:32.614700Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.09809","last_updated":"2026-06-08T17:55:02Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-02T08:53:32.385821Z","submitted_at":"2026-06-08T17:55:02Z","title":"Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":2,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":66,"verified_exact":27,"verified_fuzzy":0},"total_outbound_references":155},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 100 of 155 outbound references and 0 inbound Pith citation observations for arXiv:2606.09809."}