{"as_of":"2026-08-05T17:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6b880a15cda703a8da0fa4e40374df5c6fe4c1517d2737434ecd51841cc26428","coverage":[{"denominator":121,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T04:45:20.445703Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T11:50:20.579924Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"cited_work":{"arxiv_id":"2606.14516","doi":"10.48550/arxiv.2606.14516","metadata_source":"pith","pith_arxiv_id":"2606.14516","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","venue":"cs.AI","work_id":"24b62377-760d-4dcb-8e31-3ee3c7866481","year":2026},"citing_paper":{"arxiv_id":"2607.20491","last_updated":"2026-07-24T14:53:06Z","snapshot_observed_at":"2026-08-04T19:10:51.320569Z","submitted_at":"2026-06-10T03:31:09Z","title":"DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-02T11:50:20.579924Z"},"links":{"cited_paper":"/paper/2606.14516","citing_paper":"/paper/2607.20491"},"observation_digest":"sha256:dd90d602c0062c931dc62a250d16e44ecc66c6db0f461110c3682e4735dc5ce3","observation_id":"42904533-c7aa-4ee7-9909-53bf29b36b24","resolution":{"observed_at":"2026-08-02T11:54:15.471726Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.14516/citation-record","integrity":"/paper/2606.14516/integrity","json":"/paper/2606.14516/citation-record.json","paper":"/paper/2606.14516"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:648bf1f4eeecdf601824d8121d0d633b83f337b130014fca115bef24f776b5bc","observation_id":"4dc34b4c-e531-441f-b5f5-32ea14cb07d6","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:4d20a0368db5501802e277258be786bbf4ee60561c6ad1de30fb46c4d304f3fe","observation_id":"5e4292e1-92c4-48eb-9b80-1bd28b784c42","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:46f4214a4d09aaf5562c77e9842867730f9d7a5c424faf85052d0392cd880d71","observation_id":"be5bc7b9-fd89-411c-8f96-2675f638a1e8","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16763","last_updated":"2026-06-29T17:01:58Z","snapshot_observed_at":"2026-08-02T22:31:47.931184Z","submitted_at":"2026-02-18T16:51:37Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","version":3},"cited_work":{"arxiv_id":"2602.16763","doi":"10.48550/arxiv.2602.16763","metadata_source":"pith","pith_arxiv_id":"2602.16763","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation","venue":"cs.AI","work_id":"fb4bcdcb-e72f-4428-8d2a-fd34a4437e50","year":2026},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"cited_paper":"/paper/2602.16763","citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:d7f8bce4a84302b4819b26e558e8fba24e34c8e12cf38c2e70b53b614840c262","observation_id":"c69b331e-a486-4646-9b76-1644549805b2","resolution":{"observed_at":"2026-07-03T16:58:43.251838Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:02.919694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:02.919694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:f2042cda87f9b1f607c7fc9997f3431a0eb7bbc4b2899f7cadcc0d873949d7b4","observation_id":"bb58b622-2eaa-436e-8b3f-a0e446581490","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16867","last_updated":"2023-11-29T19:45:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-28T15:12:47Z","title":"The Falcon Series of Open Language Models","version":2},"cited_work":{"arxiv_id":"2311.16867","doi":"10.48550/arxiv.2311.16867","metadata_source":"pith","pith_arxiv_id":"2311.16867","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Falcon Series of Open Language Models","venue":"cs.CL","work_id":"9ef058cb-28ba-4128-b9b7-a707f2fd36b3","year":2023},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"cited_paper":"/paper/2311.16867","citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:022aa68e2eefe7f58b44e2a8ebc8400f89dbf2591d53fe3fdf43e5859fa6e09d","observation_id":"23683cba-8f47-4c5d-8806-6b2812559c7b","resolution":{"observed_at":"2026-07-03T16:58:43.254104Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:b17a415a4883e2e2ed792b72d66bc36e03181c281ced76b1a58ad29d3ff45bb6","observation_id":"91228e6c-d9e0-4b42-9160-f5e3e72fa057","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:1e05222e55e9c768a94ef8784ee9d787295c5ae9b47b415d1c3edd23efe2eecb","observation_id":"456acf78-bbb5-49d3-a722-39c5d449cb73","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.22953","last_updated":"2026-05-11T10:27:38Z","snapshot_observed_at":"2026-08-03T12:05:35.781830Z","submitted_at":"2026-02-26T12:48:02Z","title":"General Agent Evaluation","version":2},"cited_work":{"arxiv_id":"2602.22953","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.22953","snapshot_observed_at":"2026-07-04T03:29:30.288823Z","title":"General agent evaluation","venue":"cs.AI","work_id":"3a40369d-f7d8-4112-9617-f5161de436e6","year":2026},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"cited_paper":"/paper/2602.22953","citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:09676212089f6e2e1e369c49a65c53b783bc32172dac643cbc7d14be3c782647","observation_id":"404bde04-652b-4414-9d4f-252c02ed6ef5","resolution":{"observed_at":"2026-07-03T16:58:43.241505Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:0371362b0ebdd73c7048fc988fa46eeae98be2bac0607912e2ac332f0135ce46","observation_id":"68972a49-0e3e-4e73-8d6d-e8cd3bc50940","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:0bd4af634b3ccae6b16e04a1d1a1b8266250a88778d2c8a61ff35a64bf24b1b3","observation_id":"de1cafbf-3433-490d-80a4-80a1de9c3075","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:78c8bdda13cd447203da4cd9a522bea705478e7cf818a2173f8b5726a6042cd2","observation_id":"afab99db-c000-4f52-ae6b-ee290fe07c7b","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:80a8e16026952cb1a06d089ae3c0b9465c90131883a210685e376357b69d5281","observation_id":"66ba3354-f41a-4fc1-8d7d-88f9087dde6d","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:7db8c838f71b55d5d09ecba80509e3f19c2895421ea51782dc4458cec0b81e48","observation_id":"2edbccb4-5639-45df-8544-95b782cf35b3","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14782","last_updated":"2026-05-31T00:04:33Z","snapshot_observed_at":"2026-08-02T05:44:43.939336Z","submitted_at":"2024-05-23T16:50:49Z","title":"Lessons from the Trenches on Reproducible Evaluation of Language Models","version":3},"cited_work":{"arxiv_id":"2405.14782","doi":"10.48550/arxiv.2405.14782","metadata_source":"pith","pith_arxiv_id":"2405.14782","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Lessons from the Trenches on Reproducible Evaluation of Language Models","venue":"cs.CL","work_id":"47b597a2-a355-4305-b1e4-80666b394ccd","year":2024},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"cited_paper":"/paper/2405.14782","citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:d41f890b605cd0662dd9a535b5de37709dcc0f962dc35d0a91ee6dcf62cedfd6","observation_id":"04f886df-a5e7-4000-9fc6-a8168a6e0b4c","resolution":{"observed_at":"2026-07-03T16:58:43.254512Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:45.557591+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:45.557591+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13977","last_updated":"2021-10-26T02:55:15Z","snapshot_observed_at":"2026-08-04T17:13:59.492185Z","submitted_at":"2021-05-28T16:59:01Z","title":"Perturbation Theory for the Information Bottleneck","version":2},"cited_work":{"arxiv_id":"2105.13977","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.13977","snapshot_observed_at":"2026-07-03T16:58:43.255636Z","title":null,"venue":null,"work_id":"74e3f713-919e-44fe-afc8-46d65ff9b4c2","year":2021},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"cited_paper":"/paper/2105.13977","citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:2c3df42ed36b6a33a7a13cac1f39f862a36c1748428472f648482d766c5a03ef","observation_id":"67126da5-4c73-41f2-bc5b-8d6095510ef4","resolution":{"observed_at":"2026-07-03T16:58:43.257277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:d80af5324c648c09034d9169aad2c7494564b1c93342b05ab9dc9910912a7968","observation_id":"2a34d6d1-2df6-4868-aea2-25e52149a02e","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.04062","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T16:58:43.258612Z","title":"Bordes, C","venue":null,"work_id":"f8c7b140-db16-4481-9f07-38382bb909ba","year":2025},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:3d7e0dfeba3a6a3d3d1e0c4001c53645b1d16c94d4609f05d078f2886cc8dfe6","observation_id":"5bec9b24-754a-442a-a13e-82785e01e231","resolution":{"observed_at":"2026-07-03T16:58:43.260269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.04561","last_updated":"2019-05-08T14:39:41Z","snapshot_observed_at":"2026-07-06T07:38:31.021675Z","submitted_at":"2019-03-11T19:45:54Z","title":"Nuanced Metrics for Measuring Unintended Bias with Real Data for Text Classification","version":2},"cited_work":{"arxiv_id":"1903.04561","doi":"10.48550/arxiv.1903.04561","metadata_source":"pith","pith_arxiv_id":"1903.04561","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nuanced Metrics for Measuring Unintended Bias with Real Data for Text Classification","venue":"cs.LG","work_id":"20e5770c-19ef-4291-a06c-bc68e23a0bfd","year":2019},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"cited_paper":"/paper/1903.04561","citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:4f5f9e3fa8f4b3d60a4d16b81c5633d2911651f4e86ea131b8479616b156f58d","observation_id":"f6a6e363-9f6c-4245-b50a-7eb09f506635","resolution":{"observed_at":"2026-07-03T16:58:43.266423Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:24:59.616828+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:24:59.616828+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":"Bowman and George E","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:94ec75a0e055263d17e57afbb8196bc0f371acd8ab7c2352337e20765ae5f04f","observation_id":"8b7ba4eb-e5fa-4297-8269-8f2e9c8c8536","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":"Ullman, Fernando Martinez-Plumed, Joshua B","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:a9ec8cd9de74f6fb7c1a4fd68d386981b98c3fe6a826b3352a28b7a506f9a675","observation_id":"9d1d86de-147b-4755-a316-c8cc3ac701af","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:d2a04e7e960b5edfc8057e9fa457ed969e8e68e5f6e7c771103eea625142f1ff","observation_id":"fb45c350-3dd3-46af-ac31-e7d18efc4e75","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:752a48c57f503477be3b7486730b144157136bf93727ae29e0214024432f031f","observation_id":"eb7834fa-e83c-44a7-a046-159d58b9aed6","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:36ecfdd6da2ad66d88e21d440f4705ae9d70a9ce0ac92101d04292db7b74cac8","observation_id":"07a5bf42-541b-4b7c-bfbf-520fb0c94086","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:d6255d4b05fc0234660b8f53850045eb708afcdaf032b741cdb9a4892de852f6","observation_id":"8f1ddf3a-dc43-48b6-a0a9-919295f025e3","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:9d3b00650d19cfbf0bab8b8105e0d2fbb50e46b46008122fc05e23b2c293d6e5","observation_id":"03932d67-e077-4390-95f7-62920cc3b3c2","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:5f575bcf8d433fcdee30b4eded0c2a927a83b81c22510c21b252704b73a88449","observation_id":"dba813e5-548b-4686-9db7-cc72358feba5","resolution":{"observed_at":"2026-07-03T16:58:43.275100Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:47274c3c24d8e848737b8de0f4f2973d8ff56558c2f952ca35bff61ab65bab0f","observation_id":"9d01a33d-e779-47dc-bba3-d232752890ee","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:c7695181fe5337f2d167cfa0a7166ac5b336538f55df14784f6db6813ceda01a","observation_id":"557f3318-5bf4-4cb2-9e3e-6fe2edf8c777","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:2c82bac7b9f2e836d5326d98cb01ecc65df4469a2bf07bbadc684f5af754861e","observation_id":"9f511f30-453e-444a-95fd-855ebb94ea2c","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:5e72f8e347b56f2f117c0244a082feff9e0cefab76f3e82f50c22c036aba250e","observation_id":"1e989bce-dcbd-406f-8cc2-5eb31f3f9f42","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:1012e67a0b006d28a8d8058c30074daec0899c339bbfaa96a87790cd89d75d70","observation_id":"e801ce0c-b602-426f-bb2e-17c72fdc0e60","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:cc92df4aaff73014381e56f89bb33fa57323e6f3d1bb980093ab96452b8182e1","observation_id":"07d5de42-c043-4506-affd-274036d06dee","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:c9f66d1c907f38a0f797c34edebb1e1b92be605a3372b69c1d463603cb353143","observation_id":"b89bb9d1-a542-42f2-b502-08c4e035bdd4","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:b89fa702a53cc09bb6a2443839e12bda201938cf9ea7df479a3b7ab9a1a754e0","observation_id":"9b98af51-679d-4ae9-8809-26e887897364","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:88547dd9c724164bb40fddffea9081ed86125f4d1176ac70d504173d6b52407a","observation_id":"5af8a4b5-37f9-4927-bf45-346f0dfb873e","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:bc65f7eb8ba13f559dd7b387615ac61edaa77fcd886e464b3b5e6769a4be7d42","observation_id":"b1874b74-dea4-44bf-a8c4-c8f458f53323","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12843","last_updated":"2026-04-15T05:42:39Z","snapshot_observed_at":"2026-08-04T21:55:39.843525Z","submitted_at":"2026-04-14T15:01:29Z","title":"Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration","version":2},"cited_work":{"arxiv_id":"2604.12843","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.12843","snapshot_observed_at":"2026-07-03T16:58:43.279807Z","title":"Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration","venue":"cs.CL","work_id":"62b27eb8-4865-4cd3-9b53-fcb83ca1df98","year":2026},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"cited_paper":"/paper/2604.12843","citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:c94e05ce373bdbb508717a1708df02fd2468f991fc1f0b52c9cc9ec6d71c095f","observation_id":"9c1d734e-88ce-4bb5-a346-8329f24e8f85","resolution":{"observed_at":"2026-07-03T16:58:43.280944Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.11201","last_updated":"2026-04-14T08:14:40Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T09:00:10Z","title":"CocoaBench: Evaluating Unified Digital Agents in the Wild","version":2},"cited_work":{"arxiv_id":"2604.11201","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.11201","snapshot_observed_at":"2026-07-04T10:59:46.486350Z","title":"CocoaBench: Evaluating Unified Digital Agents in the Wild","venue":"cs.CL","work_id":"128d7c46-5d6b-479a-bc1e-e81b4be1ca14","year":2026},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"cited_paper":"/paper/2604.11201","citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:77dd326b8b7ef87525f246a759fa9d25b976513b198fd05e4d13702c19486c0b","observation_id":"9712541f-f6cc-4e01-aced-f6f2f906dc3a","resolution":{"observed_at":"2026-07-03T16:58:43.239237Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:719845c9358fc3cb8386832dcb979f83c8223e04d8e1108aecea6878e46ee791","observation_id":"696f6576-ff5d-42eb-8662-8bddec687f3f","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:7cbc1c8db438c5b5d79f0200068c877fda74ea7bed25f866081f2f6797ef4016","observation_id":"109a8f8e-9db9-472f-9869-873266ebdaec","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.09577","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T16:58:43.245602Z","title":null,"venue":null,"work_id":"c1163a85-8ac7-4830-baca-04730f9a4aff","year":2025},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:6138eef7082f7e6455ffc80ba15d84f4f18f7caa96b6b58e9297f8140179dcfd","observation_id":"c984d1b6-2136-476f-a187-7463f6eac4b0","resolution":{"observed_at":"2026-07-03T16:58:43.246812Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03244","last_updated":"2026-05-22T10:20:50Z","snapshot_observed_at":"2026-08-02T11:59:04.792354Z","submitted_at":"2026-02-27T04:31:30Z","title":"AI Evaluation Should Require Standardized Item-Level Data Releases","version":2},"cited_work":{"arxiv_id":"2604.03244","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.03244","snapshot_observed_at":"2026-07-03T16:58:43.299737Z","title":"AI Evaluation Should Require Standardized Item-Level Data Releases","venue":"cs.AI","work_id":"eef930ff-40c7-42cb-aa37-c10cc0da5120","year":2026},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"cited_paper":"/paper/2604.03244","citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:2c3966a6039506934a43d1d91badba94e9ea37df905103047e348f08656caba8","observation_id":"129dcf6a-37f5-4e1a-bd75-f4e80653310b","resolution":{"observed_at":"2026-07-03T16:58:43.300859Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":"2310.06770","doi":"10.1145/512927.512945","metadata_source":"pith","pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","venue":"cs.CL","work_id":"d0effe15-a689-441a-8e3f-ea35f1c4e4b1","year":2023},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:38c0a75f079d7562130ec0a3c85c5a475b7ea3646bcf20919dd341c0bb779c84","observation_id":"8fca231c-272c-4790-85dd-06aec8848cf0","resolution":{"observed_at":"2026-07-03T16:58:43.236714Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.11977","doi":"10.48550/arxiv.2510.11977","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic agent leaderboard: The missing infrastructure for ai agent evaluation","venue":"ArXiv.org","work_id":"dec804c2-eb85-4ee1-bae1-dfb23b87886d","year":2025},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:85d251e70ec73dc959c21f5188cbccb7beaab974aae7192fce1a446c202af649","observation_id":"375c730b-3f1f-4c7d-a868-4e6dabdd8822","resolution":{"observed_at":"2026-07-03T16:58:43.274809Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T18:52:16.448662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T18:52:16.448662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":"Siegel, Nitya Nadgir, and Arvind Narayanan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:c087c01c51d1e8ad87d32496ec91e8f4118f03e4fe31a6a3df68413fe44b6175","observation_id":"a80d84c4-042d-46a1-8766-a1dd1a2e48b1","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01502","last_updated":"2024-07-01T17:48:14Z","snapshot_observed_at":"2026-08-04T08:38:08.960589Z","submitted_at":"2024-07-01T17:48:14Z","title":"AI Agents That Matter","version":1},"cited_work":{"arxiv_id":"2407.01502","doi":"10.48550/arxiv.2407.01502","metadata_source":"pith","pith_arxiv_id":"2407.01502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Siegel, Nitya Nadgir, and Arvind Narayanan","venue":"cs.LG","work_id":"07877e57-5393-47ee-ae5f-563ff8f9a6b2","year":2024},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"cited_paper":"/paper/2407.01502","citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:709ae2935e9cbde743daf279c11202c9ec1883a75f3a431d40db21d7fdb6798a","observation_id":"ead5913c-dee0-4299-8c31-6d35d405f7f9","resolution":{"observed_at":"2026-07-03T16:58:43.298615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:07.572928+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:07.572928+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12844","last_updated":"2025-02-20T16:20:11Z","snapshot_observed_at":"2026-08-05T16:38:33.638599Z","submitted_at":"2024-07-04T17:57:38Z","title":"metabench -- A Sparse Benchmark of Reasoning and Knowledge in Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.12844","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.12844","snapshot_observed_at":"2026-07-03T21:28:58.087704Z","title":"Kipnis, K","venue":null,"work_id":"67b50126-83b5-46ed-b866-e0e82750a7b9","year":2025},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"cited_paper":"/paper/2407.12844","citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:ddb73808c62a0f3afd56c29e881b1c84c2e1a22cd4af1a77a3bed442ebd8e03d","observation_id":"39807472-4816-4985-b804-9c3523e29efa","resolution":{"observed_at":"2026-07-03T16:58:43.293342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:9c25ca0a69dbcd416ce42fcbab4c445f53d31cb5c5c66270278ee6034917b083","observation_id":"9dffe5f9-6bc6-4d86-aaa0-0e815d44818d","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:bf0c5ee241d9c92d1451640ff9329c31f35bd52d5fc3778433a04ddb2ffc4c42","observation_id":"395b7c58-0961-4aeb-9b4c-3edf47bb7ec3","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":"give me bf16 or give me death","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:065cf026fe4d3b4c02f160b5dd0da3cc3ae79d135d462ba5df1ff1a03a24b675","observation_id":"28705f89-c206-4b05-9bb9-454f6850aed1","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.15798","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T16:58:43.294881Z","title":"Younis, Simone Baratta, Matteo Avalle, Imene Kerboua, Xing Han Lù, Elron Bandel, Michal Shmueli-Scheuer, Asaf Yehudai, Leshem Choshen, Jonathan Lebensold, Sean Hughes, and 7 others","venue":null,"work_id":"20f045bb-8b7c-45da-84fd-9321d52c9463","year":2026},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:b644726a26fb5a1c3bc365e90b1e9f24ccad2c15b85cbbbadff8e8f520023928","observation_id":"6268e8f7-cd1e-4dab-a995-3d1747e1f781","resolution":{"observed_at":"2026-07-03T16:58:43.296592Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:bc93de70e4aaf6f34c3b63c6b683d8c592197161fc7fbb9f4324d05d3ab39b4b","observation_id":"4dd2bfec-bf6b-486b-b31c-8e1b485f8895","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:69b1d30436edb20a37784eb9fd52351552debf576040422abc019a30657a47c0","observation_id":"5006780b-dfb4-494e-8419-b1e70e513daf","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04689","last_updated":"2026-07-13T22:56:21Z","snapshot_observed_at":"2026-08-04T23:30:14.739124Z","submitted_at":"2025-10-26T03:54:12Z","title":"Adaptive Testing for LLM Evaluation: A Psychometric Alternative to Static Benchmarks","version":3},"cited_work":{"arxiv_id":"2511.04689","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.04689","snapshot_observed_at":"2026-07-15T01:20:49.385427Z","title":"Frederic M","venue":null,"work_id":"84eb4ef4-b147-4b98-a271-127b0a97d297","year":2025},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"cited_paper":"/paper/2511.04689","citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:0e17f34e74bf9c2575ba27f3cfbd9b9e427ef4412f9f0cfbdf562fb8eb6dc64d","observation_id":"6fab7a55-6adf-4008-ac81-0d78e803ff44","resolution":{"observed_at":"2026-07-15T01:20:49.385427Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:3cf7d7de18f2e1237216673bdd30935b8041052c37fd4b7a4215b8c47e08e48c","observation_id":"e840718b-c966-40fc-bd0a-69d27a5b959f","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":"Manning, Christopher Ré, Diana Acosta-Navas, Drew Hudson, and 31 others","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:9de03e9141344556447fa57bd5ceaf9747e31436fe58ffbfc241cf90b280ec57","observation_id":"79096cb0-a3a6-41a2-84d5-b05a506c0ed3","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:cc0adb9eb4585aba7b5e2ad1567b283b675036d52551f7a4d61c2a062306cc83","observation_id":"c4de87a0-abfc-4722-9707-0d64dffc2f0a","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:59404613c0f63289898e252fb3ff1d0819e7cc3850f9e2768c29edd97fd24de8","observation_id":"0ede4dd2-1c8b-439d-b83b-32e867bf691c","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:38d1e6932a563eef90a0b6b6e4f529405a4d9c3d808a4d2c4d886d0e07d05b4b","observation_id":"ac5ca81a-f3d6-4b63-a2fb-7eefc5563902","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16406","last_updated":"2025-02-20T06:07:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-26T02:15:49Z","title":"SpinQuant: LLM quantization with learned rotations","version":4},"cited_work":{"arxiv_id":"2405.16406","doi":"10.48550/arxiv.2405.16406","metadata_source":"pith","pith_arxiv_id":"2405.16406","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpinQuant: LLM quantization with learned rotations","venue":"cs.LG","work_id":"489855f8-bd1c-4c87-a334-f6ab27d6707d","year":2024},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"cited_paper":"/paper/2405.16406","citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:556cb34a17a84f073f4130f77a993c22a4271dbee51b6bb1532e26e91840425e","observation_id":"fc76c664-d7de-4b69-b7df-5fccfcf857f4","resolution":{"observed_at":"2026-07-03T16:58:43.288258Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:2b690f8ef6d2ab6f99ad4dd5d540e1fc00756bde367be22a51f8e3bdd0f8054f","observation_id":"89ad1d78-aff8-4a5f-b4c7-41dab9cf3992","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":"Maas, Raymond E","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:4bc4fcd6584ab6b5529721720be0fc841126c2500a8772aff410ec34bd49690b","observation_id":"7c4b338e-a087-4ec5-a7ea-c483391ebad0","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:b07b95108c0bb705653443d73a8c25d2756d2ca423e359c4c60dfbefe40ac68c","observation_id":"5e6bb44d-e00b-4419-a59e-738dee2d5fde","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:ea79b748e06e3e5673a75aab8dafe95d8af6561f2103a9759640b5fbfc677dfd","observation_id":"38e8a2a1-4092-4b60-9c8c-0c6500ac2938","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":"In2021 IEEE 37th International Conference on Data Engineering (ICDE), pages 61–72","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:80800b7795cd5b7def6985ea00b351ea821c9f8e4b051f6265ad573c0ec13775","observation_id":"e8787f79-a925-4de3-a65d-c3a83d364c58","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:af35f45cfbe763b5a45210f68110da93b04d57d699eb030e99077b6e439c7f0e","observation_id":"4c0f84ab-f4b2-48f8-8225-d8df1baafd1d","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":"1609.07843","doi":"10.1007/978-3-030-62077-6","metadata_source":"pith","pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pointer Sentinel Mixture Models","venue":"cs.CL","work_id":"fef3833e-dc80-42a3-a1e0-ffbfafee6fff","year":2016},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:55bd5f78335641e70501037fa9c06f696578f8b41ec38cbc4207b11cb6ad4ce9","observation_id":"c9b14b31-3db9-43f3-ae78-ca05cc6f3a15","resolution":{"observed_at":"2026-07-03T16:58:43.301697Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11868","last_updated":"2026-01-17T01:29:30Z","snapshot_observed_at":"2026-07-06T22:41:58.373427Z","submitted_at":"2026-01-17T01:29:30Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","version":1},"cited_work":{"arxiv_id":"2601.11868","doi":"10.48550/arxiv.2302.01973","metadata_source":"pith","pith_arxiv_id":"2601.11868","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","venue":"cs.SE","work_id":"0624be05-1d97-4fd6-8300-b04b8a3ab04b","year":2026},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"cited_paper":"/paper/2601.11868","citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:bfb7d72169eb8df852b69edeacedc9527bc4959a6c52c49cb6061631cbd39128","observation_id":"801ed966-9ce3-42d2-bed4-83e9023ca161","resolution":{"observed_at":"2026-07-03T16:58:43.304552Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:f8e41a12f66956d8b47c6c674d7fac4ccffa5c8c602d1d84465b42ac2ed5b6eb","observation_id":"8efe3a0c-4ca3-434e-b518-bdf9ae70fe85","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.26539","last_updated":"2026-05-20T14:46:16Z","snapshot_observed_at":"2026-08-05T08:23:41.762360Z","submitted_at":"2026-03-27T15:50:02Z","title":"How Open Must Language Models be to Enable Reliable Scientific Inference?","version":2},"cited_work":{"arxiv_id":"2603.26539","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.26539","snapshot_observed_at":"2026-07-03T16:58:43.287320Z","title":"How Open Must Language Models be to Enable Reliable Scientific Inference?","venue":"cs.CL","work_id":"a74e3ca0-d09b-41af-b224-4fb43155b8a1","year":2026},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"cited_paper":"/paper/2603.26539","citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:2523d0d6b3913cd97bc6b61c5fa1223638416112beb9aa198d598686a782c537","observation_id":"1581714e-66d7-4735-910b-b18229d75c3d","resolution":{"observed_at":"2026-07-03T16:58:43.288445Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:d2751f2085db43c47427ff67a5d1ba6359aaa204dd9b03d5d619867bc2f4e66d","observation_id":"c5f47d8c-a701-431a-943a-494bda202c21","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:45da39e357bc761f589214de077c832ea6c7aa57e9d65b72ea3f8275b0a75170","observation_id":"844b6725-3908-4e7e-b294-bf41b8205869","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:81fb3b6bd94d9e6f932985ebd34fa9e95a7cc894baecdfa7582c4a2a9e9fa091","observation_id":"6ddfb5f2-8ab2-4d19-8540-56d7d574ca33","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:f18d86a0a5a1f7c24dfd75d1cbe52e3815eefb437eae803bad79505d1913943d","observation_id":"ca8d007b-d574-4fda-90ff-ea2eb0ee4b82","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:fdf480cfaa9a1b97583210f9b44a5edd5b3153ac0a1e4b824de1f878c548cc41","observation_id":"f6fc8bbd-f46a-4bd4-ab24-9281dab5c755","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:a56d18e98fc3e70d74c02c3592d784fb1bda278a6fe15b7dcef92b0fb6dd51db","observation_id":"ca05e2c1-bc15-48d0-aa2e-120bbac624e2","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:45dce03a6f76d1ce0f8122f341b485802ac8a77c99271f2954b8c8a8a75cd78c","observation_id":"9429f9af-44b8-49f1-be1c-11399b8270f7","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14992","last_updated":"2024-05-26T22:27:23Z","snapshot_observed_at":"2026-08-05T12:01:06.707349Z","submitted_at":"2024-02-22T22:05:23Z","title":"tinyBenchmarks: evaluating LLMs with fewer examples","version":2},"cited_work":{"arxiv_id":"2402.14992","doi":"10.48550/arxiv.2402.14992","metadata_source":"pith","pith_arxiv_id":"2402.14992","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"David Rein, Betty Li Hou, Asa Cooper Stickland, Jack- son Petty, Richard Yuanzhe Pang, Julien Dirani, Ju- lian Michael, and Samuel R Bowman","venue":"cs.CL","work_id":"1aaa40b4-1321-4f79-85a8-e296eaa2b732","year":2024},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"cited_paper":"/paper/2402.14992","citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:fd2a0c33e36716ff190408aace5f66e2e7d3b01a2023b5db1e87d89af16c0bae","observation_id":"67372468-6ce8-4916-909a-35b35b35fc27","resolution":{"observed_at":"2026-07-03T16:58:43.293701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":"Bender, Alex Hanna, and Amandalynne Paullada","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:e1f12bfc9508ae9ea131b01df4c59f9bf2c3cd615889e70ff0feeaeaf5d0667c","observation_id":"4ddd84e3-2382-42dc-a134-8cc66331cc14","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":"Scott Gardner, Itay Hubara, and 28 others","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:043c52a87060d6b6ab70dce3afebced2ea35026302cf4ee19b90d1e2aa1c49d5","observation_id":"a8e6a50f-05ad-42f7-b05f-13e80e56fb00","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:75fb69c70c382de02604c337eaef815bea7fb5c170e908d335c843d6bef1ee88","observation_id":"285ec01e-a06b-410d-a7f7-135006768ba9","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12990","last_updated":"2024-11-20T02:38:24Z","snapshot_observed_at":"2026-07-06T19:52:55.369337Z","submitted_at":"2024-11-20T02:38:24Z","title":"BetterBench: Assessing AI Benchmarks, Uncovering Issues, and Establishing Best Practices","version":1},"cited_work":{"arxiv_id":"2411.12990","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.12990","snapshot_observed_at":"2026-07-03T22:08:59.991173Z","title":"Reuel, A","venue":null,"work_id":"93399468-612f-4330-9e9b-7d8d7bdfa8ad","year":2024},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"cited_paper":"/paper/2411.12990","citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:dbf753199f97ee2f63968724c3c7bf01d4a6aa08cc1174f48cfbfe44eb985482","observation_id":"c217d386-c460-48b5-a067-14824cba9e45","resolution":{"observed_at":"2026-07-03T16:58:43.283546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:722fcce9bdf1d61840b71546ecc864b88aedaf62f951b65f39172fd5c2c8ce57","observation_id":"2c61056e-52de-4e7a-b4d6-9528a19cf157","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:3c66803d8ed9a057c9952f694b22985e40654d7f23e1b1463192b5b55908a232","observation_id":"a68a0c2b-c153-4f1f-82ff-1c0f4d77f57c","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:d35f1f30ec88d263e9ab52050c80185bc68ffa18b08f0a20e73ede99f2270c40","observation_id":"5e8ebd62-142b-41e2-bff3-530dff651881","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:810f305f112cf500bafc70ee2870a8312a90cfa81c12eed0a4e031f0aec47b87","observation_id":"65e74d2d-4cf0-41f0-9c09-7fd235104062","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:23a2f1a01c40aff94565cd2efa1923a4d55762103128701bcbcc53da07629f12","observation_id":"9e842ce4-25c9-41ef-9030-e5fd3550ca3f","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:eea217e8ff48581bcc7baf469677471bce9dcf6c0eb8bc2bc33bc9400965ff30","observation_id":"802d087b-ec68-4743-828d-b0bd9b86b9cf","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12974","last_updated":"2025-06-02T19:50:17Z","snapshot_observed_at":"2026-08-01T04:10:06.079960Z","submitted_at":"2024-10-16T19:09:02Z","title":"BenchmarkCards: Standardized Documentation for Large Language Model Benchmarks","version":3},"cited_work":{"arxiv_id":"2410.12974","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.12974","snapshot_observed_at":"2026-07-03T16:58:43.284618Z","title":"Benchmarkcards: Standardized documentation for large language model benchmarks","venue":null,"work_id":"d9ef515b-06aa-4d2d-bd10-f6a53a1a5bd0","year":2025},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"cited_paper":"/paper/2410.12974","citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:5b32e6c6d0d38bddb20614f2f3f86f320aa811896fb9749eda58a6c8e0c3b1d4","observation_id":"4f93a1b8-8c32-4117-9759-3db08ac9e939","resolution":{"observed_at":"2026-07-03T16:58:43.286197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":"2206.04615","doi":"10.1162/tacl_a_00688","metadata_source":"pith","pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","venue":"cs.CL","work_id":"bb63abb3-0d50-4362-b97c-b5e725b03b39","year":2022},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:8f8597e712915059de36b0d34888bdd2d9ff03f981990416d50f06d39dada28a","observation_id":"3fb28c3f-bfa7-4a31-855a-1c87cd822bba","resolution":{"observed_at":"2026-07-03T16:58:43.299360Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13839","last_updated":"2025-08-14T19:25:43Z","snapshot_observed_at":"2026-07-30T21:09:49.974590Z","submitted_at":"2025-04-18T17:59:59Z","title":"Audit Cards: Contextualizing AI Evaluations","version":2},"cited_work":{"arxiv_id":"2504.13839","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13839","snapshot_observed_at":"2026-07-03T16:58:43.305706Z","title":"Audit cards: Contextualizing ai evaluations","venue":null,"work_id":"d6dbe9b9-e747-4be5-97c0-aa203f12219e","year":2025},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"cited_paper":"/paper/2504.13839","citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:25075d3643999e59562e1ae52696bff002063ef777d98ed097547521c2258f8e","observation_id":"4c3190d7-2b23-417d-8122-db9c85d31e38","resolution":{"observed_at":"2026-07-03T16:58:43.307097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:3c294807a99a152f2f484c33272bad823ea25f1dba52da82a7e983c40931527a","observation_id":"918695fc-166d-4de1-8add-d66b3845830b","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:20e0c386395e02a746974af635e6e7aecb9e5802b06d9dbe2ec97ed0c46972ba","observation_id":"39937189-1cc9-47a8-b7b5-d222bdd21fd4","resolution":{"observed_at":"2026-07-03T16:58:43.295766Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:95704945f2ec57a885aa9f074c6a7a99e8f917e7aac9bcc6d47a61eedc371275","observation_id":"9dbf8a29-6835-4ea3-a39c-06016fb50ab1","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:9ceb2f67c32d6162eefb81961cc28df17f5bd288524902d0209dbcfbb88debd1","observation_id":"99dee6cb-b860-43a0-9b67-64575af49e1a","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:650db97ee4ab46b5f44b6e01eca51d7a6280a55ba5027d3beba52a5905d184d2","observation_id":"86d8ccae-d4bd-47d9-900d-dc44385ef9fc","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":"Bow- man","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:3309016c106698c1f762d8405b907479b7fcb63f669f10a47f5fcaf2a7c39aea","observation_id":"b91c1e48-4f96-4cb9-bd13-6d17f0603f2a","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:69314efeafb5c53e1cecaf55a62b775666b5e8ba8a2b81f7994997b43d0b3c38","observation_id":"8b0e120a-9b98-4e6f-8c0b-ca903adaf09b","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:45:20.445703Z","title":"Rabe, Wenda Li, Jimmy Ba, Roger B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:798dbce73ea60bb787beee27d28f68babae39ba05a664f492a221930a584f637","observation_id":"34432b55-0d77-4679-b8dd-85c08c54f625","resolution":{"observed_at":"2026-06-27T04:45:20.445703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":72,"verified_exact":21,"verified_fuzzy":0},"total_outbound_references":121},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 100 of 121 outbound references and 1 inbound Pith citation observation for arXiv:2606.14516."}