{"as_of":"2026-08-09T11:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f1588968e346c97456916903adf4d529d61da7d84c89026705a83556434dce30","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:55:34.331074Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.06893/citation-record","integrity":"/paper/2507.06893/integrity","json":"/paper/2507.06893/citation-record.json","paper":"/paper/2507.06893"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:55:34.595398Z","title":"Pairwise analysis of model performance","venue":null,"work_id":"7df375d3-af88-4201-baed-077792b55c77","year":2025},"citing_paper":{"arxiv_id":"2507.06893","last_updated":"2025-07-09T14:30:45Z","snapshot_observed_at":"2026-08-09T09:20:34.174830Z","submitted_at":"2025-07-09T14:30:45Z","title":"Developing and Maintaining an Open-Source Repository of AI Evaluations: Challenges and Insights","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T18:55:34.247692Z"},"links":{"citing_paper":"/paper/2507.06893"},"observation_digest":"sha256:0caefce9af1163f0bb4594fddd1f071f98fe6436ab4bcf6db708c4412e172160","observation_id":"78cbdc7a-d2f5-4e63-b11c-d016b53f4b04","resolution":{"observed_at":"2026-08-06T18:55:34.600472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:55:34.571044Z","title":"Calculating optimal resampling for model evaluation","venue":null,"work_id":"b3ff4c62-0f86-4c52-a8ae-48a0052a3723","year":2025},"citing_paper":{"arxiv_id":"2507.06893","last_updated":"2025-07-09T14:30:45Z","snapshot_observed_at":"2026-08-09T09:20:34.174830Z","submitted_at":"2025-07-09T14:30:45Z","title":"Developing and Maintaining an Open-Source Repository of AI Evaluations: Challenges and Insights","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T18:55:34.259478Z"},"links":{"citing_paper":"/paper/2507.06893"},"observation_digest":"sha256:dda870dbd150dc13e75c2a69297fcbfd309da4331a6ef0fb606cd021cdbb176d","observation_id":"77bc16fb-21d6-4a91-8814-da81f917fa3e","resolution":{"observed_at":"2026-08-06T18:55:34.579888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:55:34.547919Z","title":"The AI evaluation substack, 2024","venue":null,"work_id":"599ab0e3-dd57-4a43-8b2c-ca878e2ba897","year":2024},"citing_paper":{"arxiv_id":"2507.06893","last_updated":"2025-07-09T14:30:45Z","snapshot_observed_at":"2026-08-09T09:20:34.174830Z","submitted_at":"2025-07-09T14:30:45Z","title":"Developing and Maintaining an Open-Source Repository of AI Evaluations: Challenges and Insights","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T18:55:34.264917Z"},"links":{"citing_paper":"/paper/2507.06893"},"observation_digest":"sha256:77dfe6979db1abd2d729b10a141c6e3c4f1e0c9af976f9f1dd499ad103e7ebd8","observation_id":"5d2cc3ba-3566-4d4c-a820-19a7c16aafe4","resolution":{"observed_at":"2026-08-06T18:55:34.553817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09024","last_updated":"2025-04-18T14:30:31Z","snapshot_observed_at":"2026-08-02T12:38:54.249632Z","submitted_at":"2024-10-11T17:39:22Z","title":"AgentHarm: A Benchmark for Measuring Harmfulness of LLM Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09024","snapshot_observed_at":"2026-08-06T18:55:34.271238Z","title":"AgentHarm : A benchmark for measuring harmfulness of LLM agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06893","last_updated":"2025-07-09T14:30:45Z","snapshot_observed_at":"2026-08-09T09:20:34.174830Z","submitted_at":"2025-07-09T14:30:45Z","title":"Developing and Maintaining an Open-Source Repository of AI Evaluations: Challenges and Insights","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T18:55:34.271238Z"},"links":{"cited_paper":"/paper/2410.09024","citing_paper":"/paper/2507.06893"},"observation_digest":"sha256:129795fe1425ab7ea8c72138e4136f7b26c4dfb5c3ff76112151869fa1d22b01","observation_id":"e71c644c-e5ec-43b0-88c7-04992f764326","resolution":{"observed_at":"2026-08-06T18:55:34.271238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:55:34.530742Z","title":"Autonomous systems evaluation standard","venue":null,"work_id":"a499f320-719f-4d1f-9ff7-369e3df3be4e","year":2024},"citing_paper":{"arxiv_id":"2507.06893","last_updated":"2025-07-09T14:30:45Z","snapshot_observed_at":"2026-08-09T09:20:34.174830Z","submitted_at":"2025-07-09T14:30:45Z","title":"Developing and Maintaining an Open-Source Repository of AI Evaluations: Challenges and Insights","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T18:55:34.280724Z"},"links":{"citing_paper":"/paper/2507.06893"},"observation_digest":"sha256:4b083fdb93a426257c11371fd6f8a99b45d0e2e176e13ed8788398dd507417eb","observation_id":"12197ec2-6a20-49da-8bea-0eed1617a721","resolution":{"observed_at":"2026-08-06T18:55:34.536321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12983","last_updated":"2023-11-21T20:34:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-21T20:34:47Z","title":"GAIA: a benchmark for General AI Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12983","snapshot_observed_at":"2026-08-06T18:55:34.286229Z","title":"GAIA : a benchmark for general ai assistants","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06893","last_updated":"2025-07-09T14:30:45Z","snapshot_observed_at":"2026-08-09T09:20:34.174830Z","submitted_at":"2025-07-09T14:30:45Z","title":"Developing and Maintaining an Open-Source Repository of AI Evaluations: Challenges and Insights","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T18:55:34.286229Z"},"links":{"cited_paper":"/paper/2311.12983","citing_paper":"/paper/2507.06893"},"observation_digest":"sha256:01886f0e4de9997310f51f2a060abe4dd2e95cda2c7f39739c0d0f197fc4bf9f","observation_id":"368d4930-bed7-4405-a097-373a5921c3c2","resolution":{"observed_at":"2026-08-06T18:55:34.286229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00640","last_updated":"2024-11-01T14:57:16Z","snapshot_observed_at":"2026-08-07T10:39:44.274910Z","submitted_at":"2024-11-01T14:57:16Z","title":"Adding Error Bars to Evals: A Statistical Approach to Language Model Evaluations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00640","snapshot_observed_at":"2026-08-06T18:55:34.292785Z","title":"Adding error bars to evals: A statistical approach to language model evaluations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06893","last_updated":"2025-07-09T14:30:45Z","snapshot_observed_at":"2026-08-09T09:20:34.174830Z","submitted_at":"2025-07-09T14:30:45Z","title":"Developing and Maintaining an Open-Source Repository of AI Evaluations: Challenges and Insights","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T18:55:34.292785Z"},"links":{"cited_paper":"/paper/2411.00640","citing_paper":"/paper/2507.06893"},"observation_digest":"sha256:2d5c339e09b35209697aee0a575412cbe0cbf90e51a437d51333e094e4125b45","observation_id":"b3cfc9c6-33ac-45ac-924a-853631b4403a","resolution":{"observed_at":"2026-08-06T18:55:34.292785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-04T22:55:15.345443Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-06T18:55:34.300173Z","title":"L., Stickland, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06893","last_updated":"2025-07-09T14:30:45Z","snapshot_observed_at":"2026-08-09T09:20:34.174830Z","submitted_at":"2025-07-09T14:30:45Z","title":"Developing and Maintaining an Open-Source Repository of AI Evaluations: Challenges and Insights","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T18:55:34.300173Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2507.06893"},"observation_digest":"sha256:69a80664a5af9ad4d57de81e46ffb7f657d08d127150bbc4baa6c15d8e9c9743","observation_id":"1feabfbd-b7ff-4243-b054-eb37a744cf80","resolution":{"observed_at":"2026-08-06T18:55:34.300173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:55:34.514517Z","title":"inspect\\_ai: A framework for large language model evaluations, 2024","venue":null,"work_id":"e8d80c95-9aa5-4c1b-bf46-41971f29371c","year":2024},"citing_paper":{"arxiv_id":"2507.06893","last_updated":"2025-07-09T14:30:45Z","snapshot_observed_at":"2026-08-09T09:20:34.174830Z","submitted_at":"2025-07-09T14:30:45Z","title":"Developing and Maintaining an Open-Source Repository of AI Evaluations: Challenges and Insights","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T18:55:34.308264Z"},"links":{"citing_paper":"/paper/2507.06893"},"observation_digest":"sha256:4909953fdcca100fdd1582b855ef5d7068c9a1d86aeb59c0164791d5dd8e74dd","observation_id":"aeb4f00d-108e-4a45-bbae-dee22bea3d1c","resolution":{"observed_at":"2026-08-06T18:55:34.519830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:55:34.498305Z","title":"Research agenda","venue":null,"work_id":"3373d059-a8e5-4098-ac63-bf2843bff526","year":2025},"citing_paper":{"arxiv_id":"2507.06893","last_updated":"2025-07-09T14:30:45Z","snapshot_observed_at":"2026-08-09T09:20:34.174830Z","submitted_at":"2025-07-09T14:30:45Z","title":"Developing and Maintaining an Open-Source Repository of AI Evaluations: Challenges and Insights","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T18:55:34.313755Z"},"links":{"citing_paper":"/paper/2507.06893"},"observation_digest":"sha256:c8afa5ee1f7d6665a3baf35b012d7f888345ca11568d7863f3b60c23aa483f21","observation_id":"02c2801e-22b1-4a59-bb3b-0df2e8d85e00","resolution":{"observed_at":"2026-08-06T18:55:34.503280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:55:34.480118Z","title":"inspect\\_evals: Collection of evals for Inspect AI , 2024","venue":null,"work_id":"d55e60f4-e6a9-4068-8bb9-16cb53971336","year":2024},"citing_paper":{"arxiv_id":"2507.06893","last_updated":"2025-07-09T14:30:45Z","snapshot_observed_at":"2026-08-09T09:20:34.174830Z","submitted_at":"2025-07-09T14:30:45Z","title":"Developing and Maintaining an Open-Source Repository of AI Evaluations: Challenges and Insights","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T18:55:34.320409Z"},"links":{"citing_paper":"/paper/2507.06893"},"observation_digest":"sha256:90ba518632d56e03286a830b206eede6025e2b883bf48b7a49e900e4afd7ec71","observation_id":"82e3a5a0-0d7a-4421-a559-d4231eeb1fe1","resolution":{"observed_at":"2026-08-06T18:55:34.487244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08926","last_updated":"2025-04-12T21:26:07Z","snapshot_observed_at":"2026-08-06T12:22:30.341073Z","submitted_at":"2024-08-15T17:23:10Z","title":"Cybench: A Framework for Evaluating Cybersecurity Capabilities and Risks of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08926","snapshot_observed_at":"2026-08-06T18:55:34.325643Z","title":"K., Perry, N., Dulepet, R., Ji, J., Menders, C., Lin, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06893","last_updated":"2025-07-09T14:30:45Z","snapshot_observed_at":"2026-08-09T09:20:34.174830Z","submitted_at":"2025-07-09T14:30:45Z","title":"Developing and Maintaining an Open-Source Repository of AI Evaluations: Challenges and Insights","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T18:55:34.325643Z"},"links":{"cited_paper":"/paper/2408.08926","citing_paper":"/paper/2507.06893"},"observation_digest":"sha256:4c3a1b1d916ffc92267a504d5e0c1f7e332df1b05ec048cc03f34069f18d2837","observation_id":"fc9251f0-e653-4768-ba17-b7bf3c19b967","resolution":{"observed_at":"2026-08-06T18:55:34.325643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06378","last_updated":"2025-03-16T02:28:10Z","snapshot_observed_at":"2026-08-07T17:19:39.767281Z","submitted_at":"2025-03-09T01:13:56Z","title":"General Scales Unlock AI Evaluation with Explanatory and Predictive Power","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06378","snapshot_observed_at":"2026-08-06T18:55:34.331074Z","title":"M., Moros‑Daval, Y., Zhang, S., Zhao, Q., Huang, Y., Sun, L., Prunty, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06893","last_updated":"2025-07-09T14:30:45Z","snapshot_observed_at":"2026-08-09T09:20:34.174830Z","submitted_at":"2025-07-09T14:30:45Z","title":"Developing and Maintaining an Open-Source Repository of AI Evaluations: Challenges and Insights","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T18:55:34.331074Z"},"links":{"cited_paper":"/paper/2503.06378","citing_paper":"/paper/2507.06893"},"observation_digest":"sha256:f0773848dcb32d851ecaf02ecaabb6a7dfa5f2e45dcc89d1bb879869b1b5ed26","observation_id":"f14fcdfe-824c-47f4-a1c7-a7fd4d137ddd","resolution":{"observed_at":"2026-08-06T18:55:34.331074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.06893","last_updated":"2025-07-09T14:30:45Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T09:20:34.174830Z","submitted_at":"2025-07-09T14:30:45Z","title":"Developing and Maintaining an Open-Source Repository of AI Evaluations: Challenges and Insights"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2507.06893."}