{"as_of":"2026-08-06T12:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a0cc29b727a0b2c2a57e18fa9efe6a9492ff28f31d8bf3d9e0a67df4c31779fd","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T04:50:01.671400Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.20820/citation-record","integrity":"/paper/2606.20820/integrity","json":"/paper/2606.20820/citation-record.json","paper":"/paper/2606.20820"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Measuring massive multitask language under- standing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:6a07695e2b6992d0c0b3ed35d7e52fcd15c37fd872181e3c7b212de1fd2ec4c3","observation_id":"c4d3f61f-5ab1-4ed3-afdd-ffaed72cce90","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Truth- fulQA: Measuring how models mimic human false- hoods","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:b1ad74be6e59bed17239b1244e81c8df22a47beb63dd04ea4ac300d1619cc769","observation_id":"a23e9a64-24df-47a2-969c-1337dbcf6b10","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Evaluating large language models trained on code.arXiv, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:1301479d8ddda0ccbb1e87628192eae0ff5c9bc6229109f0a6350609b321e296","observation_id":"2325adca-7cd6-4619-b525-5635d07d4c91","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:b8fc127baaca1e76f5bd900048fbf60d516f40c8d6d3ba77adfc590d35ddf703","observation_id":"0336edaa-59c1-4e18-ab46-e9bd4bf50fdb","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:27e6457ad8295e91d44ed1ecdabe647ea6449b0b70e3bcf8cf2a144b5d1073a1","observation_id":"b8f887b0-0cf4-44eb-ab83-1d48a55302a0","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:d024f9a0da3af75918addcf312edaf214fd6f596af677ee7ee1cf5c03a67dc50","observation_id":"da6f48b2-4919-49e6-9814-9b20b403ca01","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Beyond the imitation game: Quantifying and extrap- olating the capabilities of language models.Transac- tions on Machine Learning Research, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:6700840e1e3b110e98e10a9aae82b04788fd34d25b560d2d48b306dd24b61b19","observation_id":"d54e626c-64e1-4824-ac31-57ee158edb7a","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Holis- tic evaluation of language models.Annals of the New York Academy of Sciences, 1525(1):140–146, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:009c54beb9d8369e367c362837573dee93191f879339718ded96395998b9ada3","observation_id":"0c02233d-e1fb-4f38-be3a-387070439b6b","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Cer-eval: Certifiable and cost-efficient evaluation framework for llms.arXiv, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:da5464016bd9e2c1ca5a76a73495430c1ed4fcb62629ffdc245a83dfd6c547e1","observation_id":"4bc08d46-3b8d-40e5-af80-2851590c41f6","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Angelopoulos, Stephen Bates, Clara Fannjiang, Michael I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:9fc1859b3870c4f0fa2ae5154c13a1468b257dce0356cf55758855374fc19e73","observation_id":"6135c387-3078-4c4d-a157-426c082c1fa9","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Angelopoulos, John C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:fd0c1fa8f7afe86e163a03317086bbea50be8e7cd7cec94c65566c54a2f93084","observation_id":"261a384a-88e2-43e8-956f-9400fb2baa5b","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Estimating means of bounded random variables by betting.Jour- nal of the Royal Statistical Society Series B: Statistical Methodology, 86(1):1–27, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:ec23031994229657ecdb8d661485089592fabd445cd11b4f2012d7b195e3c322","observation_id":"9483a7c0-4604-4b07-b3fe-13dd14ae59cd","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:89abebea7b8ada6210a8e2204a19b5f43bac6643ea97a40daa66eba50e5ce9a7","observation_id":"538eaf11-cd82-43e0-9eb4-7137707e3495","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Can large lan- guage models be an alternative to human evaluations? InACL, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:97fa55c6e8e5cc3a3d85a1c9423c454ea0d143671c52fafb6f9262e6194dd99e","observation_id":"3577c4de-c76b-4498-9a04-bea6d090050e","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Scaling up active testing to large language mod- els","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:adf23e4f85b6ffceb402f0bdff75a42f674fe03785b4b330fc79f59389ac3fb0","observation_id":"7b8b243b-6f0f-4b24-a333-1cabb4de26bf","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Confidence sequences for sampling without replacement","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:c3acaf2f651e676ca2d23677eac7ccaceb3624d539675e2453de313f1bce97d4","observation_id":"1667cbdc-5144-4d31-a6fa-13f448c37b55","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Concentra- tion inequalities for dependent random variables via the martingale method.Annals of Probability, 36(6): 2126–2158, 2008","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:0e4866883269f8848121ff6acdb36b13ff1943a17129682271691b06d7256081","observation_id":"f1ce2776-81c9-4806-ae6a-f97c198bbade","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Stabil- ity bounds for stationary φ-mixing and β-mixing pro- cesses.Journal of Machine Learning Research, 11(2), 2010","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:64c7ce3d53a268d8521cd82339b91cef8abfedf61de87b4476fb26ba446807ec","observation_id":"44b75fcf-9b92-4cac-9341-dd4d9281ee56","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Active testing: Sample-efficient model evaluation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:53767ba6985dbd1a2c7325b943a9d730fe1c56cc5b6b51e760528e3061e6cd9e","observation_id":"49275ad4-447e-4770-be86-a3b0fc5e2ec3","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Adaptive concentration inequalities for sequential decision problems","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:7ba95618a3f58f077e57dda603d4885af4194c6e359685718478142bc2207fe3","observation_id":"5923e56a-1b21-411d-8e1e-a9dd12767604","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Hypothesis testing with e-values.Foundations and Trends® in Statistics, 1(1-2):1–390, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:ff5e6ecd940037fc83a675e2514da05df6265a4c444ce8fbaaf95e67656fa9f7","observation_id":"2ecfe21a-055f-44aa-9a88-cbe86a27edc8","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Probability inequalities for sums of bounded random variables.Journal of the American Statistical Association, 58(301):13–30, 1963","venue":null,"work_id":null,"year":1963},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:113d9900ffdfdad2593f9d3724a29d8789d200e4796730b78c0e8155d4ab6e3f","observation_id":"64cd1083-5903-4cec-bbe5-08c8b676baae","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"On statistical bias in active learning: How and when to fix it","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:c98c36f9effa223fe0c4e6726ab84e759857783c7c43f22580300e4dd82724ae","observation_id":"50acafe5-6d71-4f03-9fdb-d2db74c75999","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Adaptive sub- modularity: Theory and applications in active learning and stochastic optimization.Journal of Artificial Intel- ligence Research, 42:427–486, 2011","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:fce760de15a5a38225e489fd31e833ce0ebe85d10a5ab214002d1e10ba445088","observation_id":"c314573a-f40c-466f-8378-73524da79659","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Manning, Andrew Ng, and Christopher Potts","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:adec7c75657fe06dee8b934aa07b920e6cfe98454820b0130994394935e34778","observation_id":"b92adf3c-642e-434e-80a5-cc14b0473ad6","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Character-level convolutional networks for text classi- fication","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:0d0b96738256c9de963452b7fed3193bae7fb0541f6ce37c75c817474f8ef22c","observation_id":"ab56bfbe-b751-4198-949e-4be6a6953889","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Instruction-following evaluation for large language models.arXiv, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:bf03f9e418fa7d14b62c44a00040f38b47adc6d40b17d6ba73300d687a579733","observation_id":"31e4f48c-0f7a-41c3-8c0f-85f2d40a09b9","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Safetybench: Eval- uating the safety of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:816f2908c56ad9d976ffea0b18a5c962897b61e701f9609fbce8055c832cb754","observation_id":"e748abb4-1302-4a4c-9c04-280bfb2f4344","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Adversarial glue: A multi-task bench- mark for robustness evaluation of language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:845e46bbdec55e4e1295bb410a121eeb87656c8ba3ca77d9d970a9c4761f53c3","observation_id":"8c62b072-f55d-41c5-8004-74fb62ac8ef4","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Promptrobust: Towards evaluating the robustness of large language models on adversarial prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:cac7806979d66c91b8d208ff051bc0e9b5f4caf51655c28012e3082aaf1ca119","observation_id":"1b53cfc2-3ea0-4b24-9ec9-dcdfa56159b7","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Active surrogate estimators: An active learning approach to label-efficient model eval- uation.NeurIPS, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:b4524ff4a21934c097e5d3186e9085ca00252087e751c1fceb1a19b6ef98ebd5","observation_id":"d0a5e7f3-9b72-4e46-b579-27ee189684bc","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Ash, Chicheng Zhang, Akshay Krishna- murthy, John Langford, and Alekh Agarwal","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:b22f06b61c5e4e64c9e6a6410a3ccb1e1757481cbfa669537912b59a63fca7d7","observation_id":"23d040f8-4dba-4713-aff1-cf5d41315b88","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Howard, Aaditya Ramdas, Jon McAuliffe, and Jasjeet Sekhon","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:beae94fe2b7f3ffdeb9d9f17ed420a24385b1f383df33321cdb1dcbc4cddc6af","observation_id":"8e728233-4fae-4575-b053-42ac40d7ff94","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Howard, Aaditya Ramdas, Jon McAuliffe, and Jasjeet Sekhon","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:4be848831510bab20d2e74fbad462dddf99de88ad6b4438a086602206ad124ab","observation_id":"39040900-c91e-43e1-970d-ed4385492cad","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Active statisti- cal inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:807389b972adfccadaf7bd59951efc88ae5973d95195dfc9c73d7ce6d9c7ea7c","observation_id":"b3aa5727-af23-46bf-83a9-90d09a957f09","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Adaptive prediction-powered autoeval with reliability and efficiency guarantees","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:e21e7660071433f9ddad80baca848658f1013e9ba998b9575a9f42ba879b311e","observation_id":"c06ea35c-69a0-4b55-99af-4c22d40575ae","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Active, anytime-valid risk controlling prediction sets","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:3ce7e28ec3cfd1d5b3485beb82c87cf60e8ac22ad8a276ad1936ab817a17749a","observation_id":"86036245-e084-409d-aaec-b29987423c77","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Revisiting active sequential prediction-powered mean estimation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:7b2af62fad3035483bb6a4e5fed201e958fe51555cd886864a4ab50816541994","observation_id":"6ecb0a2e-aeaa-4c01-82ff-e835a7b2ddea","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"Levin, Yu- val Peres, Csaba Szepesvari, and Geoffrey Wolfer","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:461222966cd0567134bbc7390e03aa98a654398a85db065f04956750f736cd66","observation_id":"d60dce39-d78f-43d9-a1fa-7429f2c76c83","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"1 N NX n=1 ˜ℓf (xn) # +E","venue":null,"work_id":null,"year":1939},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:7bc65a53c5c4979f9c2014330e4b9a508b55a4c0c6952151e735434a6c301889","observation_id":"6df062ce-e14e-490b-98c7-cac681be3860","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:50:01.671400Z","title":"This proves that(C t)1≤t≤N is(1−α)anytime-valid forR","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T04:50:01.671400Z"},"links":{"citing_paper":"/paper/2606.20820"},"observation_digest":"sha256:c8e5a2e020f8e8fc092cb3bf188a7d65cb5b2426855d871c3f25f022dc308a77","observation_id":"e2f34179-3b60-4eed-8a44-f290a15d8baa","resolution":{"observed_at":"2026-06-29T04:50:01.671400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.20820","last_updated":"2026-06-26T08:19:34Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:55:53.019607Z","submitted_at":"2026-06-18T18:07:42Z","title":"CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2606.20820."}