{"as_of":"2026-08-07T19:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:23b065e90ee8605427373c518a7f701f63bf706fb2d6ef9a622936a197b814bd","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T01:24:02.052803Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":39,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:40:03.461298Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T17:09:58.526716Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"reference_index":142,"source":"pdf_text","source_observed_at":"2026-05-23T17:33:13.394338Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2411.15594"},"observation_digest":"sha256:dfbc8c345608928210ca870c84348d2b2210e1ffb7cfe3346787b5722fda034a","observation_id":"877b95d4-104b-4d9a-b190-241e22a2d80d","resolution":{"observed_at":"2026-05-23T17:35:44.149506Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-07-31T01:42:39.468673Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"reference_index":220,"source":"pdf_text","source_observed_at":"2026-05-11T23:08:34.312466Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2412.05579"},"observation_digest":"sha256:0ba406c800a3e8d85c645edb3ee28912423435d3e3d31919c104ad1bd0c8f97e","observation_id":"a44a7667-9683-416d-a720-4c3a3a793636","resolution":{"observed_at":"2026-05-18T01:24:02.137278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2504.19678","last_updated":"2026-03-06T19:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-28T11:08:22Z","title":"From LLM Reasoning to Autonomous AI Agents: A Comprehensive Review","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-15T02:57:37.873567Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2504.19678"},"observation_digest":"sha256:4d688c8e04174692af19106c55e4a5e376062fdaaa223b134ff3971c691e0fcc","observation_id":"1127d743-065d-4dd2-a4b3-fe8c51514e52","resolution":{"observed_at":"2026-05-18T01:24:02.137278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-08-06T20:40:03.461298Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02182","last_updated":"2025-07-02T22:28:35Z","snapshot_observed_at":"2026-08-06T20:33:11.488119Z","submitted_at":"2025-07-02T22:28:35Z","title":"Enhancing COBOL Code Explanations: A Multi-Agents Approach Using Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:40:03.461298Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2507.02182"},"observation_digest":"sha256:acb154b26f31460cd21d2a299418dacbdb45eb89f35dafbd2679963bd11d1481","observation_id":"ac8d15c4-c40b-430a-a911-560fb805d8a8","resolution":{"observed_at":"2026-08-06T20:40:03.461298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-08-06T18:12:26.531419Z","title":"Judgebench: A benchmark for evaluating llm-based judges","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09104","last_updated":"2025-07-12T01:34:24Z","snapshot_observed_at":"2026-08-07T11:13:09.274212Z","submitted_at":"2025-07-12T01:34:24Z","title":"CompassJudger-2: Towards Generalist Judge Model via Verifiable Rewards","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:26.531419Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2507.09104"},"observation_digest":"sha256:99cb3714445abf863af6b5a3a58b2356f1ad3084c53b29ddd66728855402d56e","observation_id":"68938448-2a4b-4ea9-98d3-3cad8e1b3909","resolution":{"observed_at":"2026-08-06T18:12:26.531419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-08-05T22:54:25.184597Z","title":"Y.; Cuadron, A.; Wang, C.; Popa, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06225","last_updated":"2025-08-18T12:00:32Z","snapshot_observed_at":"2026-08-05T22:54:04.098120Z","submitted_at":"2025-08-08T11:11:22Z","title":"Overconfidence in LLM-as-a-Judge: Diagnosis and Confidence-Driven Solution","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:25.184597Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2508.06225"},"observation_digest":"sha256:b12fd682f852411446b3d3af910c2947fdbd3110e2916295fef818696d858a52","observation_id":"1ee9cd37-ef97-44e2-a5ff-b6d9c35525db","resolution":{"observed_at":"2026-08-05T22:54:25.184597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2512.20856","last_updated":"2025-12-24T00:24:05Z","snapshot_observed_at":"2026-08-07T14:13:20.121484Z","submitted_at":"2025-12-24T00:24:05Z","title":"NVIDIA Nemotron 3: Efficient and Open Intelligence","version":1},"reference_index":184,"source":"arxiv_source","source_observed_at":"2026-05-18T01:40:42.190369Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2512.20856"},"observation_digest":"sha256:daabe741ce0177ffdc48633988f51a80dd0bb7a750e75db9579530454875dde4","observation_id":"bbdbe3dd-7eae-40c2-b34e-81e813040f4a","resolution":{"observed_at":"2026-05-18T01:40:42.750774Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-08-02T22:17:31.148047Z","title":"InProceedings of the Thirty- Fourth International Joint Conference on Artificial Intelligence, IJCAI-25, pages 10669–10677","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.17443","last_updated":"2026-05-25T20:03:42Z","snapshot_observed_at":"2026-08-02T22:17:30.073749Z","submitted_at":"2026-02-19T15:09:12Z","title":"AIDG: A Formal Decomposition of Information Extraction and Containment Asymmetries in Multi-Turn LLM Dialogue","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T22:17:31.148047Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2602.17443"},"observation_digest":"sha256:3f2db70573dd4fea75f61136dfd0ea95fb901e4662aba8f0fe11675080c6a625","observation_id":"cd097b4a-db0f-4555-af2d-6ea21860b988","resolution":{"observed_at":"2026-08-02T22:17:31.148047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2603.09643","last_updated":"2026-04-16T11:12:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-10T13:18:02Z","title":"MM-tau-p$^2$: Persona-Adaptive Prompting for Robust Multi-Modal Agent Evaluation in Dual-Control Settings","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T13:43:52.671745Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2603.09643"},"observation_digest":"sha256:dc8cbc6fb5e89216a119036f2a76a44c5cb62fbaebea87b881570c447229765b","observation_id":"b50371a8-365e-43e5-8085-354baf51de63","resolution":{"observed_at":"2026-05-18T01:24:02.137278Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2604.03742","last_updated":"2026-04-04T14:07:37Z","snapshot_observed_at":"2026-08-04T22:20:40.535525Z","submitted_at":"2026-04-04T14:07:37Z","title":"Structured Multi-Criteria Evaluation of Large Language Models with Fuzzy Analytic Hierarchy Process and DualJudge","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T17:12:07.852282Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2604.03742"},"observation_digest":"sha256:8b4cc65631a616931624f647a7d856c581ebde5494b841013688b1b8512b88bb","observation_id":"12cebc39-8826-4396-97af-2baf8d07d4d1","resolution":{"observed_at":"2026-05-18T01:24:02.137278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2604.12312","last_updated":"2026-04-14T05:42:41Z","snapshot_observed_at":"2026-08-02T05:56:57.097541Z","submitted_at":"2026-04-14T05:42:41Z","title":"CompliBench: Benchmarking LLM Judges for Compliance Violation Detection in Dialogue Systems","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T14:56:00.449776Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2604.12312"},"observation_digest":"sha256:d12d1366acf37fd4f2ad5596539b5688c52a228e00f0b46c4a90a397ed1f40ec","observation_id":"3ad28c37-11bd-4c01-8427-06b41a8221bf","resolution":{"observed_at":"2026-05-18T01:24:02.137278Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2604.16790","last_updated":"2026-04-18T02:35:05Z","snapshot_observed_at":"2026-07-06T23:04:01.558812Z","submitted_at":"2026-04-18T02:35:05Z","title":"Bias in the Loop: Auditing LLM-as-a-Judge for Software Engineering","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T07:29:03.994957Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2604.16790"},"observation_digest":"sha256:1c3493514a6e7692c1c71771f2b138950414941a406d7e1db65c116160fe9622","observation_id":"612a4f1e-701e-41a8-85f5-43f1c6a57e61","resolution":{"observed_at":"2026-05-18T01:24:02.137278Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2604.22597","last_updated":"2026-04-24T14:25:01Z","snapshot_observed_at":"2026-07-06T23:08:56.419589Z","submitted_at":"2026-04-24T14:25:01Z","title":"Rethinking Math Reasoning Evaluation: A Robust LLM-as-a-Judge Framework Beyond Symbolic Rigidity","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-08T11:45:54.181019Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2604.22597"},"observation_digest":"sha256:8c71d0c821c7f66d41c1f9fe3eb2e7933f25d49c0532815b72f079b2f6647f94","observation_id":"e24a3111-f640-4a69-a58e-70922bd160f1","resolution":{"observed_at":"2026-05-18T01:24:02.137278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2604.23178","last_updated":"2026-06-24T13:27:28Z","snapshot_observed_at":"2026-08-05T10:28:56.284877Z","submitted_at":"2026-04-25T07:18:30Z","title":"Judging the Judges: A Systematic Evaluation of Bias Mitigation Strategies in LLM-as-a-Judge Pipelines","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T08:14:18.535385Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2604.23178"},"observation_digest":"sha256:e5f356601b4a30c8a726863e6b61d5bacdfddbfa329a9ca10cddbccf505adf05","observation_id":"92b89e58-b68e-4f01-b646-8839c3ab19e7","resolution":{"observed_at":"2026-05-18T01:24:02.137278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2604.24700","last_updated":"2026-04-27T17:04:17Z","snapshot_observed_at":"2026-08-04T04:55:30.006592Z","submitted_at":"2026-04-27T17:04:17Z","title":"Green Shielding: A User-Centric Approach Towards Trustworthy AI","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-08T03:43:54.896449Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2604.24700"},"observation_digest":"sha256:c936041bb4ca761fa9ad32a27e8a367cb9bbdc7d9ca04f02db9fea9b992cf08d","observation_id":"2c430462-4d8b-4fca-9ac5-7798a5fc2c2c","resolution":{"observed_at":"2026-05-18T01:24:02.137278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2604.26020","last_updated":"2026-04-28T18:04:11Z","snapshot_observed_at":"2026-07-06T23:11:48.524898Z","submitted_at":"2026-04-28T18:04:11Z","title":"Training Computer Use Agents to Assess the Usability of Graphical User Interfaces","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-07T16:04:14.938406Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2604.26020"},"observation_digest":"sha256:889de1999064e946314d13bbbec21edfadadd1e11156dfd20c45dccd6bfcddce","observation_id":"182870d9-e3c5-4940-8fe9-9f5de1b3dbe1","resolution":{"observed_at":"2026-05-18T01:24:02.137278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2604.26235","last_updated":"2026-04-29T02:32:14Z","snapshot_observed_at":"2026-08-02T11:16:41.718755Z","submitted_at":"2026-04-29T02:32:14Z","title":"LATTICE: Evaluating Decision Support Utility of Crypto Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-07T13:30:46.523784Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2604.26235"},"observation_digest":"sha256:450393e6198142c22714d9504024c8e314c3136bf6b1ae25d8be1e2d27d398b6","observation_id":"7ca0f88c-7962-4e8e-a25a-3b8221eac6e6","resolution":{"observed_at":"2026-05-18T01:24:02.137278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2604.27727","last_updated":"2026-04-30T11:20:22Z","snapshot_observed_at":"2026-07-06T23:13:11.623453Z","submitted_at":"2026-04-30T11:20:22Z","title":"LLM-as-a-Judge for Human-AI Co-Creation: A Reliability-Aware Evaluation Framework for Coding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-07T08:39:55.256518Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2604.27727"},"observation_digest":"sha256:3f88f482a8ec8f1732412795b9bcade07941198b4b044f9521f2df4556db23d1","observation_id":"125ea4ac-d648-4461-8879-cc69a105ebb8","resolution":{"observed_at":"2026-05-18T01:24:02.137278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2605.07461","last_updated":"2026-05-08T09:08:07Z","snapshot_observed_at":"2026-07-06T23:19:51.414344Z","submitted_at":"2026-05-08T09:08:07Z","title":"Think-with-Rubrics: From External Evaluator to Internal Reasoning Guidance","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T01:50:50.037018Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2605.07461"},"observation_digest":"sha256:41323c4d072713a14025e7893bcda1bcb730c3d5b44a54061d2f49e3da86be43","observation_id":"f24a1c1b-8d2a-4bfd-9a06-9682f53b81e8","resolution":{"observed_at":"2026-05-18T01:24:02.137278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2605.07699","last_updated":"2026-07-31T14:41:42Z","snapshot_observed_at":"2026-08-05T23:14:25.471589Z","submitted_at":"2026-05-08T13:10:49Z","title":"DRIP-R: A Benchmark for Decision-Making and Reasoning Under Real-World Policy Ambiguity in the Retail Domain","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-11T02:40:27.234973Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2605.07699"},"observation_digest":"sha256:3f43d21e0f98e860a74eeb94f23a0329dbe2f03f4b95f29a7ab35fc5b342b994","observation_id":"d612516c-8963-4972-aeea-dadb6b54358e","resolution":{"observed_at":"2026-05-18T01:24:02.137278Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2605.10805","last_updated":"2026-05-11T16:30:20Z","snapshot_observed_at":"2026-08-02T16:26:05.195808Z","submitted_at":"2026-05-11T16:30:20Z","title":"Reasoning Is Not Free: Robust Adaptive Cost-Efficient Routing for LLM-as-a-Judge","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T04:19:00.238602Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2605.10805"},"observation_digest":"sha256:27a9fde699e7476b5b501f9ad26d92308207d88f55c5db351d0670373d5fe89b","observation_id":"9588355e-9fba-4ddb-9d11-f94ee8d924c6","resolution":{"observed_at":"2026-05-18T01:24:02.137278Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2605.13695","last_updated":"2026-05-13T15:48:16Z","snapshot_observed_at":"2026-07-06T23:25:16.229144Z","submitted_at":"2026-05-13T15:48:16Z","title":"RTLC -- Research, Teach-to-Learn, Critique: A three-stage prompting paradigm inspired by the Feynman Learning Technique that lifts LLM-as-judge accuracy on JudgeBench with no fine-tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T19:37:09.912719Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2605.13695"},"observation_digest":"sha256:6e8ca7ce665aeee8383dff696ccca78749b7176230657cd636c2f65475c61f4e","observation_id":"828fc486-253a-4beb-9349-2a51aa29cb17","resolution":{"observed_at":"2026-05-18T01:24:02.137278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2605.19220","last_updated":"2026-05-19T00:47:02Z","snapshot_observed_at":"2026-07-06T23:29:57.003383Z","submitted_at":"2026-05-19T00:47:02Z","title":"Position: Uncertainty Quantification in LLMs is Just Unsupervised Clustering","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-20T06:53:44.993529Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2605.19220"},"observation_digest":"sha256:425eeb9d39d43f91e5154e56b66dc9ad91cc56778ebb215aef91ad148dc2859d","observation_id":"6939b2af-23ce-4106-b771-cbac7f8f19a2","resolution":{"observed_at":"2026-05-20T06:58:06.151710Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2606.00609","last_updated":"2026-05-30T08:18:40Z","snapshot_observed_at":"2026-08-05T16:11:23.807977Z","submitted_at":"2026-05-30T08:18:40Z","title":"CARE-RL: Capability-Aware Reinforcement Learning for Mitigating Cross-Domain Conflicts","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-28T19:01:14.340754Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2606.00609"},"observation_digest":"sha256:44d5ae56d945211e00d248b02765fc56abf77216ce8453224fbf1f7c78cca818","observation_id":"a8d17776-c9e9-4a32-821e-3c80a1799a81","resolution":{"observed_at":"2026-06-28T19:02:34.054734Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2606.01462","last_updated":"2026-05-31T21:46:52Z","snapshot_observed_at":"2026-07-06T23:42:02.762832Z","submitted_at":"2026-05-31T21:46:52Z","title":"An Enigma of Artificial Reason: Investigating the Production-Evaluation Gap in Large Reasoning Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T16:45:33.046568Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2606.01462"},"observation_digest":"sha256:1238448657c94527aa1b7aa8698959661bd98df2bf5c7eaff23d8d488c6292d8","observation_id":"453009ee-8fc6-42b3-956d-c4809fabfdfb","resolution":{"observed_at":"2026-07-01T21:36:14.949514Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2606.03650","last_updated":"2026-06-04T10:01:47Z","snapshot_observed_at":"2026-08-06T12:17:15.155456Z","submitted_at":"2026-06-02T13:41:43Z","title":"CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T10:46:24.554332Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2606.03650"},"observation_digest":"sha256:5adb57ae521120eb5dbbdae984d62ef9172740bf127634006dcf132690c9dada","observation_id":"ef892dda-8de7-4890-a369-2d2ce812d574","resolution":{"observed_at":"2026-07-02T02:36:27.442787Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2606.10254","last_updated":"2026-06-08T23:40:34Z","snapshot_observed_at":"2026-07-31T10:24:53.794624Z","submitted_at":"2026-06-08T23:40:34Z","title":"RealMath-Eval: Why SOTA Judges Struggle with Real Human Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T16:02:04.749003Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2606.10254"},"observation_digest":"sha256:a5b178a98f903581a6d517fc5e5bca567a7518eb0fcb409e3cea85d74d55e8d9","observation_id":"aa4d5695-7367-4495-9499-ae4c0f70d1b7","resolution":{"observed_at":"2026-07-03T02:17:34.934879Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2606.11635","last_updated":"2026-06-10T03:56:07Z","snapshot_observed_at":"2026-08-02T09:53:18.415557Z","submitted_at":"2026-06-10T03:56:07Z","title":"Are LLMs Bad at Moral Reasoning?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T08:20:24.251540Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2606.11635"},"observation_digest":"sha256:4e5499723fb995a76db241b27ce6612f5078a83e455edb791e8a3651b7dd416c","observation_id":"2074f077-bf95-4e0c-8087-3f56d7c4542b","resolution":{"observed_at":"2026-07-03T13:18:12.657972Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-06-27T04:45:20.445703Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2606.14516"},"observation_digest":"sha256:714313f20a52332067bb77581e5a09d2dc0be4792eab62c7e182b25797c84c87","observation_id":"39937189-1cc9-47a8-b7b5-d222bdd21fd4","resolution":{"observed_at":"2026-07-03T16:58:43.295766Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2606.17789","last_updated":"2026-06-16T11:05:43Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:05:43Z","title":"Mind Companion: An Embodied Conversational Agent for Process-Based Psychotherapy","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T23:07:48.991096Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2606.17789"},"observation_digest":"sha256:a4d048eb526c110e29859567ab7b997549e507c255231daba10018be095377dc","observation_id":"fa124f31-66f9-4cc6-ac3d-d3e7e9e6d4b2","resolution":{"observed_at":"2026-07-03T22:59:03.273876Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2606.19714","last_updated":"2026-06-18T02:26:05Z","snapshot_observed_at":"2026-08-01T18:27:22.876701Z","submitted_at":"2026-06-18T02:26:05Z","title":"AURA: Adaptive Uncertainty-aware Refinement for LLM-as-a-Judge Auditing","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-26T15:48:26.303462Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2606.19714"},"observation_digest":"sha256:928bc2140551793b56b402cc8dd95eaa7cd7f407e573ed2233e531d9e7650fe1","observation_id":"1e90c1f6-5d62-4bc6-a341-dd3dc89dab2f","resolution":{"observed_at":"2026-07-04T05:39:40.102134Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2606.21627","last_updated":"2026-06-19T17:30:56Z","snapshot_observed_at":"2026-08-07T08:25:40.894867Z","submitted_at":"2026-06-19T17:30:56Z","title":"Counsel: A Meta-Evaluation Dataset for Agentic Tasks","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-26T14:07:59.446478Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2606.21627"},"observation_digest":"sha256:182bf70698fbdbe9171946d8bb7439193ba6bc5308dd8965d8f77b625fd062b8","observation_id":"04a7c527-38c5-4e58-a62d-1ad662986a76","resolution":{"observed_at":"2026-07-04T06:49:38.225537Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2606.24004","last_updated":"2026-06-29T07:01:12Z","snapshot_observed_at":"2026-08-02T11:15:29.427964Z","submitted_at":"2026-06-22T23:21:55Z","title":"Towards Spec Learning: Inference-Time Alignment from Preference Pairs","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-06-26T07:49:36.816100Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2606.24004"},"observation_digest":"sha256:247aa2114928fbff578244b899c7be0a8c551a021655a69da2f0fe2ff20c1240","observation_id":"fcbb5378-2ff7-433e-9377-a60236cc6345","resolution":{"observed_at":"2026-07-04T11:39:47.085675Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2606.24004","last_updated":"2026-06-29T07:01:12Z","snapshot_observed_at":"2026-08-02T11:15:29.427964Z","submitted_at":"2026-06-22T23:21:55Z","title":"Towards Spec Learning: Inference-Time Alignment from Preference Pairs","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-06-30T10:17:33.176525Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2606.24004"},"observation_digest":"sha256:45dce39a893a3d78559a5d914b2be3d29e958a9836ec8219a8fb1ebadcbe334a","observation_id":"26100d5d-96b7-417b-8445-cdc38e93f0b2","resolution":{"observed_at":"2026-06-30T12:44:39.537486Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2606.24595","last_updated":"2026-06-23T13:52:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-23T13:52:46Z","title":"MEMPROBE: Probing Long-Term Agent Memory via Hidden User-State Recovery","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-25T23:57:26.000650Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2606.24595"},"observation_digest":"sha256:2df0e1cf0f67f98703dbd4101478b36cda541288e585dd6bd43495c331c025b3","observation_id":"a43f1ec4-f362-47d9-a625-26365f72cbd2","resolution":{"observed_at":"2026-07-04T17:09:58.528009Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":"2410.12784","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-04T17:09:58.526716Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","venue":"cs.AI","work_id":"7255b223-8380-468c-9951-e1617432eb73","year":2024},"citing_paper":{"arxiv_id":"2606.30887","last_updated":"2026-06-29T20:22:25Z","snapshot_observed_at":"2026-08-07T17:47:37.021501Z","submitted_at":"2026-06-29T20:22:25Z","title":"Training Therapeutic Judges and Multi-Agent Systems for Human-Aligned Mental Health Support","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-07-01T01:57:54.065453Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2606.30887"},"observation_digest":"sha256:2d8197c9f4c31037a7db47e3d24186fab1c43439b196f9ce28cc28089b91ffe8","observation_id":"3ccb3788-f29f-45a7-9e4d-5b475ef4c534","resolution":{"observed_at":"2026-07-01T12:35:43.863245Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-08-02T07:46:14.714824Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20527","last_updated":"2026-07-10T02:05:17Z","snapshot_observed_at":"2026-08-05T14:04:45.512105Z","submitted_at":"2026-07-10T02:05:17Z","title":"Evaluating and Guarding Citation Faithfulness in Agentic Scientific Synthesis","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T07:46:14.714824Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2607.20527"},"observation_digest":"sha256:e2c0a2f328dc927e9daa246c4639ee05455d5d61526001a79002ede43b15d0ef","observation_id":"6ac25137-7d17-4883-aef9-1070d6762439","resolution":{"observed_at":"2026-08-02T07:46:14.714824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-07-30T15:14:05.914715Z","title":"Tang, Alejandro Cuadron, Chenguang Wang, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26977","last_updated":"2026-07-29T14:35:29Z","snapshot_observed_at":"2026-08-06T03:59:45.914522Z","submitted_at":"2026-07-29T14:35:29Z","title":"TREK: A Travel Reasoning and Evaluation Kit for LLM Agents in Complex Trip Planning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-30T15:14:05.914715Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2607.26977"},"observation_digest":"sha256:b7d3852e815ce8421c77c926dd465ec0c7a7ef3add09fc1f268d264cade5639e","observation_id":"676058d8-0a36-4e19-bad9-c42b2862976d","resolution":{"observed_at":"2026-07-30T15:14:05.914715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-08-03T00:55:26.143931Z","title":"arXiv preprint arXiv:2410.12784 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28636","last_updated":"2026-05-19T13:56:13Z","snapshot_observed_at":"2026-08-06T00:38:04.006327Z","submitted_at":"2026-05-19T13:56:13Z","title":"Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-03T00:55:26.143931Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2607.28636"},"observation_digest":"sha256:b66ce3a180adc359ca517fabbc31f746ac6b3a07cf33a6395074b368a6290cb1","observation_id":"1abe627d-4e0d-4c7c-854b-c78201c607fd","resolution":{"observed_at":"2026-08-03T00:55:26.143931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.12784/citation-record","integrity":"/paper/2410.12784/integrity","json":"/paper/2410.12784/citation-record.json","paper":"/paper/2410.12784"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"10/10”, “Neither A nor B","venue":null,"work_id":"7818f15c-d770-48ed-8813-b2bde625e164","year":2024},"citing_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T01:24:02.052803Z"},"links":{"citing_paper":"/paper/2410.12784"},"observation_digest":"sha256:68385ea7c42c2b1e52a304323cb31eeeeb32baf130e5a467055056c8bc8cd4ce","observation_id":"22e41b80-1d6d-44ee-834b-0e09ebfc8657","resolution":{"observed_at":"2026-05-18T01:24:02.075449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"knowledge","venue":null,"work_id":"10de5832-731d-4deb-a0d8-9b2e860c6982","year":2024},"citing_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T01:24:02.052803Z"},"links":{"citing_paper":"/paper/2410.12784"},"observation_digest":"sha256:52238a79189821a07339759b9fddac96c8468b181a7f27aa0fae7bfb8a721c62","observation_id":"c203191a-bd16-4eb5-b2a9-8dee1cb61036","resolution":{"observed_at":"2026-05-18T01:24:02.082283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Each side’s lateral pterygoid has a different function during this movement","venue":null,"work_id":"8aa277f7-ca08-4d90-a5fd-1b0e05a4a84e","year":2025},"citing_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T01:24:02.052803Z"},"links":{"citing_paper":"/paper/2410.12784"},"observation_digest":"sha256:2b4448d8450d9ae64c9a1fc69d9f91ebc4f66e5c49b2b93e0015ed150f30cf14","observation_id":"6a66ec54-bfd4-4d96-bc51-1dbb4b058d16","resolution":{"observed_at":"2026-05-18T01:24:02.087724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c8457d4d-c92e-4d94-af1c-a6158c93e0fe","year":null},"citing_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T01:24:02.052803Z"},"links":{"citing_paper":"/paper/2410.12784"},"observation_digest":"sha256:e6fe206448cc902ebde8e6db11fd807020ff75602528143dc357c730a02c5caf","observation_id":"dadbf0f8-afce-4ed4-b5d6-126c97d5ffb5","resolution":{"observed_at":"2026-05-18T01:24:02.091561Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Output (a)","venue":null,"work_id":"e34e42d0-0a4f-408a-89a8-9b8e968cf758","year":2025},"citing_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T01:24:02.052803Z"},"links":{"citing_paper":"/paper/2410.12784"},"observation_digest":"sha256:6a8bca86a279648f5ae2cda06c456d15d9b232ada3e498417147cc0d6df51f9a","observation_id":"4406d922-8fec-4c77-8c71-8752311c2bda","resolution":{"observed_at":"2026-05-18T01:24:02.095145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"12b604ed-fff4-49d1-ad5d-1fdfc415151f","year":null},"citing_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T01:24:02.052803Z"},"links":{"citing_paper":"/paper/2410.12784"},"observation_digest":"sha256:3942b30721446c61e2a4d2e4f6c4ca6684c54d639cba85862562fd1bbe6a6079","observation_id":"49b9ea51-6e31-40e1-94c3-0c07e9563525","resolution":{"observed_at":"2026-05-18T01:24:02.100089Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"81d5ffe9-b00a-4d48-8cea-499fff23a4e2","year":null},"citing_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T01:24:02.052803Z"},"links":{"citing_paper":"/paper/2410.12784"},"observation_digest":"sha256:3c83bba8c06dc367371d484dbee85577547943725ded3ef5185144c32d63c62e","observation_id":"6fe14601-6ef7-4601-bff3-83033f4981c2","resolution":{"observed_at":"2026-05-18T01:24:02.104086Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e2bc19eb-7754-4218-8614-ab7fa2de475f","year":null},"citing_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T01:24:02.052803Z"},"links":{"citing_paper":"/paper/2410.12784"},"observation_digest":"sha256:4b796e211d9c361436ffc8a1f833f362d3e843bf64cb30bb5fd59b778b7b0465","observation_id":"c72140b1-2a06-4ac1-953b-f1c43386206c","resolution":{"observed_at":"2026-05-18T01:24:02.108077Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e668cd9d-c3f4-4941-b0f4-38814f02dbde","year":null},"citing_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T01:24:02.052803Z"},"links":{"citing_paper":"/paper/2410.12784"},"observation_digest":"sha256:6e4a12e81d12185525f0102df3400c6e733362b0f8b19c2334ba9cc29f3db35e","observation_id":"8d1b2595-9978-48ac-b65e-3b00f315782b","resolution":{"observed_at":"2026-05-18T01:24:02.112140Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"My final verdict is tie: [[A=B]]","venue":null,"work_id":"1b9c0360-6a1a-46ce-8ece-428f4c7d313e","year":2025},"citing_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T01:24:02.052803Z"},"links":{"citing_paper":"/paper/2410.12784"},"observation_digest":"sha256:3905469294bc93874ed5c090fc02d61e353d9cfacfabacb8306d4385671d5f31","observation_id":"80a5f0f9-fdb1-45e0-840e-81cb9ebae46c","resolution":{"observed_at":"2026-05-18T01:24:02.115722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fc8117fd-c25d-4853-a6f1-be8908317d04","year":null},"citing_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T01:24:02.052803Z"},"links":{"citing_paper":"/paper/2410.12784"},"observation_digest":"sha256:c1844791f6dfdd562ce72778fedc5707fa223f91bc3ca80b2f715be292a192a6","observation_id":"19303786-670b-4a39-9c58-f6e3fbef159d","resolution":{"observed_at":"2026-05-18T01:24:02.119676Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"You should refer to the score rubric","venue":null,"work_id":"73982322-1c09-4e59-8345-e82fbb1d13ee","year":null},"citing_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T01:24:02.052803Z"},"links":{"citing_paper":"/paper/2410.12784"},"observation_digest":"sha256:84223e965ebdf629d4027ed6946841cd0dd9d0c80d3c02018926440e7beb15c5","observation_id":"b9b1432f-66fc-4bc3-a9fe-90c56b394e53","resolution":{"observed_at":"2026-05-18T01:24:02.124472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"(write a feedback for criteria) [RESULT] (A or B)","venue":null,"work_id":"a7fdac8c-cad5-4087-b8ac-166facba4cfe","year":2025},"citing_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T01:24:02.052803Z"},"links":{"citing_paper":"/paper/2410.12784"},"observation_digest":"sha256:93c9a84c969388e03395cdd43d74b5deac4d0da88d74485f75d12018e91f8fe4","observation_id":"e43529e3-e0bb-4cd2-9852-7707b7a9caef","resolution":{"observed_at":"2026-05-18T01:24:02.128528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"09df5464-3e8d-450a-83ec-e215ffdc2f7e","year":null},"citing_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T01:24:02.052803Z"},"links":{"citing_paper":"/paper/2410.12784"},"observation_digest":"sha256:dac1cd44f8405e2fa1f96421fb364c0212cec875e97964e009763dd2772b615d","observation_id":"a16053e1-5fbe-4422-b118-183795266389","resolution":{"observed_at":"2026-05-18T01:24:02.132058Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"So, the final decision is Response 1 / Response 2 / Tie","venue":null,"work_id":"f973a5be-5ee5-42d8-9cd7-1d3ec3744138","year":2025},"citing_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T01:24:02.052803Z"},"links":{"citing_paper":"/paper/2410.12784"},"observation_digest":"sha256:e171585c966a30a94e79903db4f877d0ee1799561ede7f0024dddb1ae8087274","observation_id":"af812f28-b742-4c25-96a3-9916772928c7","resolution":{"observed_at":"2026-05-18T01:24:02.136211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 39 inbound Pith citation observations for arXiv:2410.12784."}