{"as_of":"2026-08-17T23:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a1cc6cafae9fab46eefdd5f3cfcd70cda95d05e529dcbb8a7d0cfc668fb51437","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:53:25.065089Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:20:29.355664Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T06:49:38.227079Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.17087","last_updated":"2025-04-23T20:32:12Z","snapshot_observed_at":"2026-08-17T16:35:13.617293Z","submitted_at":"2025-04-23T20:32:12Z","title":"Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments","version":1},"cited_work":{"arxiv_id":"2504.17087","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.17087","snapshot_observed_at":"2026-07-04T06:49:38.227079Z","title":"Leveraging llms as meta-judges: A multi-agent framework for evaluating llm judgments","venue":null,"work_id":"458ca7dd-c117-4723-b7ed-720b02e8e49c","year":2025},"citing_paper":{"arxiv_id":"2604.02359","last_updated":"2026-03-20T04:31:03Z","snapshot_observed_at":"2026-08-13T20:39:38.275039Z","submitted_at":"2026-03-20T04:31:03Z","title":"Using LLM-as-a-Judge/Jury to Advance Scalable, Clinically-Validated Safety Evaluations of Model Responses to Users Demonstrating Psychosis","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T09:06:33.531027Z"},"links":{"cited_paper":"/paper/2504.17087","citing_paper":"/paper/2604.02359"},"observation_digest":"sha256:907ca4a672ac86f6a1c362b9af9e2d553835ab713fcf0a474f8928ac9b31e448","observation_id":"b82cfc1d-e4e6-4d7d-b402-abcc60a7d50d","resolution":{"observed_at":"2026-05-15T09:09:53.327951Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17087","last_updated":"2025-04-23T20:32:12Z","snapshot_observed_at":"2026-08-17T16:35:13.617293Z","submitted_at":"2025-04-23T20:32:12Z","title":"Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments","version":1},"cited_work":{"arxiv_id":"2504.17087","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.17087","snapshot_observed_at":"2026-07-04T06:49:38.227079Z","title":"Leveraging llms as meta-judges: A multi-agent framework for evaluating llm judgments","venue":null,"work_id":"458ca7dd-c117-4723-b7ed-720b02e8e49c","year":2025},"citing_paper":{"arxiv_id":"2605.09702","last_updated":"2026-05-10T18:49:58Z","snapshot_observed_at":"2026-08-13T23:18:21.995322Z","submitted_at":"2026-05-10T18:49:58Z","title":"Calibrate, Don't Curate: Label-Efficient Estimation from Noisy LLM Judges","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T03:27:21.060953Z"},"links":{"cited_paper":"/paper/2504.17087","citing_paper":"/paper/2605.09702"},"observation_digest":"sha256:4eb8599302216ab8faa280c2988a027b71fec3749faa7964f7566cea898d0e27","observation_id":"06775abf-bd4c-4d41-9862-16567315a85c","resolution":{"observed_at":"2026-05-12T07:21:25.789277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17087","last_updated":"2025-04-23T20:32:12Z","snapshot_observed_at":"2026-08-17T16:35:13.617293Z","submitted_at":"2025-04-23T20:32:12Z","title":"Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments","version":1},"cited_work":{"arxiv_id":"2504.17087","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.17087","snapshot_observed_at":"2026-07-04T06:49:38.227079Z","title":"Leveraging llms as meta-judges: A multi-agent framework for evaluating llm judgments","venue":null,"work_id":"458ca7dd-c117-4723-b7ed-720b02e8e49c","year":2025},"citing_paper":{"arxiv_id":"2606.03650","last_updated":"2026-06-04T10:01:47Z","snapshot_observed_at":"2026-08-11T09:05:16.100158Z","submitted_at":"2026-06-02T13:41:43Z","title":"CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T10:46:24.554332Z"},"links":{"cited_paper":"/paper/2504.17087","citing_paper":"/paper/2606.03650"},"observation_digest":"sha256:09f70afa909a571c3495a68fdc7cea072b2f5c3ab0cf0b762e024545addf2180","observation_id":"5ad57e2c-14b7-4923-bd6c-9e68778c3c2f","resolution":{"observed_at":"2026-07-02T02:36:27.440905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17087","last_updated":"2025-04-23T20:32:12Z","snapshot_observed_at":"2026-08-17T16:35:13.617293Z","submitted_at":"2025-04-23T20:32:12Z","title":"Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments","version":1},"cited_work":{"arxiv_id":"2504.17087","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.17087","snapshot_observed_at":"2026-07-04T06:49:38.227079Z","title":"Leveraging llms as meta-judges: A multi-agent framework for evaluating llm judgments","venue":null,"work_id":"458ca7dd-c117-4723-b7ed-720b02e8e49c","year":2025},"citing_paper":{"arxiv_id":"2606.21627","last_updated":"2026-06-19T17:30:56Z","snapshot_observed_at":"2026-08-12T12:40:34.526392Z","submitted_at":"2026-06-19T17:30:56Z","title":"Counsel: A Meta-Evaluation Dataset for Agentic Tasks","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-26T14:07:59.446478Z"},"links":{"cited_paper":"/paper/2504.17087","citing_paper":"/paper/2606.21627"},"observation_digest":"sha256:968a9b7a9a011d29daeac632ed67f636efb44b634ca4b62d9819f07b0d97b06e","observation_id":"09773501-43c3-4a0a-a3b3-399f1e2445f3","resolution":{"observed_at":"2026-07-04T06:49:38.229229Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17087","last_updated":"2025-04-23T20:32:12Z","snapshot_observed_at":"2026-08-17T16:35:13.617293Z","submitted_at":"2025-04-23T20:32:12Z","title":"Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17087","snapshot_observed_at":"2026-07-14T12:26:27.446079Z","title":"Leveraging llms as meta-judges: A multi-agent framework for evaluating llm judgments.arXiv preprint arXiv:2504.17087, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10350","last_updated":"2026-07-17T17:27:03Z","snapshot_observed_at":"2026-08-17T00:48:18.886735Z","submitted_at":"2026-07-11T15:24:43Z","title":"ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-14T12:26:27.446079Z"},"links":{"cited_paper":"/paper/2504.17087","citing_paper":"/paper/2607.10350"},"observation_digest":"sha256:8059f303fa212dd24af6a36eb1b8febc18e93924c52d50a3ad06e663ff338d6d","observation_id":"e28d5d64-fb4d-436f-a613-e16f9573ee0c","resolution":{"observed_at":"2026-07-14T12:26:27.446079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17087","last_updated":"2025-04-23T20:32:12Z","snapshot_observed_at":"2026-08-17T16:35:13.617293Z","submitted_at":"2025-04-23T20:32:12Z","title":"Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17087","snapshot_observed_at":"2026-08-02T07:21:28.286096Z","title":"Leveraging llms as meta-judges: A multi-agent framework for evaluating llm judgments.arXiv preprint arXiv:2504.17087, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10350","last_updated":"2026-07-17T17:27:03Z","snapshot_observed_at":"2026-08-17T00:48:18.886735Z","submitted_at":"2026-07-11T15:24:43Z","title":"ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T07:21:28.286096Z"},"links":{"cited_paper":"/paper/2504.17087","citing_paper":"/paper/2607.10350"},"observation_digest":"sha256:b9323b24a0b4d2a65e87970b5766f79a6a617508a8b074f9d897db83c26c5616","observation_id":"2c691ba5-62e3-4848-bc41-35bc1552a65d","resolution":{"observed_at":"2026-08-02T07:21:28.286096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17087","last_updated":"2025-04-23T20:32:12Z","snapshot_observed_at":"2026-08-17T16:35:13.617293Z","submitted_at":"2025-04-23T20:32:12Z","title":"Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17087","snapshot_observed_at":"2026-08-01T00:32:29.254980Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26212","last_updated":"2026-07-28T19:26:50Z","snapshot_observed_at":"2026-08-13T01:38:18.719858Z","submitted_at":"2026-07-28T19:26:50Z","title":"Multi-Agent Debate Strategies: Survey, Taxonomy, and Challenges","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-01T00:32:29.254980Z"},"links":{"cited_paper":"/paper/2504.17087","citing_paper":"/paper/2607.26212"},"observation_digest":"sha256:8c9c31a841581957884235d49feca992d2a723989233af437c125770ab9127c7","observation_id":"829ec610-9d70-49c4-ad2b-ffa70b67f5d5","resolution":{"observed_at":"2026-08-01T00:32:29.254980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17087","last_updated":"2025-04-23T20:32:12Z","snapshot_observed_at":"2026-08-17T16:35:13.617293Z","submitted_at":"2025-04-23T20:32:12Z","title":"Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17087","snapshot_observed_at":"2026-08-15T15:20:29.355664Z","title":"arXiv preprint arXiv:2504.17087 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00785","last_updated":"2026-08-01T17:34:37Z","snapshot_observed_at":"2026-08-17T12:10:45.548324Z","submitted_at":"2026-08-01T17:34:37Z","title":"HIERA: Hierarchical Multi-Agent Relevance Assessment for Content Discovery Systems","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T15:20:29.355664Z"},"links":{"cited_paper":"/paper/2504.17087","citing_paper":"/paper/2608.00785"},"observation_digest":"sha256:51a5498cd2d679c2521ccf53e4d038a6c325b78e1ea26132d47566512ef8824c","observation_id":"79bcbf52-710e-4541-b49b-13b4aeca0da7","resolution":{"observed_at":"2026-08-15T15:20:29.355664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.17087/citation-record","integrity":"/paper/2504.17087/integrity","json":"/paper/2504.17087/citation-record.json","paper":"/paper/2504.17087"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.07201","last_updated":"2023-08-14T15:13:04Z","snapshot_observed_at":"2026-08-02T01:34:38.978920Z","submitted_at":"2023-08-14T15:13:04Z","title":"ChatEval: Towards Better LLM-based Evaluators through Multi-Agent Debate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07201","snapshot_observed_at":"2026-08-16T10:53:24.707459Z","title":"Chateval: Towards better llm-based evaluators through multi-agent debate","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17087","last_updated":"2025-04-23T20:32:12Z","snapshot_observed_at":"2026-08-17T16:35:13.617293Z","submitted_at":"2025-04-23T20:32:12Z","title":"Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T10:53:24.707459Z"},"links":{"cited_paper":"/paper/2308.07201","citing_paper":"/paper/2504.17087"},"observation_digest":"sha256:3ad94c8a95f4ffad3779e72812396834a7535d0c234b5a89f97271b669de2e53","observation_id":"0dd83741-44ae-4dca-ad01-b80f8ac6a110","resolution":{"observed_at":"2026-08-16T10:53:24.707459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-16T07:05:57.323612Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-16T10:53:24.840206Z","title":"Livecodebench: Holistic and contamination free eval- uation of large language models for code","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17087","last_updated":"2025-04-23T20:32:12Z","snapshot_observed_at":"2026-08-17T16:35:13.617293Z","submitted_at":"2025-04-23T20:32:12Z","title":"Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T10:53:24.840206Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2504.17087"},"observation_digest":"sha256:e06d4fa5c4dc2d61e8532d4b741f6633b0e3b7d71e966f45deaf784262d77223","observation_id":"8abf0c6f-6050-487a-8758-2119a025dd38","resolution":{"observed_at":"2026-08-16T10:53:24.840206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19305","last_updated":"2024-04-15T14:21:52Z","snapshot_observed_at":"2026-08-16T14:05:34.620696Z","submitted_at":"2024-03-28T10:41:47Z","title":"MATEval: A Multi-Agent Discussion Framework for Advancing Open-Ended Text Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19305","snapshot_observed_at":"2026-08-16T10:53:24.848112Z","title":"Lin, S., Hilton, J., and Evans, O","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17087","last_updated":"2025-04-23T20:32:12Z","snapshot_observed_at":"2026-08-17T16:35:13.617293Z","submitted_at":"2025-04-23T20:32:12Z","title":"Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T10:53:24.848112Z"},"links":{"cited_paper":"/paper/2403.19305","citing_paper":"/paper/2504.17087"},"observation_digest":"sha256:1769d15b185ca83313498936a76141ef123a4f68ceb85e7efd78bd7515f546cd","observation_id":"8c1e6529-6777-4d0a-aee8-b7d7d03944d9","resolution":{"observed_at":"2026-08-16T10:53:24.848112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-16T10:53:24.860155Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17087","last_updated":"2025-04-23T20:32:12Z","snapshot_observed_at":"2026-08-17T16:35:13.617293Z","submitted_at":"2025-04-23T20:32:12Z","title":"Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T10:53:24.860155Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2504.17087"},"observation_digest":"sha256:fcbdf2b02d10210b0e1d943f1d9c9e7ee70f99d30a4843a7d5c352e97c2c12b9","observation_id":"08bb1446-c4a7-4589-a742-fe0c0c382d0f","resolution":{"observed_at":"2026-08-16T10:53:24.860155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-08-16T10:53:24.867753Z","title":"Y ., Cuadron, A., Wang, C., Popa, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17087","last_updated":"2025-04-23T20:32:12Z","snapshot_observed_at":"2026-08-17T16:35:13.617293Z","submitted_at":"2025-04-23T20:32:12Z","title":"Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T10:53:24.867753Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2504.17087"},"observation_digest":"sha256:12f9a278fbea88fba8be171c62e6f165b3adbdd6c8f85ea1ec18f6d7402d361b","observation_id":"d96debcb-a0ab-4ee9-ac07-e64c686188cc","resolution":{"observed_at":"2026-08-16T10:53:24.867753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12624","last_updated":"2025-08-18T00:07:23Z","snapshot_observed_at":"2026-08-17T19:11:58.232946Z","submitted_at":"2024-06-18T13:49:54Z","title":"Judging the Judges: Evaluating Alignment and Vulnerabilities in LLMs-as-Judges","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12624","snapshot_observed_at":"2026-08-16T10:53:24.871674Z","title":"S., Choudhary, K., Ramayapally, V","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17087","last_updated":"2025-04-23T20:32:12Z","snapshot_observed_at":"2026-08-17T16:35:13.617293Z","submitted_at":"2025-04-23T20:32:12Z","title":"Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T10:53:24.871674Z"},"links":{"cited_paper":"/paper/2406.12624","citing_paper":"/paper/2504.17087"},"observation_digest":"sha256:d31f9d619480590ecb63725e1009253df2671a370ef47a1f24f9285ab1d719bd","observation_id":"164e792e-d0f6-48b5-9097-56408af56e71","resolution":{"observed_at":"2026-08-16T10:53:24.871674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05495","last_updated":"2024-10-07T21:05:53Z","snapshot_observed_at":"2026-08-17T22:55:51.148335Z","submitted_at":"2024-10-07T21:05:53Z","title":"Self-rationalization improves LLM as a fine-grained judge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05495","snapshot_observed_at":"2026-08-16T10:53:24.875340Z","title":"A., Rama- murthy, R., Stevens, K., Chaudhery, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17087","last_updated":"2025-04-23T20:32:12Z","snapshot_observed_at":"2026-08-17T16:35:13.617293Z","submitted_at":"2025-04-23T20:32:12Z","title":"Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T10:53:24.875340Z"},"links":{"cited_paper":"/paper/2410.05495","citing_paper":"/paper/2504.17087"},"observation_digest":"sha256:e5d5e51ee647ebe595b815359fb973118a466d8295f8a0d954d1cde8d2512e4a","observation_id":"7609c747-f80d-423a-9148-12fccf3a474b","resolution":{"observed_at":"2026-08-16T10:53:24.875340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18796","last_updated":"2024-05-01T15:37:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-29T15:33:23Z","title":"Replacing Judges with Juries: Evaluating LLM Generations with a Panel of Diverse Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18796","snapshot_observed_at":"2026-08-16T10:53:24.879314Z","title":"Replacing judges with juries: Evaluating llm gener- ations with a panel of diverse models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17087","last_updated":"2025-04-23T20:32:12Z","snapshot_observed_at":"2026-08-17T16:35:13.617293Z","submitted_at":"2025-04-23T20:32:12Z","title":"Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T10:53:24.879314Z"},"links":{"cited_paper":"/paper/2404.18796","citing_paper":"/paper/2504.17087"},"observation_digest":"sha256:298ca098ee7287870defe9183ee25efa2e006430439cf1feca52048e66e59e7b","observation_id":"9f34a9d7-520f-44d4-9e48-78738a59461b","resolution":{"observed_at":"2026-08-16T10:53:24.879314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12966","last_updated":"2023-07-24T17:44:58Z","snapshot_observed_at":"2026-08-16T15:13:42.128297Z","submitted_at":"2023-07-24T17:44:58Z","title":"Aligning Large Language Models with Human: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12966","snapshot_observed_at":"2026-08-16T10:53:24.919360Z","title":"Aligning large language models with human: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17087","last_updated":"2025-04-23T20:32:12Z","snapshot_observed_at":"2026-08-17T16:35:13.617293Z","submitted_at":"2025-04-23T20:32:12Z","title":"Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T10:53:24.919360Z"},"links":{"cited_paper":"/paper/2307.12966","citing_paper":"/paper/2504.17087"},"observation_digest":"sha256:7687a9b9fd3418d4a40a23dbc65f54e11459c084f06ea0540f0b20e4b4fdcfd4","observation_id":"47dca15f-0f4b-40ed-8137-76226752cf07","resolution":{"observed_at":"2026-08-16T10:53:24.919360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-17T13:17:07.963143Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-16T10:53:24.990467Z","title":"Mmlu-pro: A more robust and challenging multi-task language under- standing benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17087","last_updated":"2025-04-23T20:32:12Z","snapshot_observed_at":"2026-08-17T16:35:13.617293Z","submitted_at":"2025-04-23T20:32:12Z","title":"Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T10:53:24.990467Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2504.17087"},"observation_digest":"sha256:0e45bb920b51b4aee93a124616bc2f3b1a5b7a6dd450e1466b8b4b455162f959","observation_id":"0e07aea5-8e62-4d70-b3e6-3f623bb50998","resolution":{"observed_at":"2026-08-16T10:53:24.990467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19314","last_updated":"2025-04-18T19:36:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-27T16:47:42Z","title":"LiveBench: A Challenging, Contamination-Limited LLM Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19314","snapshot_observed_at":"2026-08-16T10:53:25.046352Z","title":"Livebench: A challenging, contamination-free llm benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17087","last_updated":"2025-04-23T20:32:12Z","snapshot_observed_at":"2026-08-17T16:35:13.617293Z","submitted_at":"2025-04-23T20:32:12Z","title":"Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T10:53:25.046352Z"},"links":{"cited_paper":"/paper/2406.19314","citing_paper":"/paper/2504.17087"},"observation_digest":"sha256:db2a246d5f54a49bb90c4f3810202d47a12dace33b313843d1b4c94402ee915a","observation_id":"246fa49d-6c82-4101-a111-b0abb1c1e14f","resolution":{"observed_at":"2026-08-16T10:53:25.046352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19594","last_updated":"2024-07-30T01:38:06Z","snapshot_observed_at":"2026-08-16T13:30:25.003501Z","submitted_at":"2024-07-28T21:58:28Z","title":"Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19594","snapshot_observed_at":"2026-08-16T10:53:25.049609Z","title":"Meta-rewarding language models: Self-improving alignment with llm-as-a-meta- judge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17087","last_updated":"2025-04-23T20:32:12Z","snapshot_observed_at":"2026-08-17T16:35:13.617293Z","submitted_at":"2025-04-23T20:32:12Z","title":"Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T10:53:25.049609Z"},"links":{"cited_paper":"/paper/2407.19594","citing_paper":"/paper/2504.17087"},"observation_digest":"sha256:05caa2c5a4d5e8e3580a093f8b5e3d23ad366fc3f96a1929b4da034f68684ec3","observation_id":"852a8c22-4244-4b4e-b17f-86327ee6750c","resolution":{"observed_at":"2026-08-16T10:53:25.049609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18153","last_updated":"2023-05-30T15:14:06Z","snapshot_observed_at":"2026-08-16T15:28:38.296755Z","submitted_at":"2023-05-29T15:30:13Z","title":"Do Large Language Models Know What They Don't Know?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18153","snapshot_observed_at":"2026-08-16T10:53:25.053262Z","title":"Do large language models know what they don’t know? arXiv preprint arXiv:2305.18153,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17087","last_updated":"2025-04-23T20:32:12Z","snapshot_observed_at":"2026-08-17T16:35:13.617293Z","submitted_at":"2025-04-23T20:32:12Z","title":"Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T10:53:25.053262Z"},"links":{"cited_paper":"/paper/2305.18153","citing_paper":"/paper/2504.17087"},"observation_digest":"sha256:3e7824e26fb07c254a34a67026d882a84636133b8dc815e07c6d757e1f41f621","observation_id":"181b3b98-32bd-46b0-b91e-2b6f4e16afd7","resolution":{"observed_at":"2026-08-16T10:53:25.053262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.09403","last_updated":"2022-06-19T13:43:59Z","snapshot_observed_at":"2026-08-16T16:51:57.317986Z","submitted_at":"2022-06-19T13:43:59Z","title":"MME-CRS: Multi-Metric Evaluation Based on Correlation Re-Scaling for Evaluating Open-Domain Dialogue","version":1},"cited_work":{"arxiv_id":"2206.09403","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.09403","snapshot_observed_at":"2026-08-16T10:53:25.101251Z","title":"MME-CRS: Multi-Metric Evaluation Based on Correlation Re-Scaling for Evaluating Open-Domain Dialogue","venue":"cs.CL","work_id":"2ff396d8-ca23-40e7-958d-1681ccf537f8","year":2022},"citing_paper":{"arxiv_id":"2504.17087","last_updated":"2025-04-23T20:32:12Z","snapshot_observed_at":"2026-08-17T16:35:13.617293Z","submitted_at":"2025-04-23T20:32:12Z","title":"Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T10:53:25.056988Z"},"links":{"cited_paper":"/paper/2206.09403","citing_paper":"/paper/2504.17087"},"observation_digest":"sha256:b8235690e9c0b0baca24ace104e42c5ef2a51be3bb0683288b47291fc857532c","observation_id":"2e0b0f99-3c9a-46e2-b141-122e026017c2","resolution":{"observed_at":"2026-08-16T10:53:25.139148Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-16T10:53:25.060888Z","title":"Q., and Artzi, Y","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2504.17087","last_updated":"2025-04-23T20:32:12Z","snapshot_observed_at":"2026-08-17T16:35:13.617293Z","submitted_at":"2025-04-23T20:32:12Z","title":"Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T10:53:25.060888Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2504.17087"},"observation_digest":"sha256:bb808a33f6a254dfef7d0733e5da545c3e66f54dd4a91dadedca9057fb5d5284","observation_id":"06e17a48-7e15-4e51-9542-c596ecc4391e","resolution":{"observed_at":"2026-08-16T10:53:25.060888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:53:25.367012Z","title":"Detail of different rubrics In the single-agent precision comparison section, we analyzed the impact of four different rubric configurations","venue":null,"work_id":"26225773-cdd9-452a-80c7-acb9456846b5","year":2024},"citing_paper":{"arxiv_id":"2504.17087","last_updated":"2025-04-23T20:32:12Z","snapshot_observed_at":"2026-08-17T16:35:13.617293Z","submitted_at":"2025-04-23T20:32:12Z","title":"Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T10:53:25.065089Z"},"links":{"citing_paper":"/paper/2504.17087"},"observation_digest":"sha256:08853a16d3d4e4f4982283acc1674f94ed169ec02dff5a1bfbf84d4e85065cad","observation_id":"277ec298-e4d6-44ca-be0b-cf43c770d623","resolution":{"observed_at":"2026-08-16T10:53:25.370128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14251","last_updated":"2023-10-11T05:27:50Z","snapshot_observed_at":"2026-08-16T15:30:32.877559Z","submitted_at":"2023-05-23T17:06:00Z","title":"FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14251","snapshot_observed_at":"2026-08-16T10:53:24.855417Z","title":"W., Iyyer, M., Zettlemoyer, L., and Hajishirzi, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17087","last_updated":"2025-04-23T20:32:12Z","snapshot_observed_at":"2026-08-17T16:35:13.617293Z","submitted_at":"2025-04-23T20:32:12Z","title":"Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-16T10:53:24.855417Z"},"links":{"cited_paper":"/paper/2305.14251","citing_paper":"/paper/2504.17087"},"observation_digest":"sha256:4a52f33d196ea77cc5bb00f3addb6defb403d285c7d21c92aa22c35a89087534","observation_id":"b2e1119a-76ad-4be0-9649-d4222655c614","resolution":{"observed_at":"2026-08-16T10:53:24.855417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12307","last_updated":"2023-09-07T18:20:40Z","snapshot_observed_at":"2026-08-16T15:59:27.501154Z","submitted_at":"2023-01-28T23:08:25Z","title":"MQAG: Multiple-choice Question Answering and Generation for Assessing Information Consistency in Summarization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12307","snapshot_observed_at":"2026-08-16T10:53:24.852244Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2504.17087","last_updated":"2025-04-23T20:32:12Z","snapshot_observed_at":"2026-08-17T16:35:13.617293Z","submitted_at":"2025-04-23T20:32:12Z","title":"Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-16T10:53:24.852244Z"},"links":{"cited_paper":"/paper/2301.12307","citing_paper":"/paper/2504.17087"},"observation_digest":"sha256:14d2b62dacb28f13b33f614cb1d53bd8b083b7ff3f73c77c0770b479738f0b9a","observation_id":"bd9b1b95-b754-403b-b922-e5608079069c","resolution":{"observed_at":"2026-08-16T10:53:24.852244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15845","last_updated":"2024-04-24T12:48:06Z","snapshot_observed_at":"2026-08-17T21:56:39.362424Z","submitted_at":"2024-04-24T12:48:06Z","title":"Exploring LLM Prompting Strategies for Joint Essay Scoring and Feedback Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15845","snapshot_observed_at":"2026-08-16T10:53:24.863952Z","title":"Exploring llm prompting strategies for joint es- say scoring and feedback generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17087","last_updated":"2025-04-23T20:32:12Z","snapshot_observed_at":"2026-08-17T16:35:13.617293Z","submitted_at":"2025-04-23T20:32:12Z","title":"Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T10:53:24.863952Z"},"links":{"cited_paper":"/paper/2404.15845","citing_paper":"/paper/2504.17087"},"observation_digest":"sha256:89519aef31fa8f13485f07ea620304bb7e2a2db71d4f646291a447f9a0529881","observation_id":"475da4c9-edf1-407a-b872-92fe5788823d","resolution":{"observed_at":"2026-08-16T10:53:24.863952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-08-17T07:14:41.768935Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-16T10:53:24.776501Z","title":"Guo, Z., Jin, R., Liu, C., Huang, Y ., Shi, D., Yu, L., Liu, Y ., Li, J., Xiong, B., Xiong, D., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17087","last_updated":"2025-04-23T20:32:12Z","snapshot_observed_at":"2026-08-17T16:35:13.617293Z","submitted_at":"2025-04-23T20:32:12Z","title":"Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T10:53:24.776501Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2504.17087"},"observation_digest":"sha256:0814a6cd1392a490fc450dc163c842b6791f1f8f1df8f594b973028faae3d055","observation_id":"320b609c-1579-4ee3-afd3-ad55c33d9230","resolution":{"observed_at":"2026-08-16T10:53:24.776501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06782","last_updated":"2024-07-25T23:32:21Z","snapshot_observed_at":"2026-08-17T16:34:14.248777Z","submitted_at":"2024-02-09T21:05:01Z","title":"Debating with More Persuasive LLMs Leads to More Truthful Answers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06782","snapshot_observed_at":"2026-08-16T10:53:24.844122Z","title":"R., Rockt¨aschel, T., and Perez, E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17087","last_updated":"2025-04-23T20:32:12Z","snapshot_observed_at":"2026-08-17T16:35:13.617293Z","submitted_at":"2025-04-23T20:32:12Z","title":"Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T10:53:24.844122Z"},"links":{"cited_paper":"/paper/2402.06782","citing_paper":"/paper/2504.17087"},"observation_digest":"sha256:3b308b967c7e4b61ffad068bdbf48fe50c7540ca0349dc444fb719d24fa236ea","observation_id":"8ce2fbba-1898-4282-9b13-4a7dff31c2ac","resolution":{"observed_at":"2026-08-16T10:53:24.844122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.17087","last_updated":"2025-04-23T20:32:12Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-17T16:35:13.617293Z","submitted_at":"2025-04-23T20:32:12Z","title":"Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 8 inbound Pith citation observations for arXiv:2504.17087."}