{"as_of":"2026-08-08T00:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:065d4a1efa4cc044e0e98674446056bd661276293be7034f44bc3521314ea038","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:05:25.799258Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":7,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-07-06T19:05:05.530925Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":"2408.13006","doi":"10.48550/arxiv.2408.13006","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wenda Xu, Guanglei Zhu, Xuandong Zhao, Liangming Pan, Lei Li, and William Yang Wang","venue":"arXiv (Cornell University)","work_id":"8885c76c-a469-4dcb-aef3-87b218b7013e","year":2024},"citing_paper":{"arxiv_id":"2502.18864","last_updated":"2025-02-26T06:17:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T06:17:13Z","title":"Towards an AI co-scientist","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-11T13:02:43.571234Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2502.18864"},"observation_digest":"sha256:bd0acb2e87b46c76fa045ba6e1179d20f18c0d3af5ea01c68932a8411410e6a8","observation_id":"c736d4fb-3f19-43d8-bef9-b167f1e36ba6","resolution":{"observed_at":"2026-05-11T13:02:44.404608Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-07-06T19:05:05.530925Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-07T15:05:25.799258Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17149","last_updated":"2025-05-22T09:02:15Z","snapshot_observed_at":"2026-08-07T14:59:07.124926Z","submitted_at":"2025-05-22T09:02:15Z","title":"Large Language Models for Predictive Analysis: How Far Are They?","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T15:05:25.799258Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2505.17149"},"observation_digest":"sha256:b3be55d22b82e036897ad0cac291ba0d406c7af9e9f05e834fc4922bae5f78a4","observation_id":"57ba14f9-bb84-44fb-b442-9d6f7946c53a","resolution":{"observed_at":"2026-08-07T15:05:25.799258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-07-06T19:05:05.530925Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-07T11:32:31.693251Z","title":"Systematic evaluation of llm-as-a-judge in llm alignment tasks: Explainable metrics and diverse prompt templates.arXiv preprint arXiv:2408.13006, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02553","last_updated":"2025-06-03T07:44:31Z","snapshot_observed_at":"2026-08-07T11:19:28.410568Z","submitted_at":"2025-06-03T07:44:31Z","title":"Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:31.693251Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2506.02553"},"observation_digest":"sha256:1cdf0544b41ffd7c76a04e7ae766102af14109f7b6e25ce168a22fa6ca030052","observation_id":"b472d78c-92ea-4f16-8e06-1c1a56c278ee","resolution":{"observed_at":"2026-08-07T11:32:31.693251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-07-06T19:05:05.530925Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-07T10:19:35.386305Z","title":"Systematic Evaluation of LLM -as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05748","last_updated":"2025-06-06T05:18:54Z","snapshot_observed_at":"2026-08-07T21:55:18.527116Z","submitted_at":"2025-06-06T05:18:54Z","title":"Efficient Online RFT with Plug-and-Play LLM Judges: Unlocking State-of-the-Art Performance","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:35.386305Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2506.05748"},"observation_digest":"sha256:cad7bac6d6ef32674a6b888a336a0973539c440f41a8940e026751fb739c60a8","observation_id":"7c9c9731-28a4-45d0-914a-91332507933e","resolution":{"observed_at":"2026-08-07T10:19:35.386305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-07-06T19:05:05.530925Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-07T04:34:08.584381Z","title":"Systematic evaluation of llm-as-a-judge in llm alignment tasks: Explainable metrics and diverse prompt templates","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10403","last_updated":"2025-06-12T06:53:22Z","snapshot_observed_at":"2026-08-07T04:25:03.690277Z","submitted_at":"2025-06-12T06:53:22Z","title":"Time To Impeach LLM-as-a-Judge: Programs are the Future of Evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:34:08.584381Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2506.10403"},"observation_digest":"sha256:d031b738a0c44d35893a8635a15300c1608ab2dd4b4abc25c6eb9a65ee02cab7","observation_id":"ef315790-9b74-4f37-80c1-6a150431efaa","resolution":{"observed_at":"2026-08-07T04:34:08.584381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-07-06T19:05:05.530925Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-07T00:31:36.601561Z","title":"Ziyou Yan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13639","last_updated":"2025-06-16T16:04:43Z","snapshot_observed_at":"2026-08-07T00:26:19.217552Z","submitted_at":"2025-06-16T16:04:43Z","title":"An Empirical Study of LLM-as-a-Judge: How Design Choices Impact Evaluation Reliability","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:36.601561Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2506.13639"},"observation_digest":"sha256:25d40001f97827477b67ea51521f0cff7763c65cd3668093ccb1ad38bb9de574","observation_id":"60835722-30b9-4029-95ec-185286065f5e","resolution":{"observed_at":"2026-08-07T00:31:36.601561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-07-06T19:05:05.530925Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-06T21:13:12.843092Z","title":"Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Brian Ichter, Fei Xia, Ed H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-07T03:43:14.644781Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:13:12.843092Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2507.00769"},"observation_digest":"sha256:ab336650037c0b36fea0846317d957e291fd0e6639ecb388990fb080f422268b","observation_id":"da944267-1197-4876-a579-307bef239571","resolution":{"observed_at":"2026-08-06T21:13:12.843092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-07-06T19:05:05.530925Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-06T19:12:05.596485Z","title":"Systematic evaluation of llm-as-a-judge in llm alignment tasks: Explainable metrics and diverse prompt templates","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06329","last_updated":"2025-07-08T18:33:26Z","snapshot_observed_at":"2026-08-07T13:56:04.875098Z","submitted_at":"2025-07-08T18:33:26Z","title":"MixAssist: An Audio-Language Dataset for Co-Creative AI Assistance in Music Mixing","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-06T19:12:05.596485Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2507.06329"},"observation_digest":"sha256:bbe849f2a2273b025a017ed594b0208ff6ed94eca014a26e13b5612705fc4227","observation_id":"31fef8a8-1a7f-49d7-b3b8-a8bf0d604315","resolution":{"observed_at":"2026-08-06T19:12:05.596485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-07-06T19:05:05.530925Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-05T22:34:14.617849Z","title":"Systematic evaluation of llm-as-a-judge in llm alignment tasks: Explainable metrics and diverse prompt templates,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06888","last_updated":"2025-08-09T08:35:40Z","snapshot_observed_at":"2026-08-07T20:00:53.865378Z","submitted_at":"2025-08-09T08:35:40Z","title":"Multi-Modal Requirements Data-based Acceptance Criteria Generation using LLMs","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:14.617849Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2508.06888"},"observation_digest":"sha256:172e0b888e0152cf8d012aca9da9b9a8ee695185e9c287051f9d8aa5aab2834e","observation_id":"1dabb476-796a-40e7-a1a1-95629d87f9c2","resolution":{"observed_at":"2026-08-05T22:34:14.617849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-07-06T19:05:05.530925Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-05T15:21:32.643649Z","title":"Systematic evaluation of llm-as-a-judge in llm alignment tasks: Explainable metrics and diverse prompt templates","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20186","last_updated":"2025-08-27T18:04:45Z","snapshot_observed_at":"2026-08-05T15:21:31.775746Z","submitted_at":"2025-08-27T18:04:45Z","title":"AI Propaganda factories with language models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T15:21:32.643649Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2508.20186"},"observation_digest":"sha256:1cfced33d805417ceec53a504982c5f62b50d21d596f2edd6a2c4603dcc04105","observation_id":"dd0bb244-766b-40a7-bb26-8341a1390907","resolution":{"observed_at":"2026-08-05T15:21:32.643649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-07-06T19:05:05.530925Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-05T11:26:27.543864Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02855","last_updated":"2025-09-02T21:58:58Z","snapshot_observed_at":"2026-08-07T17:03:37.433272Z","submitted_at":"2025-09-02T21:58:58Z","title":"IDEAlign: Comparing Large Language Models to Human Experts in Open-ended Interpretive Annotations","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T11:26:27.543864Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2509.02855"},"observation_digest":"sha256:0ec7d3b9f988b0f89bc4683a1c3ce36499cd5703b474c4f30629bfb96b2bc0de","observation_id":"7c465ca9-2c19-4f63-a87d-aee427466f19","resolution":{"observed_at":"2026-08-05T11:26:27.543864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-07-06T19:05:05.530925Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-07-13T15:55:53.399860Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29139","last_updated":"2026-07-16T18:43:17Z","snapshot_observed_at":"2026-08-07T05:26:14.949741Z","submitted_at":"2026-03-31T01:41:28Z","title":"SciVisAgentBench: A Benchmark for Evaluating Scientific Data Analysis and Visualization Agents","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-13T15:55:53.399860Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2603.29139"},"observation_digest":"sha256:3b2e0eb8f492d8a78732b1c0c8a982ca20d66b38cbc36f32d26feea5619cfa70","observation_id":"aeb117fe-1c82-4dba-8867-5cee665d83b0","resolution":{"observed_at":"2026-07-13T15:55:53.399860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-07-06T19:05:05.530925Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-02T17:09:18.168845Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29139","last_updated":"2026-07-16T18:43:17Z","snapshot_observed_at":"2026-08-07T05:26:14.949741Z","submitted_at":"2026-03-31T01:41:28Z","title":"SciVisAgentBench: A Benchmark for Evaluating Scientific Data Analysis and Visualization Agents","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T17:09:18.168845Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2603.29139"},"observation_digest":"sha256:db48a987a889001496d7cf69c9caefd9ad7a0e23a3099a72e11f627f274ac4d0","observation_id":"d49d3437-8437-407b-8c8d-2b048b58bf33","resolution":{"observed_at":"2026-08-02T17:09:18.168845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-07-06T19:05:05.530925Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":"2408.13006","doi":"10.48550/arxiv.2408.13006","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wenda Xu, Guanglei Zhu, Xuandong Zhao, Liangming Pan, Lei Li, and William Yang Wang","venue":"arXiv (Cornell University)","work_id":"8885c76c-a469-4dcb-aef3-87b218b7013e","year":2024},"citing_paper":{"arxiv_id":"2604.05371","last_updated":"2026-04-07T03:16:44Z","snapshot_observed_at":"2026-07-06T22:54:08.897942Z","submitted_at":"2026-04-07T03:16:44Z","title":"LLM-as-Judge for Semantic Judging of Powerline Segmentation in UAV Inspection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T19:37:19.360378Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2604.05371"},"observation_digest":"sha256:852df41915e9596df491eee9e4bf7af705a6a792ddabb45b3bba04ce940b3234","observation_id":"d1d85efb-00b7-4abd-8b08-b003eaafd557","resolution":{"observed_at":"2026-05-10T22:45:48.017272Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-07-06T19:05:05.530925Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":"2408.13006","doi":"10.48550/arxiv.2408.13006","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wenda Xu, Guanglei Zhu, Xuandong Zhao, Liangming Pan, Lei Li, and William Yang Wang","venue":"arXiv (Cornell University)","work_id":"8885c76c-a469-4dcb-aef3-87b218b7013e","year":2024},"citing_paper":{"arxiv_id":"2605.01130","last_updated":"2026-05-01T22:01:31Z","snapshot_observed_at":"2026-08-04T07:16:37.388618Z","submitted_at":"2026-05-01T22:01:31Z","title":"Iterative Finetuning is Mostly Idempotent","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-09T19:04:36.210200Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2605.01130"},"observation_digest":"sha256:80a2345a4ccf6f71f4641ec5397c5343aea72eec281134cf1a19cbd3788424ee","observation_id":"cfcb7436-1bf7-4185-b89a-df84914418af","resolution":{"observed_at":"2026-05-11T15:51:44.631356Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-07-06T19:05:05.530925Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":"2408.13006","doi":"10.48550/arxiv.2408.13006","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wenda Xu, Guanglei Zhu, Xuandong Zhao, Liangming Pan, Lei Li, and William Yang Wang","venue":"arXiv (Cornell University)","work_id":"8885c76c-a469-4dcb-aef3-87b218b7013e","year":2024},"citing_paper":{"arxiv_id":"2605.24636","last_updated":"2026-05-26T17:07:57Z","snapshot_observed_at":"2026-08-03T08:44:52.173945Z","submitted_at":"2026-05-23T15:53:44Z","title":"GlobalDentBench: A Multinational Benchmark for Evaluating LLM Clinical Reasoning in Dentistry with Expert Calibration","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T13:38:51.424919Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2605.24636"},"observation_digest":"sha256:56374e6f9a98c9a16d999a29edcd976997f46908bc06a950bb839d8f884c9883","observation_id":"f2209723-09be-42a7-9623-9f00e582529d","resolution":{"observed_at":"2026-06-30T13:44:40.790933Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-07-06T19:05:05.530925Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":"2408.13006","doi":"10.48550/arxiv.2408.13006","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wenda Xu, Guanglei Zhu, Xuandong Zhao, Liangming Pan, Lei Li, and William Yang Wang","venue":"arXiv (Cornell University)","work_id":"8885c76c-a469-4dcb-aef3-87b218b7013e","year":2024},"citing_paper":{"arxiv_id":"2606.07874","last_updated":"2026-06-05T22:11:26Z","snapshot_observed_at":"2026-08-02T07:02:54.289200Z","submitted_at":"2026-06-05T22:11:26Z","title":"Safety is Contextual, LLM-Judges Are Not: Navigating the Rigid Priors of Evaluators","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-06-27T21:39:26.268337Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2606.07874"},"observation_digest":"sha256:aa6c5f238c68c04717bf0faf06f197096d063a4f68ad35ce832f0245c00d63e9","observation_id":"7133626b-ec70-40b2-b733-4667d82b46c1","resolution":{"observed_at":"2026-06-27T21:41:18.486232Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-07-06T19:05:05.530925Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-07-12T14:02:41.517301Z","title":"None identified","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2606.14948","last_updated":"2026-07-06T20:16:03Z","snapshot_observed_at":"2026-07-12T14:02:36.178544Z","submitted_at":"2026-06-12T20:46:04Z","title":"Beyond Correctness: Enhancing Architectural Reasoning in Code LLMs via Scalable Labeling with Agentic Judgment","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T14:02:41.517301Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2606.14948"},"observation_digest":"sha256:c1a3995db4ba68ff1a03642fa271f67ccfb2fe064d77c3a38e9a054a8fee7737","observation_id":"8ff3a2b6-4a2a-453b-8bed-405c8d29267d","resolution":{"observed_at":"2026-07-12T14:02:41.517301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2408.13006/citation-record","integrity":"/paper/2408.13006/integrity","json":"/paper/2408.13006/citation-record.json","paper":"/paper/2408.13006"},"outbound":[],"paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T19:05:05.530925Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 18 inbound Pith citation observations for arXiv:2408.13006."}