{"as_of":"2026-08-07T13:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:46f0c69a7564d3fa6a4e791609ec907741c17fbe38f3c6f17e8dcf77705f3e4b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:06:32.364901Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":12,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":"2403.02839","doi":"10.48550/arxiv.2403.02839","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Huang, Y","venue":"arXiv (Cornell University)","work_id":"9dcfa6c6-4a5f-4f0e-b5d6-9875be99200f","year":2024},"citing_paper":{"arxiv_id":"2404.18796","last_updated":"2024-05-01T15:37:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-29T15:33:23Z","title":"Replacing Judges with Juries: Evaluating LLM Generations with a Panel of Diverse Models","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-15T23:32:17.279836Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2404.18796"},"observation_digest":"sha256:d297363ed32777b91452b29b2a6978f4b5361c433848a6706333d6b129a4b4a9","observation_id":"440556cc-00a4-4867-a40e-587797f21bc3","resolution":{"observed_at":"2026-05-15T23:32:17.998336Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":"2403.02839","doi":"10.48550/arxiv.2403.02839","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Huang, Y","venue":"arXiv (Cornell University)","work_id":"9dcfa6c6-4a5f-4f0e-b5d6-9875be99200f","year":2024},"citing_paper":{"arxiv_id":"2405.14782","last_updated":"2026-05-31T00:04:33Z","snapshot_observed_at":"2026-08-02T05:44:43.939336Z","submitted_at":"2024-05-23T16:50:49Z","title":"Lessons from the Trenches on Reproducible Evaluation of Language Models","version":2},"reference_index":156,"source":"arxiv_source","source_observed_at":"2026-05-16T18:44:49.519995Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2405.14782"},"observation_digest":"sha256:a4523d6bd7f96a05b01be1318b34db0e8e3c9b3cef7499d7694af30a8f9de1f6","observation_id":"619b6d6e-f015-48cd-ab29-8af910c92656","resolution":{"observed_at":"2026-05-16T18:44:49.795483Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":"2403.02839","doi":"10.48550/arxiv.2403.02839","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Huang, Y","venue":"arXiv (Cornell University)","work_id":"9dcfa6c6-4a5f-4f0e-b5d6-9875be99200f","year":2024},"citing_paper":{"arxiv_id":"2406.04244","last_updated":"2024-06-06T16:41:39Z","snapshot_observed_at":"2026-07-30T15:43:06.151242Z","submitted_at":"2024-06-06T16:41:39Z","title":"Benchmark Data Contamination of Large Language Models: A Survey","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-22T23:10:40.420241Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2406.04244"},"observation_digest":"sha256:083e23012294418fa392ab5ee12e55271dbaac5b235805331cc30b2c3797ac4d","observation_id":"8fba2e7e-e1bc-4ebc-b016-358942c9def7","resolution":{"observed_at":"2026-05-22T23:10:40.974779Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":"2403.02839","doi":"10.48550/arxiv.2403.02839","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Huang, Y","venue":"arXiv (Cornell University)","work_id":"9dcfa6c6-4a5f-4f0e-b5d6-9875be99200f","year":2024},"citing_paper":{"arxiv_id":"2407.21772","last_updated":"2024-08-04T22:13:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-31T17:48:14Z","title":"ShieldGemma: Generative AI Content Moderation Based on Gemma","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T13:17:39.444002Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2407.21772"},"observation_digest":"sha256:3b0cf87adc8521570bd138eda581ec586c74e63d02a5b0cba69b325e063f8418","observation_id":"6ca8af0d-7ab7-4a8b-97ac-91e9263a8cb8","resolution":{"observed_at":"2026-05-20T13:17:39.501674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":"2403.02839","doi":"10.48550/arxiv.2403.02839","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Huang, Y","venue":"arXiv (Cornell University)","work_id":"9dcfa6c6-4a5f-4f0e-b5d6-9875be99200f","year":2024},"citing_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-23T17:33:13.394338Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2411.15594"},"observation_digest":"sha256:6446c8a4593dd4522de53559d2116574d09128440c325fe09277566a338f80ac","observation_id":"6b368de2-740e-4e4d-86c4-5ba9d9cdd820","resolution":{"observed_at":"2026-05-23T17:35:43.845001Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":"2403.02839","doi":"10.48550/arxiv.2403.02839","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Huang, Y","venue":"arXiv (Cornell University)","work_id":"9dcfa6c6-4a5f-4f0e-b5d6-9875be99200f","year":2024},"citing_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-07-31T01:42:39.468673Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-11T23:08:34.312466Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2412.05579"},"observation_digest":"sha256:36dc8383fcfce7715793aded2b500316b20db3a0510b48c32cf2110abaa10cd7","observation_id":"33615456-3847-4488-b199-59963e60b2e0","resolution":{"observed_at":"2026-05-11T23:08:36.802863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-07T04:06:32.364901Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11604","last_updated":"2025-06-27T10:12:42Z","snapshot_observed_at":"2026-08-07T04:02:03.363112Z","submitted_at":"2025-06-13T09:20:41Z","title":"VLM@school -- Evaluation of AI image understanding on German middle school knowledge","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:06:32.364901Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2506.11604"},"observation_digest":"sha256:f4715f5018ae254ee021b28c9575e7769339d2deddb8c1fe8965805ff6e4504a","observation_id":"338cffb2-af94-4e6e-9237-ea82b87c11ee","resolution":{"observed_at":"2026-08-07T04:06:32.364901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-06T23:25:47.829032Z","title":"On the limitations of fine-tuned judge models for llm evaluation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18213","last_updated":"2025-06-23T00:19:27Z","snapshot_observed_at":"2026-08-07T10:41:05.932475Z","submitted_at":"2025-06-23T00:19:27Z","title":"A Conceptual Framework for AI Capability Evaluations","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T23:25:47.829032Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2506.18213"},"observation_digest":"sha256:3400ebd4343d75529d7abb93ac8b1dce333ea3bed6df0def992790f0eb02737a","observation_id":"35245c9b-6ac1-4d25-abec-e0eb5ed53118","resolution":{"observed_at":"2026-08-06T23:25:47.829032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-06T15:10:23.222553Z","title":"On the Limitations of Fine-tuned Judge Models for LLM Evaluation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16587","last_updated":"2025-07-22T13:40:26Z","snapshot_observed_at":"2026-08-06T15:04:15.420149Z","submitted_at":"2025-07-22T13:40:26Z","title":"On the Effectiveness of LLM-as-a-judge for Code Generation and Summarization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:10:23.222553Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2507.16587"},"observation_digest":"sha256:967bc6abdfef58045eb2d1c1e3ff2f293757e3230c8c667ee1f4198df982b7c8","observation_id":"6630e635-cbe4-40e3-8524-e2f4199fe69d","resolution":{"observed_at":"2026-08-06T15:10:23.222553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-05T23:04:56.912415Z","title":", author Qu, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05929","last_updated":"2025-09-10T12:09:14Z","snapshot_observed_at":"2026-08-05T23:04:47.746625Z","submitted_at":"2025-08-08T01:40:10Z","title":"Towards Reliable Generative AI-Driven Scaffolding: Reducing Hallucinations and Enhancing Quality in Self-Regulated Learning Support","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T23:04:56.912415Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2508.05929"},"observation_digest":"sha256:bafd0064c9c74bdfa2d5e2cf6d2d1d744004e50bcfce41608a831190b26c83de","observation_id":"f9e7aece-e3a1-4f62-a2cb-de4e76c4482a","resolution":{"observed_at":"2026-08-05T23:04:56.912415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-03T21:09:20.133943Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.16478","last_updated":"2026-07-20T11:57:11Z","snapshot_observed_at":"2026-08-07T10:54:04.966461Z","submitted_at":"2025-11-20T15:46:27Z","title":"Music Recommendation with Large Language Models: Challenges, Opportunities, and Evaluation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T21:09:20.133943Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2511.16478"},"observation_digest":"sha256:779abbabe34f1b4ebc094f4e543126cc24ee860a0c2f01c783a558996db556a5","observation_id":"094d9722-3e48-41b7-b780-5842449971b8","resolution":{"observed_at":"2026-08-03T21:09:20.133943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":"2403.02839","doi":"10.48550/arxiv.2403.02839","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Huang, Y","venue":"arXiv (Cornell University)","work_id":"9dcfa6c6-4a5f-4f0e-b5d6-9875be99200f","year":2024},"citing_paper":{"arxiv_id":"2605.02765","last_updated":"2026-05-04T16:05:40Z","snapshot_observed_at":"2026-07-06T23:15:46.390406Z","submitted_at":"2026-05-04T16:05:40Z","title":"U-Define: Designing User Workflows for Hard and Soft Constraints in LLM-Based Planning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T18:19:55.849451Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2605.02765"},"observation_digest":"sha256:6cfefa6e0e192373b030d9919b1fb2fee00ca63fa19477868c994653de5326e0","observation_id":"2333b4db-20bd-4583-a8f7-2d4feab28d01","resolution":{"observed_at":"2026-05-09T06:35:39.005139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":"2403.02839","doi":"10.48550/arxiv.2403.02839","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Huang, Y","venue":"arXiv (Cornell University)","work_id":"9dcfa6c6-4a5f-4f0e-b5d6-9875be99200f","year":2024},"citing_paper":{"arxiv_id":"2605.11663","last_updated":"2026-05-12T07:22:50Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T07:22:50Z","title":"Human-Grounded Multimodal Benchmark with 900K-Scale Aggregated Student Response Distributions from Japan's National Assessment of Academic Ability","version":1},"reference_index":106,"source":"arxiv_source","source_observed_at":"2026-05-13T01:12:44.476894Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2605.11663"},"observation_digest":"sha256:0cba46b5bc3bbae721d7c43100d9db69cc2dbcb39d820c31ebe549c7f191c307","observation_id":"d2d22ba6-a5c3-4f42-a572-30e2337e13eb","resolution":{"observed_at":"2026-05-13T01:17:02.696947Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":"2403.02839","doi":"10.48550/arxiv.2403.02839","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Huang, Y","venue":"arXiv (Cornell University)","work_id":"9dcfa6c6-4a5f-4f0e-b5d6-9875be99200f","year":2024},"citing_paper":{"arxiv_id":"2606.03138","last_updated":"2026-06-02T04:27:53Z","snapshot_observed_at":"2026-08-05T08:20:24.247189Z","submitted_at":"2026-06-02T04:27:53Z","title":"Section-Weighted Hybrid Approach for Legal Case Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T08:39:28.510255Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2606.03138"},"observation_digest":"sha256:da894e2f10baaaedee64db8b105347a7341cf47c86448d458e7d1cb18fc654f1","observation_id":"0d67d5d2-beea-4717-858a-1893de695dc3","resolution":{"observed_at":"2026-07-02T04:56:39.300020Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":"2403.02839","doi":"10.48550/arxiv.2403.02839","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Huang, Y","venue":"arXiv (Cornell University)","work_id":"9dcfa6c6-4a5f-4f0e-b5d6-9875be99200f","year":2024},"citing_paper":{"arxiv_id":"2606.07874","last_updated":"2026-06-05T22:11:26Z","snapshot_observed_at":"2026-08-02T07:02:54.289200Z","submitted_at":"2026-06-05T22:11:26Z","title":"Safety is Contextual, LLM-Judges Are Not: Navigating the Rigid Priors of Evaluators","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-06-27T21:39:26.268337Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2606.07874"},"observation_digest":"sha256:0b9b691b24d1301dc1d4739c68fd9a5a67d82781476e4467b064fe1f77ad347d","observation_id":"9d426666-40ad-4b7c-9c99-16f0bd40c3e4","resolution":{"observed_at":"2026-06-27T21:41:18.571899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-02T05:30:00.492775Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13347","last_updated":"2026-07-16T21:13:23Z","snapshot_observed_at":"2026-08-07T00:27:01.400375Z","submitted_at":"2026-07-15T00:14:31Z","title":"LLM-as-a-Judge Scores Are Unreliable Optimization Signals in Closed-Loop Table Recognition","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-02T05:30:00.492775Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2607.13347"},"observation_digest":"sha256:affa724bd326a2e1b9fe3540edce5d7a877e30f53db5e8433859053420267b3b","observation_id":"bd79bc58-d3bd-4eb0-8bed-8afeccf7dde5","resolution":{"observed_at":"2026-08-02T05:30:00.492775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-07-31T12:20:07.090862Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28282","last_updated":"2026-07-30T14:31:07Z","snapshot_observed_at":"2026-08-06T16:34:19.905250Z","submitted_at":"2026-07-30T14:31:07Z","title":"(Towards) Scalable Reliable Automated Evaluation with Large Language Models","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-07-31T12:20:07.090862Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2607.28282"},"observation_digest":"sha256:6a6960fcdb630d29edea6e7469c6604998364beab986ae79c1da50ced02e79fc","observation_id":"919a65f8-29a8-430a-a1ec-2d0a3744c8f5","resolution":{"observed_at":"2026-07-31T12:20:07.090862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02839","snapshot_observed_at":"2026-08-03T00:55:40.748915Z","title":"arXiv preprint arXiv:2403.02839 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28636","last_updated":"2026-05-19T13:56:13Z","snapshot_observed_at":"2026-08-06T00:38:04.006327Z","submitted_at":"2026-05-19T13:56:13Z","title":"Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges","version":1},"reference_index":272,"source":"arxiv_source","source_observed_at":"2026-08-03T00:55:40.748915Z"},"links":{"cited_paper":"/paper/2403.02839","citing_paper":"/paper/2607.28636"},"observation_digest":"sha256:5edd4d0c718e7da8d0661ebeb03d3283f126efe7f219d4878317f118387dd14f","observation_id":"27885a75-59e5-46f3-9d69-832c82e6d4cd","resolution":{"observed_at":"2026-08-03T00:55:40.748915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2403.02839/citation-record","integrity":"/paper/2403.02839/integrity","json":"/paper/2403.02839/citation-record.json","paper":"/paper/2403.02839"},"outbound":[],"paper":{"arxiv_id":"2403.02839","last_updated":"2025-05-30T12:01:03Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T17:39:45.571775Z","submitted_at":"2024-03-05T10:20:52Z","title":"An Empirical Study of LLM-as-a-Judge for LLM Evaluation: Fine-tuned Judge Model is not a General Substitute for GPT-4"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 18 inbound Pith citation observations for arXiv:2403.02839."}