{"as_of":"2026-08-17T15:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:443ef58e48e46d541ccce6684477bd4f891f19baa64b44a8dcfdc92cd1fc2d79","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T11:08:45.974486Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-03T14:31:49.214297Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T14:38:28.709855Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.07506","last_updated":"2026-06-10T04:38:15Z","snapshot_observed_at":"2026-08-16T05:14:32.001117Z","submitted_at":"2026-01-12T13:05:13Z","title":"Judging Against the Reference: Uncovering Knowledge-Driven Failures in LLM-Judges on QA Evaluation","version":2},"cited_work":{"arxiv_id":"2601.07506","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.07506","snapshot_observed_at":"2026-07-03T14:38:28.709855Z","title":"Judging Against the Reference: Uncovering Knowledge-Driven Failures in LLM-Judges on QA Evaluation","venue":"cs.CL","work_id":"9f489fde-5c86-4e6b-bca0-56c52affa6bc","year":2026},"citing_paper":{"arxiv_id":"2607.02235","last_updated":"2026-07-02T14:34:07Z","snapshot_observed_at":"2026-07-07T00:07:42.752664Z","submitted_at":"2026-07-02T14:34:07Z","title":"Challenges and Recommendations for LLMs-as-a-Judge in Multilingual Settings and Low-Resource Languages","version":1},"reference_index":165,"source":"arxiv_source","source_observed_at":"2026-07-03T14:31:49.214297Z"},"links":{"cited_paper":"/paper/2601.07506","citing_paper":"/paper/2607.02235"},"observation_digest":"sha256:e178ade8f4298e819fa05ce08d146c0ecd218854da7098c41f1dab4a912359b5","observation_id":"3f123a11-f5f1-4282-8ea8-18b051efc4c1","resolution":{"observed_at":"2026-07-03T14:38:28.711235Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2601.07506/citation-record","integrity":"/paper/2601.07506/integrity","json":"/paper/2601.07506/citation-record.json","paper":"/paper/2601.07506"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:08:44.828348Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.07506","last_updated":"2026-06-10T04:38:15Z","snapshot_observed_at":"2026-08-16T05:14:32.001117Z","submitted_at":"2026-01-12T13:05:13Z","title":"Judging Against the Reference: Uncovering Knowledge-Driven Failures in LLM-Judges on QA Evaluation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T11:08:44.828348Z"},"links":{"citing_paper":"/paper/2601.07506"},"observation_digest":"sha256:ebf36b442a5558cce058c580c68c2ddf9e892251d1eaffaf1d297af7ff844ce7","observation_id":"74d9ae33-2146-4a92-b717-867477a080ff","resolution":{"observed_at":"2026-08-03T11:08:44.828348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:08:45.003915Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.07506","last_updated":"2026-06-10T04:38:15Z","snapshot_observed_at":"2026-08-16T05:14:32.001117Z","submitted_at":"2026-01-12T13:05:13Z","title":"Judging Against the Reference: Uncovering Knowledge-Driven Failures in LLM-Judges on QA Evaluation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T11:08:45.003915Z"},"links":{"citing_paper":"/paper/2601.07506"},"observation_digest":"sha256:085dd6016f979e9b254fd2b6be801dfc30bd34c68110386ab584d08cf94f4b5f","observation_id":"5c3f32a1-2b77-45b0-9c41-716c3f9f424d","resolution":{"observed_at":"2026-08-03T11:08:45.003915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:08:45.237417Z","title":"- Dates/periods → DATE","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.07506","last_updated":"2026-06-10T04:38:15Z","snapshot_observed_at":"2026-08-16T05:14:32.001117Z","submitted_at":"2026-01-12T13:05:13Z","title":"Judging Against the Reference: Uncovering Knowledge-Driven Failures in LLM-Judges on QA Evaluation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T11:08:45.237417Z"},"links":{"citing_paper":"/paper/2601.07506"},"observation_digest":"sha256:027d5ce74ae24359b1f9594df5f72b3cb3e4d57bebab42cbed107dc5d9cd5e9c","observation_id":"3f53d9d6-9de5-4156-a522-96dfe9c4da04","resolution":{"observed_at":"2026-08-03T11:08:45.237417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:08:45.431688Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.07506","last_updated":"2026-06-10T04:38:15Z","snapshot_observed_at":"2026-08-16T05:14:32.001117Z","submitted_at":"2026-01-12T13:05:13Z","title":"Judging Against the Reference: Uncovering Knowledge-Driven Failures in LLM-Judges on QA Evaluation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T11:08:45.431688Z"},"links":{"citing_paper":"/paper/2601.07506"},"observation_digest":"sha256:60583e1047b0fb7971cae4323ea91d4143f01d2dda5f0be45e246d2b7e00b2bc","observation_id":"15e2f7fd-ff3b-4253-9afd-6cd0e013b514","resolution":{"observed_at":"2026-08-03T11:08:45.431688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:08:44.037230Z","title":"InFindings of the Associa- tion for Computational Linguistics: ACL 2024, pages 12688–12701","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.07506","last_updated":"2026-06-10T04:38:15Z","snapshot_observed_at":"2026-08-16T05:14:32.001117Z","submitted_at":"2026-01-12T13:05:13Z","title":"Judging Against the Reference: Uncovering Knowledge-Driven Failures in LLM-Judges on QA Evaluation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T11:08:44.037230Z"},"links":{"citing_paper":"/paper/2601.07506"},"observation_digest":"sha256:a3d426f57d94a601470425dadd31c1eadbc8e2278d9dca8af6c8bdfb9ce9b3d7","observation_id":"4da665f8-f426-41c5-b018-a046d3e6a5b9","resolution":{"observed_at":"2026-08-03T11:08:44.037230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.05052","last_updated":"2022-01-12T02:41:09Z","snapshot_observed_at":"2026-08-16T17:57:28.013555Z","submitted_at":"2021-09-10T18:29:44Z","title":"Entity-Based Knowledge Conflicts in Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.05052","snapshot_observed_at":"2026-08-03T11:08:44.172839Z","title":"Tiange Luo, Ang Cao, Gunhee Lee, Justin Johnson, and Honglak Lee","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.07506","last_updated":"2026-06-10T04:38:15Z","snapshot_observed_at":"2026-08-16T05:14:32.001117Z","submitted_at":"2026-01-12T13:05:13Z","title":"Judging Against the Reference: Uncovering Knowledge-Driven Failures in LLM-Judges on QA Evaluation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T11:08:44.172839Z"},"links":{"cited_paper":"/paper/2109.05052","citing_paper":"/paper/2601.07506"},"observation_digest":"sha256:5672a322f000299c65c147cfebc3eb220262449a2dcf5c1ca91629e06640614a","observation_id":"0e5202c3-d0d2-4e4f-a376-f823603370c5","resolution":{"observed_at":"2026-08-03T11:08:44.172839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:08:45.856255Z","title":"No explanation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.07506","last_updated":"2026-06-10T04:38:15Z","snapshot_observed_at":"2026-08-16T05:14:32.001117Z","submitted_at":"2026-01-12T13:05:13Z","title":"Judging Against the Reference: Uncovering Knowledge-Driven Failures in LLM-Judges on QA Evaluation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T11:08:45.856255Z"},"links":{"citing_paper":"/paper/2601.07506"},"observation_digest":"sha256:ec2e7e8682763f35e71c5f4025a2a8ece84dcb550a00e10c17ff71e77e623d7a","observation_id":"a98bf69e-66b9-41a4-b4a2-b1d53022ce04","resolution":{"observed_at":"2026-08-03T11:08:45.856255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:08:45.974486Z","title":"Mona Lisa","venue":null,"work_id":null,"year":1945},"citing_paper":{"arxiv_id":"2601.07506","last_updated":"2026-06-10T04:38:15Z","snapshot_observed_at":"2026-08-16T05:14:32.001117Z","submitted_at":"2026-01-12T13:05:13Z","title":"Judging Against the Reference: Uncovering Knowledge-Driven Failures in LLM-Judges on QA Evaluation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T11:08:45.974486Z"},"links":{"citing_paper":"/paper/2601.07506"},"observation_digest":"sha256:1243b7812c8f973b7c985d1e0bb4f5dacdc6a1b98e57279e03cb1682c221473b","observation_id":"b7f38292-2c26-4861-b70c-0ba0d2a09f25","resolution":{"observed_at":"2026-08-03T11:08:45.974486Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17631","last_updated":"2025-03-01T17:06:43Z","snapshot_observed_at":"2026-08-16T14:48:30.939401Z","submitted_at":"2023-10-26T17:48:58Z","title":"JudgeLM: Fine-tuned Large Language Models are Scalable Judges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17631","snapshot_observed_at":"2026-08-03T11:08:44.678747Z","title":"MONEY: Monetary values, including unit. QUANTITY: Measurements of size/weight/distance/volume/speed/etc. ORDINAL: “first","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.07506","last_updated":"2026-06-10T04:38:15Z","snapshot_observed_at":"2026-08-16T05:14:32.001117Z","submitted_at":"2026-01-12T13:05:13Z","title":"Judging Against the Reference: Uncovering Knowledge-Driven Failures in LLM-Judges on QA Evaluation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T11:08:44.678747Z"},"links":{"cited_paper":"/paper/2310.17631","citing_paper":"/paper/2601.07506"},"observation_digest":"sha256:41a31765a1d0a2da7345c3ba0f8f3578724b016089eab249b35eb3389cf652aa","observation_id":"30268516-3ec6-4c15-8c0b-a0c3d07b6b12","resolution":{"observed_at":"2026-08-03T11:08:44.678747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:08:45.596783Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.07506","last_updated":"2026-06-10T04:38:15Z","snapshot_observed_at":"2026-08-16T05:14:32.001117Z","submitted_at":"2026-01-12T13:05:13Z","title":"Judging Against the Reference: Uncovering Knowledge-Driven Failures in LLM-Judges on QA Evaluation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T11:08:45.596783Z"},"links":{"citing_paper":"/paper/2601.07506"},"observation_digest":"sha256:178e114c1ee40d3ea3e9eefaccb9d03556fc4970309d6e42c02bb49fd2b87ea7","observation_id":"5c341bd4-31bb-4ace-b673-d138823184c0","resolution":{"observed_at":"2026-08-03T11:08:45.596783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:08:45.724786Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.07506","last_updated":"2026-06-10T04:38:15Z","snapshot_observed_at":"2026-08-16T05:14:32.001117Z","submitted_at":"2026-01-12T13:05:13Z","title":"Judging Against the Reference: Uncovering Knowledge-Driven Failures in LLM-Judges on QA Evaluation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T11:08:45.724786Z"},"links":{"citing_paper":"/paper/2601.07506"},"observation_digest":"sha256:b68ee13e1de258169fd500a6597e06ea0f91d63f5226f66291987f504027b85d","observation_id":"23fd7538-362e-45ee-aa62-5463b15be321","resolution":{"observed_at":"2026-08-03T11:08:45.724786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00300","last_updated":"2019-06-27T21:06:12Z","snapshot_observed_at":"2026-08-16T14:19:32.455632Z","submitted_at":"2019-06-01T22:02:39Z","title":"Latent Retrieval for Weakly Supervised Open Domain Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.00300","snapshot_observed_at":"2026-08-03T11:08:43.916320Z","title":"Dawei Li, Bohan Jiang, Liangjie Huang, Alimohammad Beigi, Chengshuai Zhao, Zhen Tan, Amrita Bhat- tacharjee, Yuxuan Jiang, Canyu Chen, Tianhao Wu, and 1 others","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2601.07506","last_updated":"2026-06-10T04:38:15Z","snapshot_observed_at":"2026-08-16T05:14:32.001117Z","submitted_at":"2026-01-12T13:05:13Z","title":"Judging Against the Reference: Uncovering Knowledge-Driven Failures in LLM-Judges on QA Evaluation","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-03T11:08:43.916320Z"},"links":{"cited_paper":"/paper/1906.00300","citing_paper":"/paper/2601.07506"},"observation_digest":"sha256:61cb0846ae9a6a0f9a680bc75dfda5d1752e6b1de8b13b4b03353be06e819877","observation_id":"ac3fb4d3-a2dc-4201-87b5-ae5c37073664","resolution":{"observed_at":"2026-08-03T11:08:43.916320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.06314","last_updated":"2021-10-25T01:10:38Z","snapshot_observed_at":"2026-08-16T18:03:21.632822Z","submitted_at":"2021-08-13T16:42:25Z","title":"A Dataset for Answering Time-Sensitive Questions","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.06314","snapshot_observed_at":"2026-08-03T11:08:43.665042Z","title":"Zhi-Yuan Chen, Hao Wang, Xinyu Zhang, Enrui Hu, and Yankai Lin","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07506","last_updated":"2026-06-10T04:38:15Z","snapshot_observed_at":"2026-08-16T05:14:32.001117Z","submitted_at":"2026-01-12T13:05:13Z","title":"Judging Against the Reference: Uncovering Knowledge-Driven Failures in LLM-Judges on QA Evaluation","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T11:08:43.665042Z"},"links":{"cited_paper":"/paper/2108.06314","citing_paper":"/paper/2601.07506"},"observation_digest":"sha256:c912f42ad9bdebe7bae67f93cb9e32795799cfa14d2d0edb497d03c746129a94","observation_id":"aa27bbfb-854d-467c-87cf-b4709f37c1d7","resolution":{"observed_at":"2026-08-03T11:08:43.665042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:08:43.526902Z","title":"InProceedings of the 2022 Con- ference on Empirical Methods in Natural Language Processing, pages 2292–2307","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.07506","last_updated":"2026-06-10T04:38:15Z","snapshot_observed_at":"2026-08-16T05:14:32.001117Z","submitted_at":"2026-01-12T13:05:13Z","title":"Judging Against the Reference: Uncovering Knowledge-Driven Failures in LLM-Judges on QA Evaluation","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T11:08:43.526902Z"},"links":{"citing_paper":"/paper/2601.07506"},"observation_digest":"sha256:8bfcaeee07acafd2216985e33ecde8c8c713962dcc0c8b53d0730278c9ef443f","observation_id":"d140dde2-5f93-435c-884a-d0f6664c4a44","resolution":{"observed_at":"2026-08-03T11:08:43.526902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19301","last_updated":"2023-10-30T06:35:37Z","snapshot_observed_at":"2026-08-17T15:43:41.171640Z","submitted_at":"2023-10-30T06:35:37Z","title":"ROME: Evaluating Pre-trained Vision-Language Models on Reasoning beyond Visual Common Sense","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19301","snapshot_observed_at":"2026-08-03T11:08:44.483762Z","title":"Kankan Zhou, Eason Lai, Wei Bin Au Yeong, Kyriakos Mouratidis, and Jing Jiang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.07506","last_updated":"2026-06-10T04:38:15Z","snapshot_observed_at":"2026-08-16T05:14:32.001117Z","submitted_at":"2026-01-12T13:05:13Z","title":"Judging Against the Reference: Uncovering Knowledge-Driven Failures in LLM-Judges on QA Evaluation","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T11:08:44.483762Z"},"links":{"cited_paper":"/paper/2310.19301","citing_paper":"/paper/2601.07506"},"observation_digest":"sha256:ee043017c717422d746bd82136002e02d8196b1b36eb149822e7e586cbc42d5a","observation_id":"029133b2-4152-4420-ab4f-3fd0e1f1b46c","resolution":{"observed_at":"2026-08-03T11:08:44.483762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:08:43.783284Z","title":"InProceedings of the 47th International ACM SI- GIR Conference on Research and Development in Information Retrieval, pages 2811–2816","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.07506","last_updated":"2026-06-10T04:38:15Z","snapshot_observed_at":"2026-08-16T05:14:32.001117Z","submitted_at":"2026-01-12T13:05:13Z","title":"Judging Against the Reference: Uncovering Knowledge-Driven Failures in LLM-Judges on QA Evaluation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T11:08:43.783284Z"},"links":{"citing_paper":"/paper/2601.07506"},"observation_digest":"sha256:5e31a44750614cfcb777fe70db576788bceeff3323524f7d7d4c4d2dc73095be","observation_id":"5761f192-9849-4276-91fa-7d9f57c27264","resolution":{"observed_at":"2026-08-03T11:08:43.783284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-03T11:08:44.325810Z","title":"Wenhao Yu, Meng Jiang, Peter Clark, and Ashish Sab- harwal","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.07506","last_updated":"2026-06-10T04:38:15Z","snapshot_observed_at":"2026-08-16T05:14:32.001117Z","submitted_at":"2026-01-12T13:05:13Z","title":"Judging Against the Reference: Uncovering Knowledge-Driven Failures in LLM-Judges on QA Evaluation","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T11:08:44.325810Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2601.07506"},"observation_digest":"sha256:8013da62532d2c21145f6c45355150e3308ad4f59824d666a7f581be7a8fa7b0","observation_id":"4a0971c1-12a3-4d1e-b1d1-90443c0a25fc","resolution":{"observed_at":"2026-08-03T11:08:44.325810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.07506","last_updated":"2026-06-10T04:38:15Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T05:14:32.001117Z","submitted_at":"2026-01-12T13:05:13Z","title":"Judging Against the Reference: Uncovering Knowledge-Driven Failures in LLM-Judges on QA Evaluation"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 1 inbound Pith citation observation for arXiv:2601.07506."}