{"as_of":"2026-08-18T18:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a7b31018a95d9c68d34008ecfac38f7e668f8ad4716e9fe2cb165c7a416d87e8","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:34:00.158389Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T22:28:12.204856Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12589","snapshot_observed_at":"2026-07-11T22:28:12.204856Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03991","last_updated":"2026-07-04T19:18:53Z","snapshot_observed_at":"2026-08-16T13:11:21.298407Z","submitted_at":"2026-07-04T19:18:53Z","title":"Knowing When to Stop: Predicting Execution-Consistency Convergence in Text-to-SQL","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-11T22:28:12.204856Z"},"links":{"cited_paper":"/paper/2504.12589","citing_paper":"/paper/2607.03991"},"observation_digest":"sha256:59a189deb6a302870ce6a32843539234362ad56eea296d47808e227c1d6f6406","observation_id":"b74be109-94ba-41ca-beb8-3b124780c348","resolution":{"observed_at":"2026-07-11T22:28:12.204856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.12589/citation-record","integrity":"/paper/2504.12589/integrity","json":"/paper/2504.12589/citation-record.json","paper":"/paper/2504.12589"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:00.705145Z","title":"(27) The sample size requirement is given by Equation (11): τ 1√r− 1− 1√r ≤ξ","venue":null,"work_id":"8d965b0d-7010-4fe9-8591-300623309985","year":2020},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.148848Z"},"links":{"citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:48da1691a7878967f991514421f5676af65a21d4c08e02971c1c798075570050","observation_id":"bf70d860-ed25-4812-87b2-3ed3d1183016","resolution":{"observed_at":"2026-08-16T12:34:00.709716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-08-17T11:56:26.482360Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-08-16T12:34:00.009661Z","title":"Lambert, N., Pyatkin, V ., Morrison, J., Miranda, L., Lin, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.009661Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:3d7937c1d6af85eaa4a6ad907dc683d19160b8e8583f39780f15e993b86dc8f3","observation_id":"3bb4f7c7-5569-427d-a7e3-9a8fec855943","resolution":{"observed_at":"2026-08-16T12:34:00.009661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17428","last_updated":"2025-02-25T00:35:18Z","snapshot_observed_at":"2026-08-14T08:11:36.232487Z","submitted_at":"2024-05-27T17:59:45Z","title":"NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17428","snapshot_observed_at":"2026-08-16T12:34:00.014662Z","title":"Lee, H., Phatale, S., Mansoor, H., Mesnard, T., Ferret, J., Lu, K., Bishop, C., Hall, E., Carbune, V ., Rastogi, A., and Prakash, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.014662Z"},"links":{"cited_paper":"/paper/2405.17428","citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:b5c17212a05bf98d9a88632e5b8c6e2d3feccd25e8aff754d2bd15dce6496cb6","observation_id":"cbc37a07-fcfd-4ccb-ae53-c688b16479f7","resolution":{"observed_at":"2026-08-16T12:34:00.014662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-08-15T10:07:24.540946Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00267","snapshot_observed_at":"2026-08-16T12:34:00.019720Z","title":"Li, D., Jiang, B., Huang, L., Beigi, A., Zhao, C., Tan, Z., Bhattacharjee, A., Jiang, Y ., Chen, C., Wu, T., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.019720Z"},"links":{"cited_paper":"/paper/2309.00267","citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:ec5cebc1a66d080c90375d4840a7b0048dba19e29d3348c08dc7e5d72bb4ce56","observation_id":"d8edb0c2-a5d2-495b-aba3-5d3cff7be325","resolution":{"observed_at":"2026-08-16T12:34:00.019720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-17T09:42:34.746112Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-16T12:34:00.024381Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.024381Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:1b737027fbdfd74f9b62b7a361a0fc52fb7b9d38961bd3e3e7d4ad752c902612","observation_id":"06bd8d45-88a3-4da4-97ea-c4696965aa54","resolution":{"observed_at":"2026-08-16T12:34:00.024381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-16T12:34:00.032240Z","title":"Truthfulqa: Measuring how models mimic human falsehoods","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.032240Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:f757b8ad15b54cb6137fb3c9c47025ee3c73c8587731642284d3b8a2c32da42d","observation_id":"b76ae8d5-a902-4731-9870-720adb6532bf","resolution":{"observed_at":"2026-08-16T12:34:00.032240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:00.043609Z","title":"doi: 10.18653/v1/2023.emnlp-main","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.043609Z"},"links":{"citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:c8da40926a546eeba4a6b29aa9e7f58ba38bbdb7b31f42732c0de1cb369d5808","observation_id":"5847f86b-2aaf-4a85-b8a3-1ae1574b39a8","resolution":{"observed_at":"2026-08-16T12:34:00.043609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:00.718808Z","title":"FActScore: Fine-grained atomic evaluation of factual precision in long form text generation","venue":null,"work_id":"9c4ff176-6c46-4c67-8d77-51ac26fb07d4","year":2023},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.057354Z"},"links":{"citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:f5b8f128168f748a36a548f53c5cf7985bd7733cfcb3cf1c155d6066befa4e7a","observation_id":"f9ffea09-1bae-4596-9cdc-82b05858ff58","resolution":{"observed_at":"2026-08-16T12:34:00.723560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:00.062996Z","title":"doi: 10.18653/v1/2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.062996Z"},"links":{"citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:29cd75c6e177cb434ebb333811aee40636d1b117c9e4a4fb6f9795347619163d","observation_id":"d3d22ed5-e705-4ec9-ba03-8a735c34cccb","resolution":{"observed_at":"2026-08-16T12:34:00.062996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10978","last_updated":"2024-02-15T18:31:53Z","snapshot_observed_at":"2026-08-17T18:28:44.698125Z","submitted_at":"2024-02-15T18:31:53Z","title":"Language Models with Conformal Factuality Guarantees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10978","snapshot_observed_at":"2026-08-16T12:34:00.067979Z","title":"Moniri, B., Hassani, H., and Dobriban, E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.067979Z"},"links":{"cited_paper":"/paper/2402.10978","citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:80ee6bb4abcc82a82693d6732c0ef72499b2585eab9f3cb9d23b79989a01e400","observation_id":"9201301e-cdb0-4279-bffe-614215646e9b","resolution":{"observed_at":"2026-08-16T12:34:00.067979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11044","last_updated":"2025-02-07T21:56:40Z","snapshot_observed_at":"2026-08-16T13:42:30.409477Z","submitted_at":"2024-06-16T19:02:31Z","title":"Evaluating the Performance of Large Language Models via Debates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11044","snapshot_observed_at":"2026-08-16T12:34:00.073227Z","title":"OpenAI, Achiam, J., Adler, S., Agarwal, S., Ahmad, L., Akkaya, I., Aleman, F","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.073227Z"},"links":{"cited_paper":"/paper/2406.11044","citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:70b396bd2daffcbb4919233ae9d4d2f64aa0c216c25d118a9ca4d0b7a3374343","observation_id":"78246a18-2786-45dd-9476-49eb94c52a75","resolution":{"observed_at":"2026-08-16T12:34:00.073227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T12:34:00.079774Z","title":"Panickssery, A., Bowman, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.079774Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:19af497de0fa5abf9784ead2103e4a1a3ef8ed1d6c03bd855088733677b0467f","observation_id":"7a4ff0eb-ab4d-46c7-981c-5916480da2c1","resolution":{"observed_at":"2026-08-16T12:34:00.079774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-18T02:44:37.072871Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-16T12:34:00.085776Z","title":"Park, J., Jwa, S., Ren, M., Kim, D., and Choi, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.085776Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:724c8b9b88c4d08ae8aba9ae4f2174c1b1a1c70da2634409978953ba987b0044","observation_id":"8f7d093e-198d-4ee2-8644-3c39a199c128","resolution":{"observed_at":"2026-08-16T12:34:00.085776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06551","last_updated":"2024-10-07T08:49:49Z","snapshot_observed_at":"2026-08-17T18:28:45.283938Z","submitted_at":"2024-07-09T05:16:22Z","title":"OffsetBias: Leveraging Debiased Data for Tuning Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06551","snapshot_observed_at":"2026-08-16T12:34:00.091046Z","title":"Qiu, J., Guo, D., Natalie, P., Noelle, P., Cheri, L., and Henry, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.091046Z"},"links":{"cited_paper":"/paper/2407.06551","citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:a7d6dbc382e9ee68086158606e3eb684944dcc002ed474477987baa02dc2df26","observation_id":"31398427-a194-46fc-9c48-0a2b2dd6c92b","resolution":{"observed_at":"2026-08-16T12:34:00.091046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:00.096283Z","title":"Schoenegger, P., Tuminauskaite, I., Park, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.096283Z"},"links":{"citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:891b0980ed382442de73cd75e0eeb391dc16f2545edd56f73968ac01c17db043","observation_id":"85b054a0-2ca4-44e8-b242-f0e01b558c28","resolution":{"observed_at":"2026-08-16T12:34:00.096283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19379","last_updated":"2024-07-22T13:50:27Z","snapshot_observed_at":"2026-08-16T17:02:16.227612Z","submitted_at":"2024-02-29T17:27:59Z","title":"Wisdom of the Silicon Crowd: LLM Ensemble Prediction Capabilities Rival Human Crowd Accuracy","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19379","snapshot_observed_at":"2026-08-16T12:34:00.100789Z","title":"Shafer, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.100789Z"},"links":{"cited_paper":"/paper/2402.19379","citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:48c858af924241e7e98ec9afbfe04c0e1be5b7946d539232d18d8b2b2473ef9f","observation_id":"53b4fffa-f319-43f8-afa0-e561adddbccb","resolution":{"observed_at":"2026-08-16T12:34:00.100789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17926","last_updated":"2023-08-30T13:22:35Z","snapshot_observed_at":"2026-08-14T09:51:03.197404Z","submitted_at":"2023-05-29T07:41:03Z","title":"Large Language Models are not Fair Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17926","snapshot_observed_at":"2026-08-16T12:34:00.116061Z","title":"org/abs/2305.17926","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.116061Z"},"links":{"cited_paper":"/paper/2305.17926","citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:dced21f8bd07289750cd05ca7d4b960c4ab592738d58ecb10e47c46a67fe272e","observation_id":"7a085280-c85d-401f-9952-870169be5145","resolution":{"observed_at":"2026-08-16T12:34:00.116061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02666","last_updated":"2024-08-08T17:09:58Z","snapshot_observed_at":"2026-08-16T13:28:23.560818Z","submitted_at":"2024-08-05T17:57:02Z","title":"Self-Taught Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02666","snapshot_observed_at":"2026-08-16T12:34:00.121097Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.121097Z"},"links":{"cited_paper":"/paper/2408.02666","citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:3c2bfa0b3f4b798faca2c0f80c91c8174f22d08dd1594bf675861f47c8038e27","observation_id":"2283103e-e3a2-4c63-a7f5-953e8a858284","resolution":{"observed_at":"2026-08-16T12:34:00.121097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19594","last_updated":"2024-07-30T01:38:06Z","snapshot_observed_at":"2026-08-16T13:30:25.003501Z","submitted_at":"2024-07-28T21:58:28Z","title":"Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19594","snapshot_observed_at":"2026-08-16T12:34:00.125136Z","title":"Yadkori, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.125136Z"},"links":{"cited_paper":"/paper/2407.19594","citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:ee2eee21712aec1788cdde861ce9886ef2f1a2daf6b1e3cf09166c7939799ed1","observation_id":"9da31557-7804-4ab7-b421-64b3335b8797","resolution":{"observed_at":"2026-08-16T12:34:00.125136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01563","last_updated":"2024-04-04T11:32:03Z","snapshot_observed_at":"2026-08-16T14:03:40.226273Z","submitted_at":"2024-04-04T11:32:03Z","title":"Mitigating LLM Hallucinations via Conformal Abstention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01563","snapshot_observed_at":"2026-08-16T12:34:00.129391Z","title":"Yang, A., Yang, B., Zhang, B., Hui, B., Zheng, B., Yu, B., Li, C., Liu, D., Huang, F., Wei, H., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.129391Z"},"links":{"cited_paper":"/paper/2405.01563","citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:d210ded38eb53bd29e91ea87c4158abe29b8d027c294eb5acc590414913f9f21","observation_id":"1f7f3b40-ec5c-4715-a0fe-3eb8a0980c30","resolution":{"observed_at":"2026-08-16T12:34:00.129391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10019","last_updated":"2024-10-05T06:50:15Z","snapshot_observed_at":"2026-08-18T12:47:10.257853Z","submitted_at":"2024-01-18T14:40:46Z","title":"R-Judge: Benchmarking Safety Risk Awareness for LLM Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10019","snapshot_observed_at":"2026-08-16T12:34:00.135394Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.135394Z"},"links":{"cited_paper":"/paper/2401.10019","citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:50c93031598cf30573237839b8dd2f7b48f52c8078fac2aa6026492d672abd93","observation_id":"a075c498-a3cf-41dc-a4a9-caa259132990","resolution":{"observed_at":"2026-08-16T12:34:00.135394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07301","last_updated":"2025-06-05T16:34:24Z","snapshot_observed_at":"2026-08-17T12:00:23.281116Z","submitted_at":"2025-01-13T13:10:16Z","title":"The Lessons of Developing Process Reward Models in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07301","snapshot_observed_at":"2026-08-16T12:34:00.139625Z","title":"Zhao, R., Zhang, W., Chia, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.139625Z"},"links":{"cited_paper":"/paper/2501.07301","citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:ae296d3fdc3f7c0af5f854eca6e35cb689625bafe9885d987bf78764c01842dc","observation_id":"86695c75-741b-4859-bafb-cd4effaa6fb8","resolution":{"observed_at":"2026-08-16T12:34:00.139625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14317","last_updated":"2024-01-22T17:06:50Z","snapshot_observed_at":"2026-08-17T18:28:43.963104Z","submitted_at":"2023-04-27T16:38:17Z","title":"ICE-Score: Instructing Large Language Models to Evaluate Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14317","snapshot_observed_at":"2026-08-16T12:34:00.143975Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.143975Z"},"links":{"cited_paper":"/paper/2304.14317","citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:36408c6c2c3781804ee4ba56b9cc2f10e5fb8e654f065ffaeab483620de767ab","observation_id":"20dbed31-fcad-48d2-b902-ca0470c3d8d3","resolution":{"observed_at":"2026-08-16T12:34:00.143975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:00.691352Z","title":null,"venue":null,"work_id":"20dbdf26-3708-4103-aee0-c9d0c6767cf8","year":2024},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.154036Z"},"links":{"citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:23dd0f69a192af791e019ecf83d4606576e983c09cb946e8a0aac9cda69e7c66","observation_id":"fb9ed3d8-2591-435a-87b7-dcfea60548db","resolution":{"observed_at":"2026-08-16T12:34:00.695396Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:00.675241Z","title":"Throughout all the experiments, the sampling temperature of all LLMs is set to","venue":null,"work_id":"be71eadb-9616-4b62-8f12-a2e3db51bc4b","year":2024},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.158389Z"},"links":{"citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:6b00670b34ee8e6f587cd50eb8d247c4f4143aef4c80da5581bf80df9a3168b2","observation_id":"f74fc53d-f39d-441f-8f12-78416841d579","resolution":{"observed_at":"2026-08-16T12:34:00.681422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07070","last_updated":"2024-06-11T08:56:18Z","snapshot_observed_at":"2026-08-17T18:28:43.797515Z","submitted_at":"2024-06-11T08:56:18Z","title":"HalluDial: A Large-Scale Benchmark for Automatic Dialogue-Level Hallucination Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07070","snapshot_observed_at":"2026-08-16T12:34:00.050576Z","title":"emnlp-main.153/","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":153,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.050576Z"},"links":{"cited_paper":"/paper/2406.07070","citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:52690d9c91f95ce9c5b99a18dc6200e7fc640fa0b24ef37744d472324bafd8be","observation_id":"875b74ba-a9cf-4f04-b85f-403f733c36e2","resolution":{"observed_at":"2026-08-16T12:34:00.050576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:33:59.985921Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":1996,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:59.985921Z"},"links":{"citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:fcfb5a7f3f4baa77d8fd04a13beff187ae0fb62f08040ce5c8981bba49a5352b","observation_id":"52fc39ef-4a47-4bdd-aa86-17a467626918","resolution":{"observed_at":"2026-08-16T12:33:59.985921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-16T12:34:00.106381Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.106381Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:928dd2307d040472da7320d83ccd09fa5e0fa9ccb8bb0f7a5aabd415294440e4","observation_id":"33163599-9675-4b96-bdcc-fcdc81db52f1","resolution":{"observed_at":"2026-08-16T12:34:00.106381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T12:33:59.999096Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:59.999096Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:0b0bdbf7dbc931ccc9990260fd60f07d1fad90a0509b9559c32ca0a3c895810c","observation_id":"e86a87c7-768a-40d6-9a55-d790fa32dd44","resolution":{"observed_at":"2026-08-16T12:33:59.999096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-12T16:46:46.561976Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-16T12:33:59.990167Z","title":"Internlm2 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:59.990167Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:68c2def163a5acbc22feea00488de0703ba9c6b1cdb0d985acfafa9624ac01d3","observation_id":"309a2d6b-5da1-46a0-b356-8214f5ce8161","resolution":{"observed_at":"2026-08-16T12:33:59.990167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:34:00.731977Z","title":"G-eval: NLG evaluation using gpt-4 with better human alignment","venue":null,"work_id":"af747ea6-ad29-418b-b673-e76c662f07e6","year":2023},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.038153Z"},"links":{"citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:2b39bda4a0300d4c28c9a1e884091a7773c004ed5f98700d78ca88c264a6a274","observation_id":"817a8913-855b-45f5-8bc3-945a044be0bf","resolution":{"observed_at":"2026-08-16T12:34:00.738775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12784","last_updated":"2025-04-05T00:07:35Z","snapshot_observed_at":"2026-07-31T04:18:41.491400Z","submitted_at":"2024-10-16T17:58:19Z","title":"JudgeBench: A Benchmark for Evaluating LLM-based Judges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12784","snapshot_observed_at":"2026-08-16T12:34:00.111101Z","title":"Y ., Cuadron, A., Wang, C., Popa, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.111101Z"},"links":{"cited_paper":"/paper/2410.12784","citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:2bf63c926d33e3ee78f2de013b60dbd657f5bfe096cf668756a8a0d6c1c107f4","observation_id":"64f17eec-0726-43e2-ba53-51d018b0c395","resolution":{"observed_at":"2026-08-16T12:34:00.111101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.02814","last_updated":"2025-06-13T18:38:23Z","snapshot_observed_at":"2026-08-16T16:41:06.898140Z","submitted_at":"2022-08-04T17:59:44Z","title":"Conformal Risk Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.02814","snapshot_observed_at":"2026-08-16T12:33:59.980861Z","title":"Austen-Smith, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:59.980861Z"},"links":{"cited_paper":"/paper/2208.02814","citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:6f56492d33cff74ef84bd3c00b4e7b19fe4ddaf42f1bfac3021d4e22642ec218","observation_id":"bdc249c8-6a88-4e39-8fc1-5a439992fbf0","resolution":{"observed_at":"2026-08-16T12:33:59.980861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-16T12:34:00.004913Z","title":"org/abs/2404.04475","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T12:34:00.004913Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:f161826ff2109547b96608ac74a408f0162ba1a6795429fa750b52bcf2d69eca","observation_id":"463f6fea-99d0-49e3-a546-a1ab89c49fc3","resolution":{"observed_at":"2026-08-16T12:34:00.004913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10970","last_updated":"2025-08-08T06:36:34Z","snapshot_observed_at":"2026-08-17T18:24:02.701027Z","submitted_at":"2025-01-19T07:09:11Z","title":"The Alternative Annotator Test for LLM-as-a-Judge: How to Statistically Justify Replacing Human Annotators with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10970","snapshot_observed_at":"2026-08-16T12:33:59.994553Z","title":"Chen, B., Wang, X., Peng, S., Litschko, R., Korho- nen, A., and Plank, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:59.994553Z"},"links":{"cited_paper":"/paper/2501.10970","citing_paper":"/paper/2504.12589"},"observation_digest":"sha256:39001f743a82344088e9b778b44ecc60ac58adffb562527da07f9edcbd00a50c","observation_id":"cc5ef465-76d9-4980-86fa-9925ba4ad169","resolution":{"observed_at":"2026-08-16T12:33:59.994553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.12589","last_updated":"2025-04-17T02:08:51Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T18:25:04.283265Z","submitted_at":"2025-04-17T02:08:51Z","title":"Efficient MAP Estimation of LLM Judgment Performance with Prior Transfer"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 1 inbound Pith citation observation for arXiv:2504.12589."}