{"as_of":"2026-08-09T10:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b8497c38b11464d776f68de13b4f1711f6293d18439c9ab843e3bbb6736d9dd0","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:26:03.842968Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-07T12:53:50.367532Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":"2309.17012","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-07-07T12:53:50.367532Z","title":"I., Kim, Z","venue":"cs.CL","work_id":"4ade443e-5ed6-40cd-8063-e42ffa273080","year":2023},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-07-06T18:02:53.240463Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:05727111bd8c5c06e35f60492113ac2202464d68141e5a2a380df91314865b8d","observation_id":"f899883b-0a27-470b-8d38-f46471bf40bf","resolution":{"observed_at":"2026-05-22T18:44:28.816877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":"2309.17012","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-07-07T12:53:50.367532Z","title":"I., Kim, Z","venue":"cs.CL","work_id":"4ade443e-5ed6-40cd-8063-e42ffa273080","year":2023},"citing_paper":{"arxiv_id":"2404.19737","last_updated":"2024-04-30T17:33:57Z","snapshot_observed_at":"2026-08-03T23:22:09.849239Z","submitted_at":"2024-04-30T17:33:57Z","title":"Better & Faster Large Language Models via Multi-token Prediction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T12:26:09.731664Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2404.19737"},"observation_digest":"sha256:3882a676bd7da8ef2f2b410d344f9810ca206e219beae574c87a0bd0dbce8536","observation_id":"ab7b2c8e-08ff-4d0d-838d-9aed89e9baa7","resolution":{"observed_at":"2026-05-16T12:26:09.810803Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":"2309.17012","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-07-07T12:53:50.367532Z","title":"I., Kim, Z","venue":"cs.CL","work_id":"4ade443e-5ed6-40cd-8063-e42ffa273080","year":2023},"citing_paper":{"arxiv_id":"2410.20791","last_updated":"2026-04-06T19:29:25Z","snapshot_observed_at":"2026-08-03T01:41:19.546733Z","submitted_at":"2024-10-28T07:16:00Z","title":"From Cool Demos to Production-Ready FMware: Core Challenges and a Technology Roadmap","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-23T19:07:21.016824Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2410.20791"},"observation_digest":"sha256:9cd6dedfb6cca1e27c8efb7e81f6d8f0cb85abca7bb2f8f7bf45240764a46c2b","observation_id":"fc4e8733-be44-49d0-9fec-7d700a4c89f8","resolution":{"observed_at":"2026-05-23T19:08:20.988267Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":"2309.17012","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-07-07T12:53:50.367532Z","title":"I., Kim, Z","venue":"cs.CL","work_id":"4ade443e-5ed6-40cd-8063-e42ffa273080","year":2023},"citing_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-23T17:33:13.394338Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2411.15594"},"observation_digest":"sha256:7a0c04ddf468bd4b5df5c9ff8f4179f03de4607123a75bb76e82dc7ee21392a6","observation_id":"5a3abb5e-cfdd-4880-860c-93fc57e331bd","resolution":{"observed_at":"2026-05-23T17:35:44.032235Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":"2309.17012","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-07-07T12:53:50.367532Z","title":"I., Kim, Z","venue":"cs.CL","work_id":"4ade443e-5ed6-40cd-8063-e42ffa273080","year":2023},"citing_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-07-31T01:42:39.468673Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"reference_index":116,"source":"pdf_text","source_observed_at":"2026-05-11T23:08:34.312466Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2412.05579"},"observation_digest":"sha256:327b2e5942706a4bc82d5bdd1229728780a584903de4578033e93c5c156397bc","observation_id":"9e50b7f7-7e23-4f03-9e13-a8302fd0db5b","resolution":{"observed_at":"2026-05-11T23:08:37.018788Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-08-07T11:26:03.842968Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02592","last_updated":"2025-06-03T08:12:47Z","snapshot_observed_at":"2026-08-07T15:19:01.070855Z","submitted_at":"2025-06-03T08:12:47Z","title":"Beyond the Surface: Measuring Self-Preference in LLM Judgments","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:03.842968Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2506.02592"},"observation_digest":"sha256:da55cf44052ce3f419e80d8eeb85690269a2f828969e7022fcdde24fd33b848e","observation_id":"2f4d8d5a-931a-4bb6-81bc-60471a111347","resolution":{"observed_at":"2026-08-07T11:26:03.842968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-08-07T04:13:17.718512Z","title":"Benchmarking cognitive biases in large language models as evaluators, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11440","last_updated":"2025-06-13T03:38:29Z","snapshot_observed_at":"2026-08-07T04:06:34.003190Z","submitted_at":"2025-06-13T03:38:29Z","title":"AbsenceBench: Language Models Can't Tell What's Missing","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T04:13:17.718512Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2506.11440"},"observation_digest":"sha256:c6db4c5657991d6a9f9fb2c66cd4b677d5ec9c5f5ec63b7232a89a22bddd339a","observation_id":"6c134385-792b-4c51-9ea6-155b1800f4e3","resolution":{"observed_at":"2026-08-07T04:13:17.718512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-08-06T19:01:31.053765Z","title":"Boyi Li, Philipp Wu, Pieter Abbeel, and Jitendra Malik","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08037","last_updated":"2025-07-09T11:40:24Z","snapshot_observed_at":"2026-08-06T18:52:39.220996Z","submitted_at":"2025-07-09T11:40:24Z","title":"CRISP: Complex Reasoning with Interpretable Step-based Plans","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T19:01:31.053765Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2507.08037"},"observation_digest":"sha256:da5b7ddfaecff2bca6f1d7d0bfa32bf87fa58bfe85de207379753bc3d639bb4d","observation_id":"4568b5f1-b150-4c37-96a1-ad7f735d3388","resolution":{"observed_at":"2026-08-06T19:01:31.053765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-08-06T11:45:41.064778Z","title":"Benchmarking cognitive biases in large language models as evaluators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00923","last_updated":"2026-07-15T15:41:30Z","snapshot_observed_at":"2026-08-06T14:26:51.797479Z","submitted_at":"2025-07-30T08:44:22Z","title":"Addressing Benchmarking Gaps in Large Language Models for Health and Medicine with Dynamic Red-Teaming","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T11:45:41.064778Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2508.00923"},"observation_digest":"sha256:2ec6cd28cf2e633c94121512e5c9a36ba3df6fbde125b7b12db5cf79b50fefe9","observation_id":"602d4ffe-c342-4bef-9e26-f28960e02120","resolution":{"observed_at":"2026-08-06T11:45:41.064778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-08-05T22:40:42.206258Z","title":"Bench- marking cognitive biases in large language models as evaluators.arXiv preprint arXiv:2309.17012 ,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-09T02:04:42.987019Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.206258Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:8df58f6a7caf6b839f4e9d88aef9396d3ddfdf52c867a66128d50830ac931603","observation_id":"44abe90e-85c8-43a4-9e08-15a1b0802d92","resolution":{"observed_at":"2026-08-05T22:40:42.206258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-08-05T21:55:58.213182Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07805","last_updated":"2025-08-11T09:45:02Z","snapshot_observed_at":"2026-08-07T10:05:08.818969Z","submitted_at":"2025-08-11T09:45:02Z","title":"Can You Trick the Grader? Adversarial Persuasion of LLM Judges","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T21:55:58.213182Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2508.07805"},"observation_digest":"sha256:94e9072118034c7162987471bfc9f7d78ff5c7b5236dc047005ee2e74cb440c5","observation_id":"a1b445b0-1406-4459-b511-3d2c5ce62956","resolution":{"observed_at":"2026-08-05T21:55:58.213182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-08-05T05:01:36.732735Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators.ArXiv, 2309.17012, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05786","last_updated":"2025-09-06T17:42:22Z","snapshot_observed_at":"2026-08-08T09:14:25.199933Z","submitted_at":"2025-09-06T17:42:22Z","title":"Effectively obtaining acoustic, visual and textual data from videos","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T05:01:36.732735Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2509.05786"},"observation_digest":"sha256:ccc06094c675658535a2ebacdc5c9945a48d3f76936a87f00eb2cd245e2b33d9","observation_id":"4e1e2dec-7704-4b8c-935e-200e8f2c817e","resolution":{"observed_at":"2026-08-05T05:01:36.732735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-08-04T21:25:26.892235Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators.ArXiv, 2309.17012, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09717","last_updated":"2025-09-09T18:57:10Z","snapshot_observed_at":"2026-08-08T11:56:25.298917Z","submitted_at":"2025-09-09T18:57:10Z","title":"Testing chatbots on the creation of encoders for audio conditioned image generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T21:25:26.892235Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2509.09717"},"observation_digest":"sha256:8623565f7ca3401eaefd38b2b9fe7fbbc1d0870df8c2adeffd28f086c838d216","observation_id":"e4a5ec78-d9dc-4d66-ba76-3f0446d240da","resolution":{"observed_at":"2026-08-04T21:25:26.892235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":"2309.17012","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-07-07T12:53:50.367532Z","title":"I., Kim, Z","venue":"cs.CL","work_id":"4ade443e-5ed6-40cd-8063-e42ffa273080","year":2023},"citing_paper":{"arxiv_id":"2604.06996","last_updated":"2026-08-03T11:57:08Z","snapshot_observed_at":"2026-08-06T23:31:00.952449Z","submitted_at":"2026-04-08T12:13:53Z","title":"Self-Preference Bias in Rubric-Based Evaluation of Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T18:18:19.955943Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2604.06996"},"observation_digest":"sha256:844801a02d5544f822b9df362e5fe246ac4d33bfe01d5c1aded226042a8beb08","observation_id":"038f4fa5-de01-4194-bad5-b298963f42eb","resolution":{"observed_at":"2026-05-11T00:50:50.481371Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-08-02T16:40:55.426512Z","title":"Benchmarking cognitive biases in large language models as evaluators.arXiv preprint arXiv:2309.17012,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.06996","last_updated":"2026-08-03T11:57:08Z","snapshot_observed_at":"2026-08-06T23:31:00.952449Z","submitted_at":"2026-04-08T12:13:53Z","title":"Self-Preference Bias in Rubric-Based Evaluation of Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T16:40:55.426512Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2604.06996"},"observation_digest":"sha256:0b71f9180d35d1bc5d2760efe4820f8a9b247e91c77beaae68ff6df6dbe97ca1","observation_id":"b59a23e2-396e-4e0c-a714-32830efcc736","resolution":{"observed_at":"2026-08-02T16:40:55.426512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-08-04T05:36:43.332913Z","title":"Benchmarking cognitive biases in large language models as evaluators.arXiv preprint arXiv:2309.17012,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.06996","last_updated":"2026-08-03T11:57:08Z","snapshot_observed_at":"2026-08-06T23:31:00.952449Z","submitted_at":"2026-04-08T12:13:53Z","title":"Self-Preference Bias in Rubric-Based Evaluation of Large Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T05:36:43.332913Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2604.06996"},"observation_digest":"sha256:5d576c6221f55239af06f399ae72e442c7333a3baf6624ca51d8c69b157febfa","observation_id":"8ed94691-671b-45a0-9090-854487c94667","resolution":{"observed_at":"2026-08-04T05:36:43.332913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":"2309.17012","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-07-07T12:53:50.367532Z","title":"I., Kim, Z","venue":"cs.CL","work_id":"4ade443e-5ed6-40cd-8063-e42ffa273080","year":2023},"citing_paper":{"arxiv_id":"2604.15302","last_updated":"2026-04-16T17:58:21Z","snapshot_observed_at":"2026-08-04T23:34:28.740321Z","submitted_at":"2026-04-16T17:58:21Z","title":"Diagnosing LLM Judge Reliability: Conformal Prediction Sets and Transitivity Violations","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-10T10:41:21.406201Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2604.15302"},"observation_digest":"sha256:0b5b6c978121e25aba782235974c840a14f598979c45278c7141e6e454f40239","observation_id":"38c552b8-0b23-44f9-86b9-13366418ef4a","resolution":{"observed_at":"2026-05-10T10:44:37.607656Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":"2309.17012","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-07-07T12:53:50.367532Z","title":"I., Kim, Z","venue":"cs.CL","work_id":"4ade443e-5ed6-40cd-8063-e42ffa273080","year":2023},"citing_paper":{"arxiv_id":"2604.23178","last_updated":"2026-06-24T13:27:28Z","snapshot_observed_at":"2026-08-08T12:19:05.889262Z","submitted_at":"2026-04-25T07:18:30Z","title":"Judging the Judges: A Systematic Evaluation of Bias Mitigation Strategies in LLM-as-a-Judge Pipelines","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T08:14:18.535385Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2604.23178"},"observation_digest":"sha256:811060d303a69fc41966a909241b69610505f30c8700d20b10bca0f7ebde0cff","observation_id":"2ffbd726-6c6a-476d-9f0e-873e74becc45","resolution":{"observed_at":"2026-05-11T20:41:13.976357Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":"2309.17012","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-07-07T12:53:50.367532Z","title":"I., Kim, Z","venue":"cs.CL","work_id":"4ade443e-5ed6-40cd-8063-e42ffa273080","year":2023},"citing_paper":{"arxiv_id":"2605.02765","last_updated":"2026-05-04T16:05:40Z","snapshot_observed_at":"2026-07-06T23:15:46.390406Z","submitted_at":"2026-05-04T16:05:40Z","title":"U-Define: Designing User Workflows for Hard and Soft Constraints in LLM-Based Planning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-08T18:19:55.849451Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2605.02765"},"observation_digest":"sha256:9d3ec7311f64def5b3f26a017daf5d9d2a1360e88d4a947622dffd6391d1f533","observation_id":"e1a4976e-a1e9-4a7e-94f5-0d076211b651","resolution":{"observed_at":"2026-05-09T06:35:39.077576Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":"2309.17012","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-07-07T12:53:50.367532Z","title":"I., Kim, Z","venue":"cs.CL","work_id":"4ade443e-5ed6-40cd-8063-e42ffa273080","year":2023},"citing_paper":{"arxiv_id":"2605.17554","last_updated":"2026-06-25T15:53:39Z","snapshot_observed_at":"2026-08-02T10:05:30.262076Z","submitted_at":"2026-05-17T17:32:52Z","title":"Evaluating Deep Research Agents on Expert Consulting Work: A Benchmark with Verifiers, Rubrics, and Cognitive Traps","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T12:32:22.536994Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2605.17554"},"observation_digest":"sha256:06d35284c27162d87fa470a55965019840d5dc811807f6f6af29677ca8d2defd","observation_id":"66475279-6144-48ed-9d7e-c63011334597","resolution":{"observed_at":"2026-05-20T12:33:16.779705Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":"2309.17012","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-07-07T12:53:50.367532Z","title":"I., Kim, Z","venue":"cs.CL","work_id":"4ade443e-5ed6-40cd-8063-e42ffa273080","year":2023},"citing_paper":{"arxiv_id":"2605.27914","last_updated":"2026-06-09T02:24:01Z","snapshot_observed_at":"2026-07-06T23:37:36.244456Z","submitted_at":"2026-05-27T03:41:11Z","title":"Does Capability Transfer to Subjective Behavior -- and Would Our Instruments Tell Us? A Self-Evolving, Trust-by-Construction Evaluation Paradigm","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-29T12:54:36.818698Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2605.27914"},"observation_digest":"sha256:9a4664de7d84bc93a266c24c690c05c8eca8990aa22680018e061131e2f5b2df","observation_id":"8bbb5c07-bfda-4855-9660-e75ed527d963","resolution":{"observed_at":"2026-06-29T13:03:26.715349Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":"2309.17012","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-07-07T12:53:50.367532Z","title":"I., Kim, Z","venue":"cs.CL","work_id":"4ade443e-5ed6-40cd-8063-e42ffa273080","year":2023},"citing_paper":{"arxiv_id":"2605.27921","last_updated":"2026-05-27T03:47:25Z","snapshot_observed_at":"2026-08-01T16:37:35.607510Z","submitted_at":"2026-05-27T03:47:25Z","title":"Show, Don't TELL: Explainable AI-Generated Text Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T12:56:04.003337Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2605.27921"},"observation_digest":"sha256:74cb1639914e9ac6d9a86fe82b184338c3c81d43ae0577f0a90cbc4622f173ae","observation_id":"fb9f1fd1-16a0-48c7-81b5-28a198b0db93","resolution":{"observed_at":"2026-06-29T13:03:26.555612Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":"2309.17012","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-07-07T12:53:50.367532Z","title":"I., Kim, Z","venue":"cs.CL","work_id":"4ade443e-5ed6-40cd-8063-e42ffa273080","year":2023},"citing_paper":{"arxiv_id":"2606.30556","last_updated":"2026-06-29T16:51:31Z","snapshot_observed_at":"2026-08-07T13:43:00.994295Z","submitted_at":"2026-06-29T16:51:31Z","title":"Poller: Are LLMs Suitable for Evaluating the Poetry Understanding Task?","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-30T05:59:58.183264Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2606.30556"},"observation_digest":"sha256:a00dd9cf1eb4c4ec0ef083d29c4f9196fc5e8bc4ff1576b5927bdb977ab7c656","observation_id":"50aad0d0-743e-43ca-9fad-4a0f00ca67f3","resolution":{"observed_at":"2026-06-30T06:04:21.556059Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":"2309.17012","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-07-07T12:53:50.367532Z","title":"I., Kim, Z","venue":"cs.CL","work_id":"4ade443e-5ed6-40cd-8063-e42ffa273080","year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-07T12:47:29.552283Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:619a9d4635e7aec9af513ee233b3c8ba887ac691b783c42c0835f8cfc12335c3","observation_id":"1892a6d9-f0ed-461b-86c8-9c57c92a65c1","resolution":{"observed_at":"2026-07-07T12:53:50.369284Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Benchmarking cognitive biases in large language models as evaluators, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:f97651de5cf7910eede6b5c2139000c0834f564a68c8a9bcdd3e87d9e3b9c216","observation_id":"c9b73bbf-03de-4ba3-b178-d538abc065d4","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-07-14T06:40:17.865408Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11151","last_updated":"2026-07-13T06:46:56Z","snapshot_observed_at":"2026-07-16T23:19:13.693221Z","submitted_at":"2026-07-13T06:46:56Z","title":"AMT-X: Phase-Structured Multi-Turn Red-Teaming with Checklist-Gated Evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T06:40:17.865408Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2607.11151"},"observation_digest":"sha256:42478f7a49aa0dcd2ab28813f3c8e45178ea76e0d768b0eb01c6e6a685fd5805","observation_id":"cb7ec13a-8c12-44aa-9f13-a015ba53d632","resolution":{"observed_at":"2026-07-14T06:40:17.865408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-07-14T02:33:34.084111Z","title":"Findings of the Association for Computational Linguistics: ACL 2024 , year=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11871","last_updated":"2026-07-13T17:55:19Z","snapshot_observed_at":"2026-08-05T16:49:44.432361Z","submitted_at":"2026-07-13T17:55:19Z","title":"Inside the Unfair Judge: A Mechanistic Interpretability Account of LLM-as-Judge Bias","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-14T02:33:34.084111Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2607.11871"},"observation_digest":"sha256:4a53c84465b0dc2d40b6770fa654846fd675b908449bb9c6edcce16ce033a034","observation_id":"2cb7b65c-3a5a-4d79-9294-95f4a01daa4d","resolution":{"observed_at":"2026-07-14T02:33:34.084111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-08-02T16:42:05.597565Z","title":"arXiv preprint arXiv:2309.17012 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20425","last_updated":"2026-04-07T13:29:12Z","snapshot_observed_at":"2026-08-07T13:27:00.639711Z","submitted_at":"2026-04-07T13:29:12Z","title":"What is Good? Extracting and Testing Implicit Theories of Literary Quality from LLM Reasoning Traces","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-02T16:42:05.597565Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2607.20425"},"observation_digest":"sha256:1b63f1b8a4dfa36e0caa2490e8c865abbec979393ebbc8e8e46de550dba3987a","observation_id":"48c6a736-6094-48ba-be94-2cf8e6e86dbc","resolution":{"observed_at":"2026-08-02T16:42:05.597565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2309.17012/citation-record","integrity":"/paper/2309.17012/integrity","json":"/paper/2309.17012/citation-record.json","paper":"/paper/2309.17012"},"outbound":[],"paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T16:25:21.571679Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 28 inbound Pith citation observations for arXiv:2309.17012."}