{"as_of":"2026-08-09T13:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9babfabdd7e671c33c05d855ba9d1dcd9d40c19b6a100560c37089239b907e87","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T17:15:27.898978Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T12:47:37.888316Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.11026","last_updated":"2025-09-14T01:33:14Z","snapshot_observed_at":"2026-08-07T23:35:39.492240Z","submitted_at":"2025-09-14T01:33:14Z","title":"Rethinking Human Preference Evaluation of LLM Rationales","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.11026","snapshot_observed_at":"2026-08-01T12:47:37.888316Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19338","last_updated":"2026-07-30T18:56:15Z","snapshot_observed_at":"2026-08-05T23:11:03.030949Z","submitted_at":"2026-07-21T17:56:49Z","title":"CodeRescue: Budget-Calibrated Recovery Routing for Coding Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T12:47:37.888316Z"},"links":{"cited_paper":"/paper/2509.11026","citing_paper":"/paper/2607.19338"},"observation_digest":"sha256:67fe37b38ff5c2ce6049c597aa438de1c99bc48029652a193a6744e649b090e8","observation_id":"50e6b86a-e429-4e72-a484-99f4ea2e78e5","resolution":{"observed_at":"2026-08-01T12:47:37.888316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.11026/citation-record","integrity":"/paper/2509.11026/integrity","json":"/paper/2509.11026/citation-record.json","paper":"/paper/2509.11026"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2210.04982","last_updated":"2023-06-02T15:27:46Z","snapshot_observed_at":"2026-07-06T14:03:17.645948Z","submitted_at":"2022-10-10T19:31:30Z","title":"REV: Information-Theoretic Evaluation of Free-Text Rationales","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.04982","snapshot_observed_at":"2026-08-04T17:15:27.861042Z","title":"org/abs/2210.04982","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.11026","last_updated":"2025-09-14T01:33:14Z","snapshot_observed_at":"2026-08-07T23:35:39.492240Z","submitted_at":"2025-09-14T01:33:14Z","title":"Rethinking Human Preference Evaluation of LLM Rationales","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T17:15:27.861042Z"},"links":{"cited_paper":"/paper/2210.04982","citing_paper":"/paper/2509.11026"},"observation_digest":"sha256:2e8d730939e574d96d5c741eed8d25c6522179b908e60eb477cf96b0beae4638","observation_id":"178274f0-4833-4e24-b46d-ebaa34776a55","resolution":{"observed_at":"2026-08-04T17:15:27.861042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03741","last_updated":"2023-02-17T17:00:34Z","snapshot_observed_at":"2026-08-03T14:31:51.401500Z","submitted_at":"2017-06-12T17:23:59Z","title":"Deep reinforcement learning from human preferences","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03741","snapshot_observed_at":"2026-08-04T17:15:27.866035Z","title":"Paul F Christiano, Jan Leike, Tom Brown, Miljan Martic, Shane Legg, and Dario Amodei","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.11026","last_updated":"2025-09-14T01:33:14Z","snapshot_observed_at":"2026-08-07T23:35:39.492240Z","submitted_at":"2025-09-14T01:33:14Z","title":"Rethinking Human Preference Evaluation of LLM Rationales","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T17:15:27.866035Z"},"links":{"cited_paper":"/paper/1706.03741","citing_paper":"/paper/2509.11026"},"observation_digest":"sha256:f8d5c2ff8a68ccbb84325f2a09d45cf15da54f9552e8826eef694e03e57cb3da","observation_id":"05322b96-4ea8-4209-8bb7-3085c46d7962","resolution":{"observed_at":"2026-08-04T17:15:27.866035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07919","last_updated":"2023-09-12T15:08:46Z","snapshot_observed_at":"2026-07-06T14:31:03.189108Z","submitted_at":"2022-12-15T15:52:39Z","title":"ROSCOE: A Suite of Metrics for Scoring Step-by-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07919","snapshot_observed_at":"2026-08-04T17:15:27.868447Z","title":"Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Ruoyu Zhang, Runxin Xu, Qihao Zhu, Shirong Ma, Peiyi Wang, Xiao Bi, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.11026","last_updated":"2025-09-14T01:33:14Z","snapshot_observed_at":"2026-08-07T23:35:39.492240Z","submitted_at":"2025-09-14T01:33:14Z","title":"Rethinking Human Preference Evaluation of LLM Rationales","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T17:15:27.868447Z"},"links":{"cited_paper":"/paper/2212.07919","citing_paper":"/paper/2509.11026"},"observation_digest":"sha256:bb5cf193cafbf11f4d3eb191a6b5c55d78a6e38d7da10bbe6f962e8e1e0a84f2","observation_id":"4a6dd9a8-749d-476d-b2fd-8ef1e599dc4a","resolution":{"observed_at":"2026-08-04T17:15:27.868447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07095","last_updated":"2023-05-11T19:01:13Z","snapshot_observed_at":"2026-07-06T15:26:14.741268Z","submitted_at":"2023-05-11T19:01:13Z","title":"Are Machine Rationales (Not) Useful to Humans? Measuring and Improving Human Utility of Free-Text Rationales","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07095","snapshot_observed_at":"2026-08-04T17:15:27.875563Z","title":"org/abs/2305.07095","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11026","last_updated":"2025-09-14T01:33:14Z","snapshot_observed_at":"2026-08-07T23:35:39.492240Z","submitted_at":"2025-09-14T01:33:14Z","title":"Rethinking Human Preference Evaluation of LLM Rationales","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T17:15:27.875563Z"},"links":{"cited_paper":"/paper/2305.07095","citing_paper":"/paper/2509.11026"},"observation_digest":"sha256:20ebd4df4f6e4bad052d6fbeeb881b509b0973d82dcd01c5918d75fcf9926230","observation_id":"71f6839e-b693-4227-8801-8a1b6fb6d790","resolution":{"observed_at":"2026-08-04T17:15:27.875563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-08-08T06:58:44.493777Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-04T17:15:27.882256Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.11026","last_updated":"2025-09-14T01:33:14Z","snapshot_observed_at":"2026-08-07T23:35:39.492240Z","submitted_at":"2025-09-14T01:33:14Z","title":"Rethinking Human Preference Evaluation of LLM Rationales","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T17:15:27.882256Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2509.11026"},"observation_digest":"sha256:4eebd16dd2cd068e81a3ea820943995ef2db3e8a50a2d0edac5b138b3a37bcae","observation_id":"2996221c-3aa0-4582-8b8d-822dc2b55ca9","resolution":{"observed_at":"2026-08-04T17:15:27.882256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:15:27.884639Z","title":"Long Ouyang, Jeffrey Wu, Xu Jiang, Diogo Almeida, Carroll Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11026","last_updated":"2025-09-14T01:33:14Z","snapshot_observed_at":"2026-08-07T23:35:39.492240Z","submitted_at":"2025-09-14T01:33:14Z","title":"Rethinking Human Preference Evaluation of LLM Rationales","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T17:15:27.884639Z"},"links":{"citing_paper":"/paper/2509.11026"},"observation_digest":"sha256:f0ecbd433652b6561e12a42329df18f8614ffdb8e6bca4f3f65686ad9e89e18f","observation_id":"d60bde18-2647-4359-b013-92f3d56a5127","resolution":{"observed_at":"2026-08-04T17:15:27.884639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10703","last_updated":"2023-11-30T23:33:07Z","snapshot_observed_at":"2026-08-04T12:27:12.584527Z","submitted_at":"2023-04-21T02:19:06Z","title":"ReCEval: Evaluating Reasoning Chains via Correctness and Informativeness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10703","snapshot_observed_at":"2026-08-04T17:15:27.887155Z","title":"Rafael Rafailov, Archit Sharma, Eric Mitchell, Christopher D Manning, Stefano Ermon, and Chelsea Finn","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.11026","last_updated":"2025-09-14T01:33:14Z","snapshot_observed_at":"2026-08-07T23:35:39.492240Z","submitted_at":"2025-09-14T01:33:14Z","title":"Rethinking Human Preference Evaluation of LLM Rationales","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T17:15:27.887155Z"},"links":{"cited_paper":"/paper/2304.10703","citing_paper":"/paper/2509.11026"},"observation_digest":"sha256:e6b3f647338a1bd02804a3d1cd4a4b79eb5ac6a209a9fbca34c419321da47263","observation_id":"b8e998bf-7eae-4b59-bb1d-43c97d681ccf","resolution":{"observed_at":"2026-08-04T17:15:27.887155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02805","last_updated":"2024-05-22T19:01:10Z","snapshot_observed_at":"2026-08-09T10:00:53.899860Z","submitted_at":"2023-11-06T00:20:11Z","title":"Tailoring Self-Rationalizers with Multi-Reward Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02805","snapshot_observed_at":"2026-08-04T17:15:27.891750Z","title":"Peifeng Wang, Aaron Chan, Filip Ilievski, Muhao Chen, and Xiang Ren","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.11026","last_updated":"2025-09-14T01:33:14Z","snapshot_observed_at":"2026-08-07T23:35:39.492240Z","submitted_at":"2025-09-14T01:33:14Z","title":"Rethinking Human Preference Evaluation of LLM Rationales","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T17:15:27.891750Z"},"links":{"cited_paper":"/paper/2311.02805","citing_paper":"/paper/2509.11026"},"observation_digest":"sha256:c4e367f88633a26a9857c5bf6f3a66a5200dcfe3026ff91d7242b4f1262f0429","observation_id":"ea864c49-05f0-41b0-bb51-7c3494cd308c","resolution":{"observed_at":"2026-08-04T17:15:27.891750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01562","last_updated":"2023-04-06T23:49:35Z","snapshot_observed_at":"2026-08-03T08:21:21.325360Z","submitted_at":"2022-11-03T02:55:54Z","title":"PINTO: Faithful Language Reasoning Using Prompt-Generated Rationales","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01562","snapshot_observed_at":"2026-08-04T17:15:27.894185Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11026","last_updated":"2025-09-14T01:33:14Z","snapshot_observed_at":"2026-08-07T23:35:39.492240Z","submitted_at":"2025-09-14T01:33:14Z","title":"Rethinking Human Preference Evaluation of LLM Rationales","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T17:15:27.894185Z"},"links":{"cited_paper":"/paper/2211.01562","citing_paper":"/paper/2509.11026"},"observation_digest":"sha256:ac1ac6478a49c6a88fa4e168e1c6c1c520d558a15213de8103ea02fdb0bead70","observation_id":"fd8281ac-fab5-489a-81d8-c777d494e750","resolution":{"observed_at":"2026-08-04T17:15:27.894185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-04T17:15:27.898978Z","title":"Faithfulness","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11026","last_updated":"2025-09-14T01:33:14Z","snapshot_observed_at":"2026-08-07T23:35:39.492240Z","submitted_at":"2025-09-14T01:33:14Z","title":"Rethinking Human Preference Evaluation of LLM Rationales","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T17:15:27.898978Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2509.11026"},"observation_digest":"sha256:66413c611d8a6287c8dc37d8e39bd4ae658c1833200126aaf4dec85e7de37fcd","observation_id":"9a58348b-4a58-4cc3-ad89-25bfcc4479f0","resolution":{"observed_at":"2026-08-04T17:15:27.898978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:15:27.880107Z","title":"cc/paper files/paper/2016/file/10a5ab2db37feedfdeaab192ead4ac0e-Paper.pdf","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.11026","last_updated":"2025-09-14T01:33:14Z","snapshot_observed_at":"2026-08-07T23:35:39.492240Z","submitted_at":"2025-09-14T01:33:14Z","title":"Rethinking Human Preference Evaluation of LLM Rationales","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-04T17:15:27.880107Z"},"links":{"citing_paper":"/paper/2509.11026"},"observation_digest":"sha256:b278df392b2b38f15015d732fc87aae6f4566ad55b74d3fc769ab4b638444ac3","observation_id":"3858e017-d4a9-4b83-8191-6be19cb770b7","resolution":{"observed_at":"2026-08-04T17:15:27.880107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:15:27.877843Z","title":"Scott M Lundberg and Su-In Lee","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.11026","last_updated":"2025-09-14T01:33:14Z","snapshot_observed_at":"2026-08-07T23:35:39.492240Z","submitted_at":"2025-09-14T01:33:14Z","title":"Rethinking Human Preference Evaluation of LLM Rationales","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T17:15:27.877843Z"},"links":{"citing_paper":"/paper/2509.11026"},"observation_digest":"sha256:f02a8ec84fc963277e034fde8cdc15b4c74afe3f84b5507e20b5955d8f8ccecf","observation_id":"1e27b531-77ab-4288-b346-651276ab82ed","resolution":{"observed_at":"2026-08-04T17:15:27.877843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02361","last_updated":"2019-06-06T00:02:37Z","snapshot_observed_at":"2026-08-07T09:27:07.685326Z","submitted_at":"2019-06-06T00:02:37Z","title":"Explain Yourself! Leveraging Language Models for Commonsense Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.02361","snapshot_observed_at":"2026-08-04T17:15:27.889372Z","title":"Sahana Ramnath, Brihi Joshi, Skyler Hallinan, Ximing Lu, Liunian Harold Li, Aaron Chan, Jack Hessel, Yejin Choi, and Xiang Ren","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2509.11026","last_updated":"2025-09-14T01:33:14Z","snapshot_observed_at":"2026-08-07T23:35:39.492240Z","submitted_at":"2025-09-14T01:33:14Z","title":"Rethinking Human Preference Evaluation of LLM Rationales","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T17:15:27.889372Z"},"links":{"cited_paper":"/paper/1906.02361","citing_paper":"/paper/2509.11026"},"observation_digest":"sha256:d358be01350409c3f5918934c184249fca6c6d868994d782e80710f16dc0b4bb","observation_id":"5de3ddad-9dde-4a3e-ab0f-98e9b50cd13a","resolution":{"observed_at":"2026-08-04T17:15:27.889372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14702","last_updated":"2023-10-28T01:03:15Z","snapshot_observed_at":"2026-07-06T15:32:14.701994Z","submitted_at":"2023-05-24T04:13:15Z","title":"DecipherPref: Analyzing Influential Factors in Human Preference Judgments via GPT-4","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14702","snapshot_observed_at":"2026-08-04T17:15:27.873148Z","title":"doi: 10.18653/v1/2020.findings-emnlp.390","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.11026","last_updated":"2025-09-14T01:33:14Z","snapshot_observed_at":"2026-08-07T23:35:39.492240Z","submitted_at":"2025-09-14T01:33:14Z","title":"Rethinking Human Preference Evaluation of LLM Rationales","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T17:15:27.873148Z"},"links":{"cited_paper":"/paper/2305.14702","citing_paper":"/paper/2509.11026"},"observation_digest":"sha256:9b3ef488fc505b1b727e31513ae9f1a5daa555fb32af3955601c1860754cc5a1","observation_id":"3243e181-b116-4136-88f6-dbe0913ea7a6","resolution":{"observed_at":"2026-08-04T17:15:27.873148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08674","last_updated":"2022-05-04T19:34:21Z","snapshot_observed_at":"2026-08-04T13:47:55.644736Z","submitted_at":"2021-12-16T07:31:37Z","title":"Reframing Human-AI Collaboration for Generating Free-Text Explanations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08674","snapshot_observed_at":"2026-08-04T17:15:27.896357Z","title":"org/abs/2112.08674","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.11026","last_updated":"2025-09-14T01:33:14Z","snapshot_observed_at":"2026-08-07T23:35:39.492240Z","submitted_at":"2025-09-14T01:33:14Z","title":"Rethinking Human Preference Evaluation of LLM Rationales","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T17:15:27.896357Z"},"links":{"cited_paper":"/paper/2112.08674","citing_paper":"/paper/2509.11026"},"observation_digest":"sha256:ef975ec46edb3bc7c5a3b89d064d24c40a10cf39b873675c7840caa828cdad21","observation_id":"f740dcd0-d594-4249-84bb-70da27720075","resolution":{"observed_at":"2026-08-04T17:15:27.896357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18029","last_updated":"2023-06-30T15:41:47Z","snapshot_observed_at":"2026-07-06T15:34:44.280483Z","submitted_at":"2023-05-29T11:40:37Z","title":"Faithfulness Tests for Natural Language Explanations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18029","snapshot_observed_at":"2026-08-04T17:15:27.857734Z","title":"Ge Bai, Jie Liu, Xingyuan Bu, Yancheng He, Jiaheng Liu, Zhanhui Zhou, Zhuoran Lin, Wenbo Su, Tiezheng Ge, Bo Zheng, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.11026","last_updated":"2025-09-14T01:33:14Z","snapshot_observed_at":"2026-08-07T23:35:39.492240Z","submitted_at":"2025-09-14T01:33:14Z","title":"Rethinking Human Preference Evaluation of LLM Rationales","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T17:15:27.857734Z"},"links":{"cited_paper":"/paper/2305.18029","citing_paper":"/paper/2509.11026"},"observation_digest":"sha256:ac26ec55017c0574d7d16d7d00a7c3cef470fd2b7cbc842683bba4c8a6b50cf0","observation_id":"c877e8ca-d434-4b45-a792-6b23e27f6ff8","resolution":{"observed_at":"2026-08-04T17:15:27.857734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-04T17:15:27.863520Z","title":"Paul Christiano, Jan Leike, Tom B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.11026","last_updated":"2025-09-14T01:33:14Z","snapshot_observed_at":"2026-08-07T23:35:39.492240Z","submitted_at":"2025-09-14T01:33:14Z","title":"Rethinking Human Preference Evaluation of LLM Rationales","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T17:15:27.863520Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2509.11026"},"observation_digest":"sha256:884340eba9053beee1738fa6612f07bc4c3fb881d7445a002750eb569b364864","observation_id":"b9c9a3ff-c413-4d5f-845b-cc6fadf33474","resolution":{"observed_at":"2026-08-04T17:15:27.863520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:15:27.870816Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.11026","last_updated":"2025-09-14T01:33:14Z","snapshot_observed_at":"2026-08-07T23:35:39.492240Z","submitted_at":"2025-09-14T01:33:14Z","title":"Rethinking Human Preference Evaluation of LLM Rationales","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T17:15:27.870816Z"},"links":{"citing_paper":"/paper/2509.11026"},"observation_digest":"sha256:1d909c93a3063596f26f43c7ee1eb07a514c0ccca526f8f6869133364def8dcb","observation_id":"1b80c55b-79d6-4cf8-ac00-58ff29db57d8","resolution":{"observed_at":"2026-08-04T17:15:27.870816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.11026","last_updated":"2025-09-14T01:33:14Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T23:35:39.492240Z","submitted_at":"2025-09-14T01:33:14Z","title":"Rethinking Human Preference Evaluation of LLM Rationales"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 1 inbound Pith citation observation for arXiv:2509.11026."}