{"as_of":"2026-08-08T17:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:044b40339de84e9949b6ce4dc7fb7e9ae568b5c56816d8c6df639259eb17becd","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:55:24.431078Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":28,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2212.07919","last_updated":"2023-09-12T15:08:46Z","snapshot_observed_at":"2026-07-06T14:31:03.189108Z","submitted_at":"2022-12-15T15:52:39Z","title":"ROSCOE: A Suite of Metrics for Scoring Step-by-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07919","snapshot_observed_at":"2026-08-07T14:55:24.431078Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17021","last_updated":"2025-05-22T17:59:58Z","snapshot_observed_at":"2026-08-08T11:44:17.973390Z","submitted_at":"2025-05-22T17:59:58Z","title":"ARB: A Comprehensive Arabic Multimodal Reasoning Benchmark","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:24.431078Z"},"links":{"cited_paper":"/paper/2212.07919","citing_paper":"/paper/2505.17021"},"observation_digest":"sha256:db41a961e54b714d3788aa7ed94381e51e09201cc300f2640534cdeb1fec0c33","observation_id":"3f805292-2812-4c37-b4cd-0359cbb56397","resolution":{"observed_at":"2026-08-07T14:55:24.431078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07919","last_updated":"2023-09-12T15:08:46Z","snapshot_observed_at":"2026-07-06T14:31:03.189108Z","submitted_at":"2022-12-15T15:52:39Z","title":"ROSCOE: A Suite of Metrics for Scoring Step-by-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07919","snapshot_observed_at":"2026-08-07T14:03:04.297202Z","title":"Roscoe: A suite of metrics for scoring step-by-step reasoning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20223","last_updated":"2025-05-26T17:06:00Z","snapshot_observed_at":"2026-08-08T00:05:56.709460Z","submitted_at":"2025-05-26T17:06:00Z","title":"Chain-of-Thought for Autonomous Driving: A Comprehensive Survey and Future Prospects","version":1},"reference_index":147,"source":"pdf_text","source_observed_at":"2026-08-07T14:03:04.297202Z"},"links":{"cited_paper":"/paper/2212.07919","citing_paper":"/paper/2505.20223"},"observation_digest":"sha256:2615727b2ac5feea67f8dbe8131bffff5c02371e769dd49fa0ba9bbcd41f0ffa","observation_id":"ee8e5cc5-8649-48d6-886a-a4b8f18fb5a6","resolution":{"observed_at":"2026-08-07T14:03:04.297202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07919","last_updated":"2023-09-12T15:08:46Z","snapshot_observed_at":"2026-07-06T14:31:03.189108Z","submitted_at":"2022-12-15T15:52:39Z","title":"ROSCOE: A Suite of Metrics for Scoring Step-by-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07919","snapshot_observed_at":"2026-08-07T11:33:30.453495Z","title":"Roscoe: A suite of metrics for scoring step-by-step reasoning.arXiv preprint arXiv:2212.07919, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02126","last_updated":"2025-06-02T18:01:00Z","snapshot_observed_at":"2026-08-08T09:39:27.326103Z","submitted_at":"2025-06-02T18:01:00Z","title":"Knowledge or Reasoning? A Close Look at How LLMs Think Across Domains","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:30.453495Z"},"links":{"cited_paper":"/paper/2212.07919","citing_paper":"/paper/2506.02126"},"observation_digest":"sha256:1032622f0791570e5c50835acad280dd5c57453eb1f4b522215996683d9bcf80","observation_id":"fe22c061-ad7b-4ba9-9e23-205a1610624f","resolution":{"observed_at":"2026-08-07T11:33:30.453495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07919","last_updated":"2023-09-12T15:08:46Z","snapshot_observed_at":"2026-07-06T14:31:03.189108Z","submitted_at":"2022-12-15T15:52:39Z","title":"ROSCOE: A Suite of Metrics for Scoring Step-by-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07919","snapshot_observed_at":"2026-08-07T05:51:08.212502Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06971","last_updated":"2025-06-12T14:47:31Z","snapshot_observed_at":"2026-08-07T07:20:17.397323Z","submitted_at":"2025-06-08T02:43:46Z","title":"Chain-of-Code Collapse: Reasoning Failures in LLMs via Adversarial Prompting in Code Generation","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T05:51:08.212502Z"},"links":{"cited_paper":"/paper/2212.07919","citing_paper":"/paper/2506.06971"},"observation_digest":"sha256:3a74608c3442c3bb57d1eef72ad7c906a7dc40b8e2ea6ad9b26b4bb1e343d000","observation_id":"fb7d36f6-e76c-4daa-83bb-36b16ce378b4","resolution":{"observed_at":"2026-08-07T05:51:08.212502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07919","last_updated":"2023-09-12T15:08:46Z","snapshot_observed_at":"2026-07-06T14:31:03.189108Z","submitted_at":"2022-12-15T15:52:39Z","title":"ROSCOE: A Suite of Metrics for Scoring Step-by-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07919","snapshot_observed_at":"2026-08-07T00:41:33.692878Z","title":"Roscoe: A suite of metrics for scoring step-by-step reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13326","last_updated":"2025-06-16T10:15:38Z","snapshot_observed_at":"2026-08-07T00:34:01.184734Z","submitted_at":"2025-06-16T10:15:38Z","title":"VIS-Shepherd: Constructing Critic for LLM-based Data Visualization Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:33.692878Z"},"links":{"cited_paper":"/paper/2212.07919","citing_paper":"/paper/2506.13326"},"observation_digest":"sha256:e205b6926f32afc6da2788f36be38b6867b3527d84c4432ce31440b63acd3f13","observation_id":"04f788f9-ede6-409c-a8d0-e0e8d9e68fdf","resolution":{"observed_at":"2026-08-07T00:41:33.692878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07919","last_updated":"2023-09-12T15:08:46Z","snapshot_observed_at":"2026-07-06T14:31:03.189108Z","submitted_at":"2022-12-15T15:52:39Z","title":"ROSCOE: A Suite of Metrics for Scoring Step-by-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07919","snapshot_observed_at":"2026-08-04T17:15:27.868447Z","title":"Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Ruoyu Zhang, Runxin Xu, Qihao Zhu, Shirong Ma, Peiyi Wang, Xiao Bi, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.11026","last_updated":"2025-09-14T01:33:14Z","snapshot_observed_at":"2026-08-07T23:35:39.492240Z","submitted_at":"2025-09-14T01:33:14Z","title":"Rethinking Human Preference Evaluation of LLM Rationales","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T17:15:27.868447Z"},"links":{"cited_paper":"/paper/2212.07919","citing_paper":"/paper/2509.11026"},"observation_digest":"sha256:bb5cf193cafbf11f4d3eb191a6b5c55d78a6e38d7da10bbe6f962e8e1e0a84f2","observation_id":"4a6dd9a8-749d-476d-b2fd-8ef1e599dc4a","resolution":{"observed_at":"2026-08-04T17:15:27.868447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07919","last_updated":"2023-09-12T15:08:46Z","snapshot_observed_at":"2026-07-06T14:31:03.189108Z","submitted_at":"2022-12-15T15:52:39Z","title":"ROSCOE: A Suite of Metrics for Scoring Step-by-Step Reasoning","version":2},"cited_work":{"arxiv_id":"2212.07919","doi":"10.48550/arxiv.2212.07919","metadata_source":"arxiv_reference","pith_arxiv_id":"2212.07919","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anisha Gunjal, Jihan Yin, and Erhan Bas","venue":"arXiv (Cornell University)","work_id":"1098c56c-d0eb-49a6-b986-b94ae9d87c1a","year":2024},"citing_paper":{"arxiv_id":"2509.25844","last_updated":"2026-04-21T23:57:56Z","snapshot_observed_at":"2026-07-06T22:31:10.099674Z","submitted_at":"2025-09-30T06:34:21Z","title":"Believing without Seeing: Quality Scores for Contextualizing Vision-Language Model Explanations","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T12:58:50.538826Z"},"links":{"cited_paper":"/paper/2212.07919","citing_paper":"/paper/2509.25844"},"observation_digest":"sha256:4ff07c795915c44575f80073e2ce23bb8b008461162961c25d7da22057fdf348","observation_id":"d0a98575-162f-4037-b710-4260fb60d90d","resolution":{"observed_at":"2026-05-18T13:01:23.684248Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07919","last_updated":"2023-09-12T15:08:46Z","snapshot_observed_at":"2026-07-06T14:31:03.189108Z","submitted_at":"2022-12-15T15:52:39Z","title":"ROSCOE: A Suite of Metrics for Scoring Step-by-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07919","snapshot_observed_at":"2026-08-03T16:14:28.968859Z","title":"Tingxu Han, Zhenting Wang, Chunrong Fang, Shiyu Zhao, Shiqing Ma, and Zhenyu Chen","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.14332","last_updated":"2026-07-16T10:35:40Z","snapshot_observed_at":"2026-08-05T14:51:47.757034Z","submitted_at":"2025-12-16T12:01:16Z","title":"Step-Tagging: Toward controlling the generation of Language Reasoning Models through step monitoring","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T16:14:28.968859Z"},"links":{"cited_paper":"/paper/2212.07919","citing_paper":"/paper/2512.14332"},"observation_digest":"sha256:a5ef235d29afdde74a1e321e7c152ba9aa16db17c7715ef0d30e9afd8271e9e7","observation_id":"6a572793-a0ee-4424-ac17-5b8c3f6d972a","resolution":{"observed_at":"2026-08-03T16:14:28.968859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07919","last_updated":"2023-09-12T15:08:46Z","snapshot_observed_at":"2026-07-06T14:31:03.189108Z","submitted_at":"2022-12-15T15:52:39Z","title":"ROSCOE: A Suite of Metrics for Scoring Step-by-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07919","snapshot_observed_at":"2026-08-02T23:26:29.354201Z","title":"org/abs/2212.07919","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.13904","last_updated":"2026-07-23T02:27:49Z","snapshot_observed_at":"2026-08-07T20:41:50.134795Z","submitted_at":"2026-02-14T21:53:47Z","title":"Diagnosing Pathological Chain-of-Thought in Reasoning Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T23:26:29.354201Z"},"links":{"cited_paper":"/paper/2212.07919","citing_paper":"/paper/2602.13904"},"observation_digest":"sha256:8e8ce6dbfdf00ea114db792746ab5db65280f43f72673d0dace07f35afe1a00f","observation_id":"1b783235-d6ef-41dc-b722-ff326ce7efa8","resolution":{"observed_at":"2026-08-02T23:26:29.354201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07919","last_updated":"2023-09-12T15:08:46Z","snapshot_observed_at":"2026-07-06T14:31:03.189108Z","submitted_at":"2022-12-15T15:52:39Z","title":"ROSCOE: A Suite of Metrics for Scoring Step-by-Step Reasoning","version":2},"cited_work":{"arxiv_id":"2212.07919","doi":"10.48550/arxiv.2212.07919","metadata_source":"arxiv_reference","pith_arxiv_id":"2212.07919","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anisha Gunjal, Jihan Yin, and Erhan Bas","venue":"arXiv (Cornell University)","work_id":"1098c56c-d0eb-49a6-b986-b94ae9d87c1a","year":2024},"citing_paper":{"arxiv_id":"2603.03332","last_updated":"2026-04-16T23:41:41Z","snapshot_observed_at":"2026-08-04T02:21:24.392691Z","submitted_at":"2026-02-11T03:11:30Z","title":"Fragile Thoughts: How Large Language Models Handle Chain-of-Thought Perturbations","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T03:43:18.987241Z"},"links":{"cited_paper":"/paper/2212.07919","citing_paper":"/paper/2603.03332"},"observation_digest":"sha256:5c07188dacf6712ce1e1d8728074d98153c6eed59ca134952ffe14be7be7c487","observation_id":"4278645e-906e-45e5-8d16-3be97360b09b","resolution":{"observed_at":"2026-05-16T03:47:15.328082Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07919","last_updated":"2023-09-12T15:08:46Z","snapshot_observed_at":"2026-07-06T14:31:03.189108Z","submitted_at":"2022-12-15T15:52:39Z","title":"ROSCOE: A Suite of Metrics for Scoring Step-by-Step Reasoning","version":2},"cited_work":{"arxiv_id":"2212.07919","doi":"10.48550/arxiv.2212.07919","metadata_source":"arxiv_reference","pith_arxiv_id":"2212.07919","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anisha Gunjal, Jihan Yin, and Erhan Bas","venue":"arXiv (Cornell University)","work_id":"1098c56c-d0eb-49a6-b986-b94ae9d87c1a","year":2024},"citing_paper":{"arxiv_id":"2604.04852","last_updated":"2026-04-06T16:53:52Z","snapshot_observed_at":"2026-08-02T21:39:50.942163Z","submitted_at":"2026-04-06T16:53:52Z","title":"Strengthening Human-Centric Chain-of-Thought Reasoning Integrity in LLMs via a Structured Prompt Framework","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T18:53:12.473010Z"},"links":{"cited_paper":"/paper/2212.07919","citing_paper":"/paper/2604.04852"},"observation_digest":"sha256:d4c7622559f0982a3ce7f44e98d9f8be8234dffb529a5e769051b4d1372748f6","observation_id":"45b69f89-53be-4c34-95c8-8384bed91f85","resolution":{"observed_at":"2026-05-10T18:55:44.645241Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07919","last_updated":"2023-09-12T15:08:46Z","snapshot_observed_at":"2026-07-06T14:31:03.189108Z","submitted_at":"2022-12-15T15:52:39Z","title":"ROSCOE: A Suite of Metrics for Scoring Step-by-Step Reasoning","version":2},"cited_work":{"arxiv_id":"2212.07919","doi":"10.48550/arxiv.2212.07919","metadata_source":"arxiv_reference","pith_arxiv_id":"2212.07919","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anisha Gunjal, Jihan Yin, and Erhan Bas","venue":"arXiv (Cornell University)","work_id":"1098c56c-d0eb-49a6-b986-b94ae9d87c1a","year":2024},"citing_paper":{"arxiv_id":"2604.06066","last_updated":"2026-04-07T16:47:37Z","snapshot_observed_at":"2026-07-06T22:54:40.349479Z","submitted_at":"2026-04-07T16:47:37Z","title":"From Hallucination to Structure Snowballing: The Alignment Tax of Constrained Decoding in LLM Reflection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T19:04:32.931596Z"},"links":{"cited_paper":"/paper/2212.07919","citing_paper":"/paper/2604.06066"},"observation_digest":"sha256:5a1d7328cc7fae8603b23357b4a396276467b152d4c567e884fa9c36e21b8d19","observation_id":"e92b42ec-b7e8-40d5-9e4b-ac03b7a92cd9","resolution":{"observed_at":"2026-05-10T23:30:51.495749Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07919","last_updated":"2023-09-12T15:08:46Z","snapshot_observed_at":"2026-07-06T14:31:03.189108Z","submitted_at":"2022-12-15T15:52:39Z","title":"ROSCOE: A Suite of Metrics for Scoring Step-by-Step Reasoning","version":2},"cited_work":{"arxiv_id":"2212.07919","doi":"10.48550/arxiv.2212.07919","metadata_source":"arxiv_reference","pith_arxiv_id":"2212.07919","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anisha Gunjal, Jihan Yin, and Erhan Bas","venue":"arXiv (Cornell University)","work_id":"1098c56c-d0eb-49a6-b986-b94ae9d87c1a","year":2024},"citing_paper":{"arxiv_id":"2606.10279","last_updated":"2026-06-09T01:00:04Z","snapshot_observed_at":"2026-08-03T09:33:29.324006Z","submitted_at":"2026-06-09T01:00:04Z","title":"Supervised Fine-tuning with Synthetic Rationale Data Hurts Real-World Disease Prediction","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-27T13:48:39.832057Z"},"links":{"cited_paper":"/paper/2212.07919","citing_paper":"/paper/2606.10279"},"observation_digest":"sha256:33169a00d27518e9e50b81beec64aeaac94efe32e84708348ed1034052b30f68","observation_id":"91f99d7a-2a47-4957-b787-2caae3e80e74","resolution":{"observed_at":"2026-07-03T04:37:36.780083Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07919","last_updated":"2023-09-12T15:08:46Z","snapshot_observed_at":"2026-07-06T14:31:03.189108Z","submitted_at":"2022-12-15T15:52:39Z","title":"ROSCOE: A Suite of Metrics for Scoring Step-by-Step Reasoning","version":2},"cited_work":{"arxiv_id":"2212.07919","doi":"10.48550/arxiv.2212.07919","metadata_source":"arxiv_reference","pith_arxiv_id":"2212.07919","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anisha Gunjal, Jihan Yin, and Erhan Bas","venue":"arXiv (Cornell University)","work_id":"1098c56c-d0eb-49a6-b986-b94ae9d87c1a","year":2024},"citing_paper":{"arxiv_id":"2606.29278","last_updated":"2026-06-28T08:56:34Z","snapshot_observed_at":"2026-07-07T00:03:16.968118Z","submitted_at":"2026-06-28T08:56:34Z","title":"The Complexity Ceiling Benchmark: A Multi-Domain Evaluation of Sequential Reasoning Under Depth Scaling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T07:37:38.371341Z"},"links":{"cited_paper":"/paper/2212.07919","citing_paper":"/paper/2606.29278"},"observation_digest":"sha256:06c8f8021bd765c4f1c6404e565f8c452f13cef52184138001b37f8fac8e500a","observation_id":"cd110505-f34c-4fbf-b9db-7a0b6c0de025","resolution":{"observed_at":"2026-06-30T07:44:22.077461Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07919","last_updated":"2023-09-12T15:08:46Z","snapshot_observed_at":"2026-07-06T14:31:03.189108Z","submitted_at":"2022-12-15T15:52:39Z","title":"ROSCOE: A Suite of Metrics for Scoring Step-by-Step Reasoning","version":2},"cited_work":{"arxiv_id":"2212.07919","doi":"10.48550/arxiv.2212.07919","metadata_source":"arxiv_reference","pith_arxiv_id":"2212.07919","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anisha Gunjal, Jihan Yin, and Erhan Bas","venue":"arXiv (Cornell University)","work_id":"1098c56c-d0eb-49a6-b986-b94ae9d87c1a","year":2024},"citing_paper":{"arxiv_id":"2606.31608","last_updated":"2026-06-30T12:56:42Z","snapshot_observed_at":"2026-07-07T00:05:17.259491Z","submitted_at":"2026-06-30T12:56:42Z","title":"CLExEval: A Human-in-the-Loop Framework for Qualitative Evaluation of LLM Clinical Reasoning","version":1},"reference_index":107,"source":"arxiv_source","source_observed_at":"2026-07-01T05:33:52.027771Z"},"links":{"cited_paper":"/paper/2212.07919","citing_paper":"/paper/2606.31608"},"observation_digest":"sha256:c80467ec668aa4fc60944cc5824c7104fa9c206eeb0bddbea99587e208b083b1","observation_id":"e118551f-6c45-4c67-9cc5-8e24d7e4d013","resolution":{"observed_at":"2026-07-01T10:25:41.607755Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07919","last_updated":"2023-09-12T15:08:46Z","snapshot_observed_at":"2026-07-06T14:31:03.189108Z","submitted_at":"2022-12-15T15:52:39Z","title":"ROSCOE: A Suite of Metrics for Scoring Step-by-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07919","snapshot_observed_at":"2026-08-04T01:00:54.813255Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.00243","last_updated":"2026-07-31T19:40:15Z","snapshot_observed_at":"2026-08-07T12:34:29.941530Z","submitted_at":"2026-07-31T19:40:15Z","title":"More Debate, Same Evidence: Structural Limits of Homogeneous Multi-Agent Groundedness","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T01:00:54.813255Z"},"links":{"cited_paper":"/paper/2212.07919","citing_paper":"/paper/2608.00243"},"observation_digest":"sha256:b2920bb7174b3c7561388719aedfec2d620cecf399d255192be4d7d0020bcc9d","observation_id":"cb15932c-4aba-4345-b557-31fa45f113f4","resolution":{"observed_at":"2026-08-04T01:00:54.813255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2212.07919/citation-record","integrity":"/paper/2212.07919/integrity","json":"/paper/2212.07919/citation-record.json","paper":"/paper/2212.07919"},"outbound":[],"paper":{"arxiv_id":"2212.07919","last_updated":"2023-09-12T15:08:46Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T14:31:03.189108Z","submitted_at":"2022-12-15T15:52:39Z","title":"ROSCOE: A Suite of Metrics for Scoring Step-by-Step Reasoning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 16 inbound Pith citation observations for arXiv:2212.07919."}