{"as_of":"2026-08-12T20:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0e714756ef5325ced1737fa861893509fcbbdfabf8357d6f7ae164f8ab724516","coverage":[{"denominator":111,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:11:20.582856Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.15748/citation-record","integrity":"/paper/2412.15748/integrity","json":"/paper/2412.15748/citation-record.json","paper":"/paper/2412.15748"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.081483Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.081483Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:0c99b95c109d294219d2934dc064abbdaf71515d00aa7ea25e39a13c487096d0","observation_id":"ba171195-4212-4408-8d2a-dfd967a22076","resolution":{"observed_at":"2026-08-11T11:11:20.081483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12541","last_updated":"2024-05-21T07:16:12Z","snapshot_observed_at":"2026-08-11T18:23:30.605307Z","submitted_at":"2024-05-21T07:16:12Z","title":"DrHouse: An LLM-empowered Diagnostic Reasoning System through Harnessing Outcomes from Sensor Data and Expert Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12541","snapshot_observed_at":"2026-08-11T11:11:20.086727Z","title":"Drhouse: An llm-empowered diagnostic reasoning system through harnessing outcomes from sensor data and expert knowledge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.086727Z"},"links":{"cited_paper":"/paper/2405.12541","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:fa1e04ae812b33578dfd16f62f8aca55f0419f66535949dbc956d717740eebd5","observation_id":"05ad7186-4003-4460-b4e9-ce0114ef6c26","resolution":{"observed_at":"2026-08-11T11:11:20.086727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22405","last_updated":"2025-07-02T17:58:37Z","snapshot_observed_at":"2026-08-06T22:01:41.066952Z","submitted_at":"2025-06-27T17:27:26Z","title":"Sequential Diagnosis with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22405","snapshot_observed_at":"2026-08-11T11:11:20.092099Z","title":"Sequential diagnosis with language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.092099Z"},"links":{"cited_paper":"/paper/2506.22405","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:4325880a9ed914791549bd2ea404aaeeb46cce9762c7dce21da3b38fd32849b4","observation_id":"955fee99-12ec-4d45-b643-4386a5b3f9f8","resolution":{"observed_at":"2026-08-11T11:11:20.092099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.097479Z","title":"Diagnostic reasoning prompts reveal the potential for large language model interpretability in medicine.NPJ Digital Medicine, 7(1):20, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.097479Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:eee756fbca8c23cc8846892523577ec1dfdd850e410aff5b591863170ec88d34","observation_id":"be829d62-6e26-4adf-a602-27cd40dcf905","resolution":{"observed_at":"2026-08-11T11:11:20.097479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19634","last_updated":"2025-03-19T13:55:33Z","snapshot_observed_at":"2026-08-07T20:37:56.716831Z","submitted_at":"2025-02-26T23:57:34Z","title":"MedVLM-R1: Incentivizing Medical Reasoning Capability of Vision-Language Models (VLMs) via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19634","snapshot_observed_at":"2026-08-11T11:11:20.102484Z","title":"Medvlm-r1: Incentivizing medical reasoning capability of vision-language models (vlms) via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.102484Z"},"links":{"cited_paper":"/paper/2502.19634","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:31cbaf768e38eb3760c5fb279311eac02d4e51b5e760c32bb32163be630797e0","observation_id":"feea806c-f572-4e1f-a657-6bc674dc31a7","resolution":{"observed_at":"2026-08-11T11:11:20.102484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.107764Z","title":"Med-r1: Reinforcement learning for generalizable medical reasoning in vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.107764Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:bdadf63d27c3139dad33cc6b82a66916fc023a6f10ba0e187546315d1d5c49fd","observation_id":"c2985272-7e53-4da9-96a1-aecac7f62f7d","resolution":{"observed_at":"2026-08-11T11:11:20.107764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.112970Z","title":"Enhancing medical summarization with parameter efficient fine tuning on local cpus","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.112970Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:fcd3990ea950e22a7bdf704777aa69b270b74f6131ed1dec0f8a50744afd9c97","observation_id":"0db61431-7f41-418b-903d-b31ad7565bb9","resolution":{"observed_at":"2026-08-11T11:11:20.112970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07128","last_updated":"2024-10-04T05:56:56Z","snapshot_observed_at":"2026-08-11T05:02:57.342522Z","submitted_at":"2024-01-13T18:09:05Z","title":"EHRAgent: Code Empowers Large Language Models for Few-shot Complex Tabular Reasoning on Electronic Health Records","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07128","snapshot_observed_at":"2026-08-11T11:11:20.117728Z","title":"Ehragent: Code empowers large language models for complex tabular reasoning on electronic health records","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.117728Z"},"links":{"cited_paper":"/paper/2401.07128","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:3d2681e9931f8a36eee8732b29a47569c0f5f5ab6bbaa05d39c1e89eebec9e27","observation_id":"dafeb8fc-71f1-40c9-8986-109187c47e06","resolution":{"observed_at":"2026-08-11T11:11:20.117728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.122551Z","title":"genomicbert: A light-weight foundation model for genome analysis using unigram tokenization and specialized dna vocabulary","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.122551Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:7dbe594ea6ab816869315fd272e8ddfa81bc96b1bd25d5fb8337d2990d37d609","observation_id":"1f77cb2f-5991-4b6b-9855-bf2ec20e281b","resolution":{"observed_at":"2026-08-11T11:11:20.122551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.127754Z","title":"What disease does this patient have? a large-scale open domain question answering dataset from medical exams, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.127754Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:f26e17e25b5c067a2897b4d2a2baf28adecba3fac021b573a5bc137dc434fa27","observation_id":"d315e8f4-8923-470c-8d59-ae09b978657d","resolution":{"observed_at":"2026-08-11T11:11:20.127754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.133527Z","title":"Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.133527Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:3e28b4f76c0881ae7b92e1fedc18786ea466c86f9d15bf76c65e2e7f60bc4669","observation_id":"72b6f34d-0a3e-4460-bb5f-05331277c91c","resolution":{"observed_at":"2026-08-11T11:11:20.133527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.06146","last_updated":"2019-09-13T11:18:20Z","snapshot_observed_at":"2026-07-06T08:21:28.880621Z","submitted_at":"2019-09-13T11:18:20Z","title":"PubMedQA: A Dataset for Biomedical Research Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.06146","snapshot_observed_at":"2026-08-11T11:11:20.138167Z","title":"Pubmedqa: A dataset for biomedical research question answering","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.138167Z"},"links":{"cited_paper":"/paper/1909.06146","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:7b8c4966c7bfe3cb55b00fb801650332c6418482b79500ffe58abdda1ac2dbe7","observation_id":"d051557d-bbdf-4e66-ad37-b485ae81a077","resolution":{"observed_at":"2026-08-11T11:11:20.138167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-11T11:11:20.142851Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.142851Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:3452ece818c9ec3b39800d67643c3ace9b2fdc759e576ca268401dcfa28478f3","observation_id":"294c32de-0fb3-4f2c-97bf-68283254967c","resolution":{"observed_at":"2026-08-11T11:11:20.142851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.147786Z","title":"Ai legal innovations: The benefits and drawbacks of chat-gpt and generative ai in the legal industry","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.147786Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:b52bea412a394e8285e9fb3fcd0e02c090c03e7bb7317b94d5e4132429c36c11","observation_id":"39159a6a-e6dd-4b95-a462-892d9fc5b5ee","resolution":{"observed_at":"2026-08-11T11:11:20.147786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.152245Z","title":"Ai detection’s high false positive rates and the psychological and material impacts on students","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.152245Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:44f689d239c3934e1d62c442f5231f919d8ac13aef1ef411317a02fe7a93c800","observation_id":"d0bef824-d397-49a6-a102-2737b1b7c3ba","resolution":{"observed_at":"2026-08-11T11:11:20.152245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.156893Z","title":"Better alone than in bad company: Addressing the risks of companion chatbots through data protection by design","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.156893Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:90f558184761a36d6ee06cec4e18c61873053280f64820d9b08df1e7f94c2115","observation_id":"e2b870e4-d47d-4d10-b25b-0470fc9ea0f5","resolution":{"observed_at":"2026-08-11T11:11:20.156893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.161472Z","title":"The google engineer who thinks the company’s ai has come to life","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.161472Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:af8a4f2bace67f1d1fd963b3fe9044569c98454538a83221b51e63f05bf53abd","observation_id":"8619aecb-5e1c-485b-b8cd-47dcbcb6626b","resolution":{"observed_at":"2026-08-11T11:11:20.161472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.166063Z","title":"Artificial intelligence algorithm for predicting mortality of patients with acute heart failure","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.166063Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:bc6029dedfd21741a28807b97f5f5ba3a9b153d53c07c53f0c610d1185df0449","observation_id":"e4716fe6-318e-4300-90e8-842ae5d51971","resolution":{"observed_at":"2026-08-11T11:11:20.166063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.170743Z","title":"Axiomatic attribution for deep networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.170743Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:c6e80b6e60046cce231a8496c1b52d861ea102a717c94ee58ef7da6bea36751d","observation_id":"d6474ca3-7925-4f31-984d-494ff3187bee","resolution":{"observed_at":"2026-08-11T11:11:20.170743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.175501Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.175501Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:56ace866c9f254d2c976f2b72895c0d85799550893370685d6253dcc13577b65","observation_id":"86fa1bf6-f40d-4822-8a7f-d489a53c4da5","resolution":{"observed_at":"2026-08-11T11:11:20.175501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.180021Z","title":"A novel visual interpretability for deep neural networks by optimizing activation maps with perturbation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.180021Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:7f9a5e4c6412d2917b260034647a512c7dbd6618b5e5ee63eb58f263a9b2d86d","observation_id":"4d92a129-f3f6-4298-b479-288a9ef7103a","resolution":{"observed_at":"2026-08-11T11:11:20.180021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.184519Z","title":"Ecco: An open source library for the explainability of transformer language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.184519Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:95a255b8de5f3e0dfdfad560ccec83a719bb6e76a98ceda0b370328580a28037","observation_id":"9fdc667d-ed37-4a43-9aed-8e793c0c89b1","resolution":{"observed_at":"2026-08-11T11:11:20.184519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.05122","last_updated":"2020-08-12T06:07:44Z","snapshot_observed_at":"2026-08-02T21:59:17.195799Z","submitted_at":"2020-08-12T06:07:44Z","title":"The Language Interpretability Tool: Extensible, Interactive Visualizations and Analysis for NLP Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.05122","snapshot_observed_at":"2026-08-11T11:11:20.189513Z","title":"The language interpretability tool: Extensible, interactive visualizations and analysis for nlp models","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.189513Z"},"links":{"cited_paper":"/paper/2008.05122","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:08636517c8c06d3d3663fed99596e92e6d473cf33f55376fb34ed2d344b582aa","observation_id":"d0e1174a-4c39-48ab-886c-8106ca1877ff","resolution":{"observed_at":"2026-08-11T11:11:20.189513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-11T11:11:20.198696Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.198696Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:e9f37c4045fa05f8cba1dd25ca247ea82cc383b5e956a0b8b14c54c0cb32449f","observation_id":"264366b1-5250-48ea-a5ac-fa903e798f0c","resolution":{"observed_at":"2026-08-11T11:11:20.198696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.203491Z","title":"Griffiths, Yuan Cao, and Karthik Narasimhan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.203491Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:999c73ffbf09f794b544f53ca1d8df07dca35ef427712b25ba56f07d57951973","observation_id":"18e35f36-3ec8-4145-88ef-fc3bffafcf00","resolution":{"observed_at":"2026-08-11T11:11:20.203491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11211","last_updated":"2025-05-26T14:11:38Z","snapshot_observed_at":"2026-08-11T02:10:28.106349Z","submitted_at":"2025-02-16T17:21:05Z","title":"A Survey of LLM-based Agents in Medicine: How far are we from Baymax?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11211","snapshot_observed_at":"2026-08-11T11:11:20.207982Z","title":"A survey of llm-based agents in medicine: How far are we from baymax? arXiv preprint arXiv:2502.11211, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.207982Z"},"links":{"cited_paper":"/paper/2502.11211","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:23e572e9681644c34ab967419d811bfc64643f776a90c5385b96039c2cb66390","observation_id":"d268c457-5503-4dfc-b413-321c3328a715","resolution":{"observed_at":"2026-08-11T11:11:20.207982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.212897Z","title":"Clinicalagent: Clinical trial multi-agent system with large language model-based reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.212897Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:21e883d64b9b910b946221b842671b245383ca0d9f6ce31e986800813edc8e09","observation_id":"e8993ab3-6649-49f4-a9c7-f15cc4d32421","resolution":{"observed_at":"2026-08-11T11:11:20.212897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13610","last_updated":"2025-05-23T07:21:04Z","snapshot_observed_at":"2026-07-06T19:35:21.868885Z","submitted_at":"2024-10-17T14:46:22Z","title":"MeNTi: Bridging Medical Calculator and LLM Agent with Nested Tool Calling","version":3},"cited_work":{"arxiv_id":"2410.13610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.13610","snapshot_observed_at":"2026-08-11T11:11:21.406230Z","title":"MeNTi: Bridging Medical Calculator and LLM Agent with Nested Tool Calling","venue":"cs.AI","work_id":"67c0ffb7-0221-48aa-8cc7-5bc475698fcd","year":2024},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.217550Z"},"links":{"cited_paper":"/paper/2410.13610","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:0d2b49303364e86150f0c494429c0a1a661b8c9338372750a60c11a6f931d0b7","observation_id":"5fa5062a-0710-48da-9715-b8782ca16109","resolution":{"observed_at":"2026-08-11T11:11:21.411396Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06294","last_updated":"2024-12-28T17:40:48Z","snapshot_observed_at":"2026-07-06T17:42:16.039458Z","submitted_at":"2024-03-10T19:47:00Z","title":"ArgMed-Agents: Explainable Clinical Decision Reasoning with LLM Disscusion via Argumentation Schemes","version":3},"cited_work":{"arxiv_id":"2403.06294","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.06294","snapshot_observed_at":"2026-08-11T11:11:21.382976Z","title":"ArgMed-Agents: Explainable Clinical Decision Reasoning with LLM Disscusion via Argumentation Schemes","venue":"cs.AI","work_id":"7b9567de-81b1-49c7-bcb4-b709030cdafe","year":2024},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.222600Z"},"links":{"cited_paper":"/paper/2403.06294","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:b7fb2bf3bc2f1febcbafd7dbe8c7cc42dbacd3cdabf9b1315a4ee52114edd99b","observation_id":"f46557a9-8c58-4c6f-b9a4-27d3c2a69d07","resolution":{"observed_at":"2026-08-11T11:11:21.388444Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.227414Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.227414Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:544a491516371b598f7a6018ae45a533c1c8f59935b819dc1615f75fb96ab709","observation_id":"4c4e26f4-cdea-4170-8e2e-12ab49a37f6c","resolution":{"observed_at":"2026-08-11T11:11:20.227414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.232703Z","title":"Marco-o1: Towards open reasoning models for open-ended solutions, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.232703Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:a1c8d9118e5b52e1b093f1b9a58eb399c66922795ed575685cba77580e11838c","observation_id":"6c07370f-fa77-4b7f-bc8e-5eeaf56bce06","resolution":{"observed_at":"2026-08-11T11:11:20.232703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.237196Z","title":"Large language models encode clinical knowledge","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.237196Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:7e5954e8ac991c781c94eccd47b7774d54c554e6ecf02ce2091790a208f92011","observation_id":"853219d8-dc98-4d92-b692-9e1abaae7aee","resolution":{"observed_at":"2026-08-11T11:11:20.237196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.241573Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.241573Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:121ea908f5fac911db037453ffc0e079ea801cbb6c1853eb17ff290d11b9aad3","observation_id":"b234839b-bef4-4d69-af20-7f323f437755","resolution":{"observed_at":"2026-08-11T11:11:20.241573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T11:11:20.246676Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.246676Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:e3937f452b07efa1df0753909536b9fdfd984b909e8c0b0468c62050fb94c753","observation_id":"0eda1fd2-3438-4fea-bd96-6a95416c272e","resolution":{"observed_at":"2026-08-11T11:11:20.246676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.252216Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.252216Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:b0e5809ae6f65bc0e3b1493f49efa02d0c8af9e1fa9984f291327fb5f1336b34","observation_id":"8f5d2cae-254d-4472-be67-812189a55f62","resolution":{"observed_at":"2026-08-11T11:11:20.252216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-11T11:11:20.256822Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.256822Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:a15e478a2ffa3516955d0f0c3e5c07e38646700ec79334fd1da153fd4b3a44fc","observation_id":"21efd48e-75d9-482b-9b9c-bd342ebab675","resolution":{"observed_at":"2026-08-11T11:11:20.256822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.261716Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.261716Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:3bbabd3172eefad2b346e44266c13a7ba41d1ec03b55645ca6be4dbce755e8e1","observation_id":"f59ebd8d-11fe-47c3-9558-111c7f83c6e5","resolution":{"observed_at":"2026-08-11T11:11:20.261716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-11T11:11:20.266213Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.266213Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:fdd394dbe79edb67dc842d528988fa58524ee6ac1e77f2b248cadcff45abf67d","observation_id":"0e63cb37-d081-4013-8fdf-1ff1c909d913","resolution":{"observed_at":"2026-08-11T11:11:20.266213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.271409Z","title":"Directed acyclic graphs","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.271409Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:63b79343a37887e0f45910fd62877a9ed03c3af64c8f5806c90354db703c10ed","observation_id":"8b20ec94-b24b-4b4f-88ee-0cd8221b8566","resolution":{"observed_at":"2026-08-11T11:11:20.271409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.276579Z","title":"Directed acyclic graphs: a tool for causal studies in paediatrics","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.276579Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:583841c438dd187fb55c87fa4d1a1d0779e8472856b8ff78605e305ffb3f00a6","observation_id":"f12f40c9-dc6e-49e0-9c89-e11adddc54be","resolution":{"observed_at":"2026-08-11T11:11:20.276579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.00050","last_updated":"2024-08-20T17:16:20Z","snapshot_observed_at":"2026-07-06T15:21:19.790554Z","submitted_at":"2023-04-28T19:00:43Z","title":"Causal Reasoning and Large Language Models: Opening a New Frontier for Causality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.00050","snapshot_observed_at":"2026-08-11T11:11:20.281295Z","title":"Causal reasoning and large language models: Opening a new frontier for causality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.281295Z"},"links":{"cited_paper":"/paper/2305.00050","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:665b637ff7083630c72c3f37f984e783047ac90e744f0487a4c931adbfbb4870","observation_id":"7195783f-1484-4b07-ad31-4d11bab7c387","resolution":{"observed_at":"2026-08-11T11:11:20.281295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.285872Z","title":"Applying large language models for causal structure learning in non small cell lung cancer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.285872Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:f51055b2d5b0c798357c5de48f053a12bd5f94a5fe7c635924758da8e9e89f36","observation_id":"358df73d-d1cd-4921-88d4-51724c0164d9","resolution":{"observed_at":"2026-08-11T11:11:20.285872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.290548Z","title":"Inferbert: a transformer-based causal inference framework for enhancing pharmacovigilance","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.290548Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:f93b94f4124a0030a5540c4fdc93c4fe0aafb3e43f2e317c10e753548bc97424","observation_id":"ac635160-9a31-4ffd-a915-baa25b15dd8a","resolution":{"observed_at":"2026-08-11T11:11:20.290548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01869","last_updated":"2024-08-06T11:58:53Z","snapshot_observed_at":"2026-08-10T11:01:45.709568Z","submitted_at":"2024-04-02T11:46:31Z","title":"Beyond Accuracy: Evaluating the Reasoning Behavior of Large Language Models -- A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01869","snapshot_observed_at":"2026-08-11T11:11:20.296204Z","title":"Beyond accuracy: Evaluating the reasoning behavior of large language models–a survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.296204Z"},"links":{"cited_paper":"/paper/2404.01869","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:e73ba86b32fc1ca389f2a647d86e6dcde267a7e5dc4a35f4b2148247c140cd0d","observation_id":"9f1cb4e5-ae72-45bd-83cd-d842f23995ec","resolution":{"observed_at":"2026-08-11T11:11:20.296204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.301120Z","title":"Cambridge Handbook Of Thinking And Reasoning Ebook","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.301120Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:5c32910da780b785dddeb57cfd423a397c78229b4b9ee78019960510b36eebed","observation_id":"4bad19f2-ab68-4d83-8a72-c7d1db89f05c","resolution":{"observed_at":"2026-08-11T11:11:20.301120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.306846Z","title":"Causal models: How people think about the world and its alternatives","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.306846Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:57611b1d41585655d9c7e1c9659a8eab151ad90c7a999e644711c47030891df6","observation_id":"ba2a0025-d682-4dd0-b265-5c0aec825012","resolution":{"observed_at":"2026-08-11T11:11:20.306846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.311484Z","title":"Philosophy of mathematics, 2007","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.311484Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:d73f0dddb4622645dae185bfa876ce5b0a26068bf204d6d89125d9da03430796","observation_id":"fe87cc89-f4f7-4219-a92f-026da95d3214","resolution":{"observed_at":"2026-08-11T11:11:20.311484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11562","last_updated":"2024-01-25T11:20:16Z","snapshot_observed_at":"2026-08-08T01:09:26.414662Z","submitted_at":"2023-12-17T15:16:13Z","title":"A Survey of Reasoning with Foundation Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11562","snapshot_observed_at":"2026-08-11T11:11:20.316040Z","title":"A survey of reasoning with foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.316040Z"},"links":{"cited_paper":"/paper/2312.11562","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:cb1f9e541d3d9ac03cc0d98a46c5e385a38358e29bd174eb9c1b07b467708d6b","observation_id":"269c7d34-ecc0-4c60-97e6-2fdcbd73fd60","resolution":{"observed_at":"2026-08-11T11:11:20.316040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14010","last_updated":"2023-05-23T12:43:19Z","snapshot_observed_at":"2026-08-04T03:43:34.446535Z","submitted_at":"2023-05-23T12:43:19Z","title":"IfQA: A Dataset for Open-domain Question Answering under Counterfactual Presuppositions","version":1},"cited_work":{"arxiv_id":"2305.14010","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.14010","snapshot_observed_at":"2026-08-11T11:11:21.263879Z","title":"IfQA: A Dataset for Open-domain Question Answering under Counterfactual Presuppositions","venue":"cs.CL","work_id":"597e6336-c774-45f6-9b3e-c5e779a07191","year":2023},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.321819Z"},"links":{"cited_paper":"/paper/2305.14010","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:359194a99dcd47d9bedcaaa62bb5fb13185f0a44c162ec7d35a1269a73fc18c7","observation_id":"3c4280c5-1ebd-42a1-ab3e-73a1f9e7bfe1","resolution":{"observed_at":"2026-08-11T11:11:21.269260Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:22.168531Z","title":"Causal reasoning and large language models: Opening a new frontier for causality, 2024","venue":null,"work_id":"8928a07c-840e-4457-840e-de6e1873574a","year":2024},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.327367Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:5e241b6e954da458cf48387ca9d35b162b5250cd2ac6030471067136b12d158f","observation_id":"bd9fed90-6dd6-4098-a272-56b2df7c81b1","resolution":{"observed_at":"2026-08-11T11:11:22.173855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:22.152765Z","title":"Mycin: a knowledge-based consultation program for infectious disease diagnosis","venue":null,"work_id":"dab3b044-c7c2-4a42-8dda-3a5afbe53934","year":1978},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.332504Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:3ca0345e9ce3546630ffc331bbe7cfeb177837bf003a849d7da724e3eafcba0d","observation_id":"63a6850f-40d1-4a2f-81b7-ac062c734ff6","resolution":{"observed_at":"2026-08-11T11:11:22.157664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:22.135319Z","title":"Internist-i, an experimental computer-based diagnostic consultant for general internal medicine","venue":null,"work_id":"dbf5a8a2-6915-491d-bcc4-865605090564","year":1985},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.337623Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:04da1f441db8f98d029f06aeb04365cefee73a1640622d845477f60471491284","observation_id":"8288469d-f0aa-404e-b1b1-51637e9d051c","resolution":{"observed_at":"2026-08-11T11:11:22.140943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:22.117434Z","title":"Neurosymbolic artificial intelligence (why, what, and how)","venue":null,"work_id":"140ae3f2-3710-46a1-90b6-9d794e108645","year":2023},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.343109Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:610b085b0da4f19df8f2debaf0ea16d9d2c7072bf9c20c0e1ea6f99d47f841dd","observation_id":"a8396c6b-a1a5-4da7-8443-b423cc0ca500","resolution":{"observed_at":"2026-08-11T11:11:22.122587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:22.101387Z","title":"A brief overview of chatgpt: The history, status quo and potential future development","venue":null,"work_id":"4ad378c1-052b-4a04-b4e8-1b185d92f802","year":2023},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.348574Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:34fcff00bace00d43a6025ecaddb9e3a50fa4746e340d52a82c7a64f8a9c22a1","observation_id":"c2d8ee80-d596-4fde-93be-caf39ede1205","resolution":{"observed_at":"2026-08-11T11:11:22.106784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T11:11:20.353694Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.353694Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:7db1a1ba0ee585244986d561598e26a5100988aa70e9c66224caca950fd46687","observation_id":"5371fe2b-589e-4493-aaab-48202cd78a46","resolution":{"observed_at":"2026-08-11T11:11:20.353694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:22.084604Z","title":"Opportunities and risks of chatgpt in medicine, science, and academic publishing: a modern promethean dilemma","venue":null,"work_id":"2a5c80d0-63fd-45cd-b928-afc6be38811b","year":2023},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.359674Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:532f410206906ea969b5c6d6d249b1d11124a7c0d4025b4e235cae7cef8333c9","observation_id":"866c0a75-0d1c-4933-aefa-ae6ed6668b3d","resolution":{"observed_at":"2026-08-11T11:11:22.089868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.364690Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.364690Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:a58939da4c509f0d62cfb23f1d1bb0af4f0cc05f4a4a423e1e64fcbadb05690c","observation_id":"45afeace-17ba-4402-92eb-b339f5bf1d8f","resolution":{"observed_at":"2026-08-11T11:11:20.364690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18925","last_updated":"2024-12-25T15:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-25T15:12:34Z","title":"HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18925","snapshot_observed_at":"2026-08-11T11:11:20.369960Z","title":"Huatuogpt-o1, towards medical complex reasoning with llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.369960Z"},"links":{"cited_paper":"/paper/2412.18925","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:c682f03c68bfa4b5181d633589dba8165dec6da3afb45fbf773fbc6166c4f780","observation_id":"62bd610d-9343-4fdc-ad4d-8618e6a4bbfd","resolution":{"observed_at":"2026-08-11T11:11:20.369960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:22.069067Z","title":"A generalist medical language model for disease diagnosis assistance","venue":null,"work_id":"1012b7bc-1706-477d-9e50-2965f63383c3","year":2025},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.375049Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:1509e42cecc1e4bc2a3de935f49123b377452746badf11bc355e643b545ef0aa","observation_id":"91d6b0ee-0ddf-4c2d-89db-6d62bab6e81d","resolution":{"observed_at":"2026-08-11T11:11:22.074140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:22.052640Z","title":"Crossing the trust gap in medical ai: Building an abductive bridge for xai","venue":null,"work_id":"9bd3ed5d-37d6-41a7-a2e3-9547466b9925","year":2024},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.380283Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:93e2951fb053d3529b03acaee300dc0a0a40f7187cd2994cada65a7bf1458b03","observation_id":"32416109-0852-4155-9d6c-2262277eb2a7","resolution":{"observed_at":"2026-08-11T11:11:22.057712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.385150Z","title":"Mimic-iii, a freely accessible critical care database","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.385150Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:6cc7548ce94ee55f66ca9f9794c280b345af84b2cfac825935d6465abb276d23","observation_id":"1cd1173a-2321-4c59-ad08-3e27102bba90","resolution":{"observed_at":"2026-08-11T11:11:20.385150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.389936Z","title":"Large language models are clinical reasoners: Reasoning- aware diagnosis framework with prompt-generated rationales","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.389936Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:b0bdb2a28b078f2a272b89260cb34352836db26ae90e8941371a2d135ee3ccf9","observation_id":"bee3fef1-17f6-4da2-bf45-91b068429816","resolution":{"observed_at":"2026-08-11T11:11:20.389936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02441","last_updated":"2023-12-05T02:44:07Z","snapshot_observed_at":"2026-08-08T16:22:12.687701Z","submitted_at":"2023-12-05T02:44:07Z","title":"MedDM:LLM-executable clinical guidance tree for clinical decision-making","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02441","snapshot_observed_at":"2026-08-11T11:11:20.394652Z","title":"Meddm: Llm-executable clinical guidance tree for clinical decision-making","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.394652Z"},"links":{"cited_paper":"/paper/2312.02441","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:01b35722dadba8ead603ae524a3fb3feec63dd249d348a98297de120b50ac562","observation_id":"305f9309-7d5e-43e3-bfdc-ddca5a06a718","resolution":{"observed_at":"2026-08-11T11:11:20.394652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:22.014111Z","title":"Patterson, Matthew M","venue":null,"work_id":"ced2be1d-fbfc-40ac-8b90-d36dd8a04c36","year":2023},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.399686Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:c2be00867c95aeef3c964e14f149a7f3a808b4871ec84e8b231eb192623dbb8f","observation_id":"450d37eb-56d2-48be-accc-684509a50405","resolution":{"observed_at":"2026-08-11T11:11:22.019512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05052","last_updated":"2023-06-08T09:12:28Z","snapshot_observed_at":"2026-08-11T01:47:18.991635Z","submitted_at":"2023-06-08T09:12:28Z","title":"Interpretable Medical Diagnostics with Structured Data Extraction by Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05052","snapshot_observed_at":"2026-08-11T11:11:20.405757Z","title":"Interpretable medical diagnostics with structured data extraction by large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.405757Z"},"links":{"cited_paper":"/paper/2306.05052","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:ba4674e0adf5468852dfa0a9f5b591386069a1318a3ba88f27762d4aa687c0de","observation_id":"58aff079-5a05-4ad2-859c-7460cde792f6","resolution":{"observed_at":"2026-08-11T11:11:20.405757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:21.996993Z","title":"Towards conversational diagnostic ai","venue":null,"work_id":"f568adf8-b4b8-4b93-bf9b-792720ebe6f1","year":2024},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.410923Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:7f9b68e8822f2dfe37f160568b653e2c88e0bed94e399773e9028397d4c465c7","observation_id":"3717f0fb-741b-4165-aa35-85ffdfce09da","resolution":{"observed_at":"2026-08-11T11:11:22.002253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:21.981037Z","title":"Towards trustworthy automatic diagnosis systems by emulating doctors’ reasoning with deep reinforcement learning","venue":null,"work_id":"87040419-d3ac-43c5-8133-29de5bd81c08","year":2022},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.415730Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:2f182f6ee55e35528175d6628fedfbbfd1fc7f3dfab3e6ae8dd5d2a00fde2e5b","observation_id":"66a6273e-a963-4e3b-8cb8-79e741001662","resolution":{"observed_at":"2026-08-11T11:11:21.986328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00922","last_updated":"2024-11-07T18:59:30Z","snapshot_observed_at":"2026-08-10T03:44:52.858614Z","submitted_at":"2024-06-03T01:32:52Z","title":"MediQ: Question-Asking LLMs and a Benchmark for Reliable Interactive Clinical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00922","snapshot_observed_at":"2026-08-11T11:11:20.420408Z","title":"Mediq: Question-asking llms for adaptive and reliable medical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.420408Z"},"links":{"cited_paper":"/paper/2406.00922","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:a95036872c5abdc33dc6c5d64b4461b528267507a2cfa86d5ba6daabad10949a","observation_id":"ec2f4fdd-f1b8-4614-a4a5-3c4b097d832b","resolution":{"observed_at":"2026-08-11T11:11:20.420408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:21.965145Z","title":"Causality extraction from medical text using large language models (llms), 2024","venue":null,"work_id":"20249b87-efa1-40e7-a547-4b5c2421df44","year":2024},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.425371Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:7ee0f366adbc8a0593fc7958e6e83ffa7d665ed0d9dbd9edbc2c1357d6210ff2","observation_id":"d5a6d98e-52c2-4d79-ae52-7ea7cf4dae0b","resolution":{"observed_at":"2026-08-11T11:11:21.970129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-11T11:11:20.430700Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.430700Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:2cc1b4584315d863a203727ee7cf9981c243187c9676beb185df89830959308e","observation_id":"8a9df475-bf98-44d4-bc78-8fcb5a4b443c","resolution":{"observed_at":"2026-08-11T11:11:20.430700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05232","last_updated":"2024-11-19T12:42:45Z","snapshot_observed_at":"2026-07-06T16:45:07.733095Z","submitted_at":"2023-11-09T09:25:37Z","title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05232","snapshot_observed_at":"2026-08-11T11:11:20.436314Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.436314Z"},"links":{"cited_paper":"/paper/2311.05232","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:9985759e06160f661b145ee0ca7bebcaa5a93d9090d46a7355085576b8707dc8","observation_id":"aede93e2-5a21-42be-b9ee-da469bf1a0aa","resolution":{"observed_at":"2026-08-11T11:11:20.436314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:21.948781Z","title":null,"venue":null,"work_id":"5838e8e4-d24f-4929-98da-6d4ed57903e2","year":2023},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.441362Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:9df0ae3cc2befc78b0d5f2aba7aa4a900208a2d8d2b04e149069756a7f603f15","observation_id":"b984a95b-70ea-4cdc-975b-1c7b8b3ef0ab","resolution":{"observed_at":"2026-08-11T11:11:21.953789Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:21.932504Z","title":"Sok: Memorization in general-purpose large language models, 2023","venue":null,"work_id":"1642ca6b-d9ba-44fe-8d11-01b2a2ba3e6f","year":2023},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.447024Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:d230f8602704c375ab7694b13a2ea2596cc887fc5c27d247a392e49aff282dd8","observation_id":"d92d1362-c50c-4c70-9bc6-72222c35a3dd","resolution":{"observed_at":"2026-08-11T11:11:21.937658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.451796Z","title":"Ddxplus: A new dataset for automatic medical diagnosis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.451796Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:3adc9e5fa9a8a6cd9168d2c799f902b42cefb9dbf4826fad95c667766d732b75","observation_id":"dfd99550-ba9a-4b69-8720-9d165517aaa5","resolution":{"observed_at":"2026-08-11T11:11:20.451796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08495","last_updated":"2024-07-21T03:00:04Z","snapshot_observed_at":"2026-08-06T12:21:28.468354Z","submitted_at":"2024-03-13T13:04:58Z","title":"Automatic Interactive Evaluation for Large Language Models with State Aware Patient Simulator","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08495","snapshot_observed_at":"2026-08-11T11:11:20.456418Z","title":"Automatic interactive evaluation for large language models with state aware patient simulator","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.456418Z"},"links":{"cited_paper":"/paper/2403.08495","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:621cf1eb7e4306c78fc8316ef6bc4ba863bac34d7318d8d7bd68f8476051bc74","observation_id":"d21d1301-403a-4feb-91e8-c7fdb7632add","resolution":{"observed_at":"2026-08-11T11:11:20.456418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:21.905130Z","title":"Toward clinical generative ai: Conceptual framework","venue":null,"work_id":"2e790f38-2a6e-4496-acc9-b711862e12c4","year":2024},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.461133Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:cf21c61bfd962f4061657ca6927d991db77a9c3b92357ea6f8716af032b146a4","observation_id":"578093fa-f539-4011-af5b-b3a83c2b0424","resolution":{"observed_at":"2026-08-11T11:11:21.910742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:21.886715Z","title":"Towards metacognitive clinical reasoning: Benchmark- ing md-pie against state-of-the-art llms in medical decision-making","venue":null,"work_id":"7f2e9817-9819-4590-a9d1-864699feb976","year":2025},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.465910Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:fedbe937d8d40cc2c6791358fa2acc69ce4ada884d551c48b9b244d97e5d7b2c","observation_id":"77095d08-1604-44e8-9604-5b64697ecf21","resolution":{"observed_at":"2026-08-11T11:11:21.891989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:21.870982Z","title":"Clinical reasoning of a generative artificial intelligence model compared with physicians","venue":null,"work_id":"2fe0fba8-14c9-45c3-9c2d-ff5b9f751e1f","year":2024},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.470708Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:162f1a78e66474e18b99413d6782e39b495c00ac2b412ba50373ed9ecd67770d","observation_id":"1500b680-71c4-469a-b548-4630025d1eea","resolution":{"observed_at":"2026-08-11T11:11:21.876061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:21.854904Z","title":"Medical reasoning in llms: an in-depth analysis of deepseek r1","venue":null,"work_id":"680f1062-8dc2-47e8-ab1e-2b1a6d81a303","year":2025},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.475968Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:6c5b74d409b08b9d8bbc7796ea28f9f77238332cd8896b4cfd0ba94de612e098","observation_id":"7813af97-b55d-4b8a-8249-b9ebfafba695","resolution":{"observed_at":"2026-08-11T11:11:21.860336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07988","last_updated":"2025-07-10T17:58:26Z","snapshot_observed_at":"2026-08-06T21:37:13.165302Z","submitted_at":"2025-07-10T17:58:26Z","title":"Automating Expert-Level Medical Reasoning Evaluation of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07988","snapshot_observed_at":"2026-08-11T11:11:20.481528Z","title":"Automating expert-level medical reasoning evaluation of large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.481528Z"},"links":{"cited_paper":"/paper/2507.07988","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:9c0aeb703dffd4fb99065b995fab6959c30e26dc114ea6911b6afb77d0321b0d","observation_id":"89338951-d8e3-47ff-a305-7f5e7bfd8d5d","resolution":{"observed_at":"2026-08-11T11:11:20.481528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11733","last_updated":"2025-05-20T15:56:52Z","snapshot_observed_at":"2026-08-07T15:44:29.798157Z","submitted_at":"2025-05-16T22:34:36Z","title":"MedCaseReasoning: Evaluating and learning diagnostic reasoning from clinical case reports","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11733","snapshot_observed_at":"2026-08-11T11:11:20.487211Z","title":"Medcasereasoning: Evaluating and learning diagnostic reasoning from clinical case reports","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.487211Z"},"links":{"cited_paper":"/paper/2505.11733","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:5867701285e029e72c9e6e4c13134f86579aade7654753d5b86f531f15c8ba3d","observation_id":"9364561e-c929-4754-824e-5c25d4ae3a86","resolution":{"observed_at":"2026-08-11T11:11:20.487211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04691","last_updated":"2025-03-10T17:28:31Z","snapshot_observed_at":"2026-08-12T16:45:38.399582Z","submitted_at":"2025-03-06T18:35:39Z","title":"Quantifying the Reasoning Abilities of LLMs on Real-world Clinical Cases","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04691","snapshot_observed_at":"2026-08-11T11:11:20.492320Z","title":"Quantifying the reasoning abilities of llms on real-world clinical cases","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.492320Z"},"links":{"cited_paper":"/paper/2503.04691","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:f0aca928942c507245d2b3d78534d4cf97d51d9fe24992e447bb9ebccee8d29c","observation_id":"8170ad43-6136-49e0-89f3-97328b26bc02","resolution":{"observed_at":"2026-08-11T11:11:20.492320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:21.838704Z","title":"Applying large language models for causal structure learning in non small cell lung cancer","venue":null,"work_id":"d9c492d4-a088-4c79-b300-d60f70126ade","year":2024},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.497273Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:3e83d79d8381cb38cff1ba053bc853d21e00382401dca5d9ea23ca5491c0ecb7","observation_id":"de82f416-5ea8-4d6f-ab76-fca4bfbeb023","resolution":{"observed_at":"2026-08-11T11:11:21.844018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.07874","last_updated":"2017-11-25T03:53:32Z","snapshot_observed_at":"2026-07-06T05:43:42.722222Z","submitted_at":"2017-05-22T17:38:10Z","title":"A Unified Approach to Interpreting Model Predictions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.07874","snapshot_observed_at":"2026-08-11T11:11:20.501964Z","title":"A unified approach to interpreting model predictions","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.501964Z"},"links":{"cited_paper":"/paper/1705.07874","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:b4f33f414995d40209696376ba22deaa2d51da79f30e5783a62c89072f32a89d","observation_id":"8e190327-3c99-452d-a923-659f57060191","resolution":{"observed_at":"2026-08-11T11:11:20.501964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.10178","last_updated":"2022-04-25T18:25:30Z","snapshot_observed_at":"2026-08-09T18:42:04.316803Z","submitted_at":"2022-04-11T18:38:22Z","title":"Doctor XAvIer: Explainable Diagnosis on Physician-Patient Dialogues and XAI Evaluation","version":2},"cited_work":{"arxiv_id":"2204.10178","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.10178","snapshot_observed_at":"2026-08-11T11:11:21.046163Z","title":"Doctor XAvIer: Explainable Diagnosis on Physician-Patient Dialogues and XAI Evaluation","venue":"cs.CL","work_id":"91669bb8-31ec-4d6e-8df1-59fc4d59d1d5","year":2022},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.507117Z"},"links":{"cited_paper":"/paper/2204.10178","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:16c5305dc382d450055a79f09ea419bc40f94785a365be9c4d49e0866fd2f4d2","observation_id":"709b182f-208e-4e1f-a350-6afad2e2b36c","resolution":{"observed_at":"2026-08-11T11:11:21.051738Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:21.821371Z","title":"An interactive programming learning environment supporting paper computing and immediate evaluation for making thinking visible and traceable","venue":null,"work_id":"c75c34a6-9157-4e41-9b47-a66519de02b4","year":2023},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.512096Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:30ed817caf255e0e452014f1c04b0e9fc27a17dd91efc05c5ee0ddefddddb274","observation_id":"d5483a22-a496-4ade-b9a4-3e580d0d5181","resolution":{"observed_at":"2026-08-11T11:11:21.827475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13246","last_updated":"2023-05-22T17:18:29Z","snapshot_observed_at":"2026-08-12T06:33:59.944306Z","submitted_at":"2023-05-22T17:18:29Z","title":"Interactive Natural Language Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13246","snapshot_observed_at":"2026-08-11T11:11:20.516947Z","title":"Interactive natural language processing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.516947Z"},"links":{"cited_paper":"/paper/2305.13246","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:ccebd88d83cbed4585cf541820370f1e8cea2b551f0a19096743514fbe1c18a6","observation_id":"a0485a8c-fc0e-4f02-9185-c4d1f7fd4110","resolution":{"observed_at":"2026-08-11T11:11:20.516947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11341","last_updated":"2024-10-17T15:12:21Z","snapshot_observed_at":"2026-07-06T18:32:02.206165Z","submitted_at":"2024-06-17T08:59:04Z","title":"A Systematic Analysis of Large Language Models as Soft Reasoners: The Case of Syllogistic Inferences","version":3},"cited_work":{"arxiv_id":"2406.11341","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.11341","snapshot_observed_at":"2026-08-11T11:11:21.002974Z","title":"A Systematic Analysis of Large Language Models as Soft Reasoners: The Case of Syllogistic Inferences","venue":"cs.CL","work_id":"947fcf2b-94ae-4d1e-bdb7-443ca527ef7d","year":2024},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.521909Z"},"links":{"cited_paper":"/paper/2406.11341","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:b44292778e9a99d714e68ae3554296b99325e64a13003c4f120afd32f59ba30f","observation_id":"2d34a395-1831-49d0-9bf4-228778ffc92c","resolution":{"observed_at":"2026-08-11T11:11:21.010417Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.527916Z","title":"Chain-of-thought reasoning without prompting, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.527916Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:19ca25bc6f354180f0d61300269c2d893098f913eeb6b348c26ab1068322c677","observation_id":"15deab5b-8dee-4d19-aa50-002ed1ad2bb0","resolution":{"observed_at":"2026-08-11T11:11:20.527916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-11T11:11:20.532807Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.532807Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:59e103d6d1e01112752d4862ffe3841e3929ceeeda2b8e66bef86772581aa64b","observation_id":"77de7b19-f217-4a34-bb6f-0ef31375ba0c","resolution":{"observed_at":"2026-08-11T11:11:20.532807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-12T17:29:41.806995Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-11T11:11:20.537912Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.537912Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:7e76401932f8c332198c1cdf4450cf7210dfc3b553bef751badce3c3f0aef548","observation_id":"4313abfd-2b56-4499-bb92-fc4f9406a39e","resolution":{"observed_at":"2026-08-11T11:11:20.537912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.542946Z","title":"Xgboost: A scalable tree boosting system","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.542946Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:ddb8f24068c2461f1320bbea45d22549ff186671392e60a2310fe25dbca990ab","observation_id":"117dbaed-0527-4c2a-b82a-5aef11be4611","resolution":{"observed_at":"2026-08-11T11:11:20.542946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.547688Z","title":"Random forests","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.547688Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:6303ae5783bc6b41a7a1d507161cce2df41cfd1792b0e9759e2314fb3a3535e3","observation_id":"398de49e-4654-4f28-9279-f8725e162618","resolution":{"observed_at":"2026-08-11T11:11:20.547688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:21.774253Z","title":"Machine learning and complex biological data","venue":null,"work_id":"b6c1520d-e562-452c-a9f0-93831a72357b","year":2019},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.552498Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:2fc85c0cc1ebcd55cd72e8bde9972bb75a50bdef703a2db85e07d6f597087bf7","observation_id":"d4b981c1-78d3-465e-87c0-cbc13256c74d","resolution":{"observed_at":"2026-08-11T11:11:21.779372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:21.757920Z","title":"From formal boosted tree explanations to interpretable rule sets","venue":null,"work_id":"2a4a1feb-3dee-4e5a-852b-5a9b95e20f49","year":2023},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.557098Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:6648922d38dc7f12b7e42540dfe85b03fb4207187d727f24bfd14b14e8f4b724","observation_id":"0048b474-4fc6-430d-b863-2dd3e4313101","resolution":{"observed_at":"2026-08-11T11:11:21.763289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.561743Z","title":"Dual-process theories of higher cognition: Advancing the debate","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.561743Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:aed907a32797ebf7b1dce2eb34191d198350427452f3c761d10cfc7b6f3dc1d5","observation_id":"685b4c00-a69f-4a65-b121-d8a65c569eda","resolution":{"observed_at":"2026-08-11T11:11:20.561743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.01547","last_updated":"2019-11-25T13:02:04Z","snapshot_observed_at":"2026-07-06T08:34:41.399203Z","submitted_at":"2019-11-05T00:31:38Z","title":"On the Measure of Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.01547","snapshot_observed_at":"2026-08-11T11:11:20.567574Z","title":"On the measure of intelligence","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.567574Z"},"links":{"cited_paper":"/paper/1911.01547","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:d2cfefdca7313f05258783c335eb96aaaf02f6146b68844809ff0e7e53cb2961","observation_id":"d5355a64-bd51-4f73-87bb-9afb64fd12b3","resolution":{"observed_at":"2026-08-11T11:11:20.567574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11831","last_updated":"2026-01-15T23:30:35Z","snapshot_observed_at":"2026-07-06T21:25:27.942187Z","submitted_at":"2025-05-17T04:34:48Z","title":"ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11831","snapshot_observed_at":"2026-08-11T11:11:20.572820Z","title":"Arc-agi-2: A new challenge for frontier ai reasoning systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.572820Z"},"links":{"cited_paper":"/paper/2505.11831","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:acf81e04abb5cb561dd7abba209f7e57ad49972f5f3ec9db89d4842173c80d41","observation_id":"22609a65-6ae5-4f63-a4d2-a6e38f09bcb6","resolution":{"observed_at":"2026-08-11T11:11:20.572820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.11473","last_updated":"2025-12-07T02:14:12Z","snapshot_observed_at":"2026-08-10T09:38:50.886870Z","submitted_at":"2025-07-15T16:43:41Z","title":"Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.11473","snapshot_observed_at":"2026-08-11T11:11:20.577706Z","title":"Chain of thought monitorability: A new and fragile opportunity for ai safety","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.577706Z"},"links":{"cited_paper":"/paper/2507.11473","citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:dc734f8236b5a4037a9f02d3eb3ade839ff728c0e8b9730d6e984ed455409adf","observation_id":"fbfb7c4d-3fa1-4eb5-b46d-71aaad2a423b","resolution":{"observed_at":"2026-08-11T11:11:20.577706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:11:20.582856Z","title":"From generation to judgment: Opportunities and challenges of llm-as-a-judge, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-11T11:11:20.582856Z"},"links":{"citing_paper":"/paper/2412.15748"},"observation_digest":"sha256:040ddc2cd8ff7aef29f1f8fc327e73c4c2f654d0729849e71512e67ac9b3a2a5","observation_id":"e0dbcf38-f032-4510-9c8e-1fa152e14886","resolution":{"observed_at":"2026-08-11T11:11:20.582856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.15748","last_updated":"2025-07-28T13:13:02Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T18:23:09.999609Z","submitted_at":"2024-12-20T10:06:52Z","title":"Critique of Impure Reason: Unveiling the reasoning behaviour of medical Large Language Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":74,"verified_exact":5,"verified_fuzzy":21},"total_outbound_references":111},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 100 of 111 outbound references and 0 inbound Pith citation observations for arXiv:2412.15748."}