{"as_of":"2026-08-08T05:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e0a84ceab2c83a15343523b1dfe60e877c0e569ec9b7e6a73166b8dcb2e4c553","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:42:26.489072Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T13:38:11.263118Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T19:27:18.623344Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":"2505.14107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14107","snapshot_observed_at":"2026-07-02T19:27:18.623344Z","title":"Diagnosisarena: Benchmarking diagnostic reasoning for large language models","venue":null,"work_id":"be790523-7e13-4f36-9302-80c429ecea85","year":2025},"citing_paper":{"arxiv_id":"2509.22258","last_updated":"2026-04-04T13:15:46Z","snapshot_observed_at":"2026-07-06T22:30:50.642382Z","submitted_at":"2025-09-26T12:20:01Z","title":"Beyond Classification Accuracy: Neural-MedBench and the Need for Deeper Reasoning Benchmarks","version":5},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-18T13:26:58.309566Z"},"links":{"cited_paper":"/paper/2505.14107","citing_paper":"/paper/2509.22258"},"observation_digest":"sha256:a67524c9096bc7c546e58a52de607dc0fe95141cce4a0be6a3dbe73abbd83dbd","observation_id":"09047aae-f843-40e3-85b4-cf933f609390","resolution":{"observed_at":"2026-05-18T13:31:25.606181Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":"2505.14107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14107","snapshot_observed_at":"2026-07-02T19:27:18.623344Z","title":"Diagnosisarena: Benchmarking diagnostic reasoning for large language models","venue":null,"work_id":"be790523-7e13-4f36-9302-80c429ecea85","year":2025},"citing_paper":{"arxiv_id":"2602.12705","last_updated":"2026-04-07T11:35:36Z","snapshot_observed_at":"2026-07-06T22:45:44.135338Z","submitted_at":"2026-02-13T08:19:38Z","title":"MedXIAOHE: A Comprehensive Recipe for Building Medical MLLMs","version":4},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-15T22:52:30.992054Z"},"links":{"cited_paper":"/paper/2505.14107","citing_paper":"/paper/2602.12705"},"observation_digest":"sha256:77b5e393f62e50e259f58c5f55df2b646b51947086994e730522a816985510ae","observation_id":"b7ec127c-9cc0-44a7-94c9-86527838c0db","resolution":{"observed_at":"2026-05-15T22:56:50.369713Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":"2505.14107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14107","snapshot_observed_at":"2026-07-02T19:27:18.623344Z","title":"Diagnosisarena: Benchmarking diagnostic reasoning for large language models","venue":null,"work_id":"be790523-7e13-4f36-9302-80c429ecea85","year":2025},"citing_paper":{"arxiv_id":"2604.06262","last_updated":"2026-04-07T01:59:40Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T01:59:40Z","title":"From Exposure to Internalization: Dual-Stream Calibration for In-context Clinical Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T19:19:15.053725Z"},"links":{"cited_paper":"/paper/2505.14107","citing_paper":"/paper/2604.06262"},"observation_digest":"sha256:a38e2259cbd3cffb1585e1c58497f6808981bcecf35d48788def8c38121e9928","observation_id":"56606448-0adb-4b38-bf1b-6c8a2b8894c4","resolution":{"observed_at":"2026-05-10T23:10:50.561904Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":"2505.14107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14107","snapshot_observed_at":"2026-07-02T19:27:18.623344Z","title":"Diagnosisarena: Benchmarking diagnostic reasoning for large language models","venue":null,"work_id":"be790523-7e13-4f36-9302-80c429ecea85","year":2025},"citing_paper":{"arxiv_id":"2605.09505","last_updated":"2026-05-13T15:59:22Z","snapshot_observed_at":"2026-08-02T08:23:54.521582Z","submitted_at":"2026-05-10T12:27:32Z","title":"EpiGraph: Building Generalists for Evidence-Intensive Epilepsy Reasoning in the Wild","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T04:03:34.773345Z"},"links":{"cited_paper":"/paper/2505.14107","citing_paper":"/paper/2605.09505"},"observation_digest":"sha256:6a2e173308268aff991799ae72f88a68b7bb423960048ff8827fa157089e46d3","observation_id":"eb509866-ada7-44b7-a024-1d689965352d","resolution":{"observed_at":"2026-05-12T06:41:37.715348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":"2505.14107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14107","snapshot_observed_at":"2026-07-02T19:27:18.623344Z","title":"Diagnosisarena: Benchmarking diagnostic reasoning for large language models","venue":null,"work_id":"be790523-7e13-4f36-9302-80c429ecea85","year":2025},"citing_paper":{"arxiv_id":"2605.09505","last_updated":"2026-05-13T15:59:22Z","snapshot_observed_at":"2026-08-02T08:23:54.521582Z","submitted_at":"2026-05-10T12:27:32Z","title":"EpiGraph: Building Generalists for Evidence-Intensive Epilepsy Reasoning in the Wild","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-14T21:25:31.662152Z"},"links":{"cited_paper":"/paper/2505.14107","citing_paper":"/paper/2605.09505"},"observation_digest":"sha256:e617fc92dd009c5121c1e7dde42fe164ac55afe93c2fa664e579d726035ea26f","observation_id":"4c17d835-2f8e-4172-ae51-856250113229","resolution":{"observed_at":"2026-05-14T21:27:59.758936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":"2505.14107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14107","snapshot_observed_at":"2026-07-02T19:27:18.623344Z","title":"Diagnosisarena: Benchmarking diagnostic reasoning for large language models","venue":null,"work_id":"be790523-7e13-4f36-9302-80c429ecea85","year":2025},"citing_paper":{"arxiv_id":"2605.30637","last_updated":"2026-05-28T22:38:26Z","snapshot_observed_at":"2026-07-06T23:39:53.132531Z","submitted_at":"2026-05-28T22:38:26Z","title":"EHRBench: An Automated and Reliable EHR-based Benchmark for Clinical Decision Making with LLMs","version":1},"reference_index":131,"source":"pdf_text","source_observed_at":"2026-06-29T06:41:06.828814Z"},"links":{"cited_paper":"/paper/2505.14107","citing_paper":"/paper/2605.30637"},"observation_digest":"sha256:065c3989e015a894c88351fbd0ec00f93dbe2d32533dc237fcef86a558099ee1","observation_id":"7eb391fb-79aa-4e59-ba84-88b6f2ba5083","resolution":{"observed_at":"2026-06-29T06:43:10.455707Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":"2505.14107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14107","snapshot_observed_at":"2026-07-02T19:27:18.623344Z","title":"Diagnosisarena: Benchmarking diagnostic reasoning for large language models","venue":null,"work_id":"be790523-7e13-4f36-9302-80c429ecea85","year":2025},"citing_paper":{"arxiv_id":"2606.07853","last_updated":"2026-06-05T21:29:39Z","snapshot_observed_at":"2026-08-02T04:31:19.934605Z","submitted_at":"2026-06-05T21:29:39Z","title":"Beyond English benchmarks: clinical llm evaluation in Brazilian Portuguese","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T21:40:16.052239Z"},"links":{"cited_paper":"/paper/2505.14107","citing_paper":"/paper/2606.07853"},"observation_digest":"sha256:4f69fd85e88d4d6815ea6c3abc940dae5aa177f3d13f78c10ea46b30c237ab7e","observation_id":"96c78045-c903-4f3b-afa0-f6f2d46e03af","resolution":{"observed_at":"2026-07-02T19:07:17.921236Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":"2505.14107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14107","snapshot_observed_at":"2026-07-02T19:27:18.623344Z","title":"Diagnosisarena: Benchmarking diagnostic reasoning for large language models","venue":null,"work_id":"be790523-7e13-4f36-9302-80c429ecea85","year":2025},"citing_paper":{"arxiv_id":"2607.00147","last_updated":"2026-06-30T20:25:53Z","snapshot_observed_at":"2026-08-04T09:35:31.011187Z","submitted_at":"2026-06-30T20:25:53Z","title":"RareDxR1: Autonomous Medical Reasoning for Rare Disease Diagnosis Beyond Human Annotation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-02T19:21:44.653877Z"},"links":{"cited_paper":"/paper/2505.14107","citing_paper":"/paper/2607.00147"},"observation_digest":"sha256:4512e6df7a49f12119c95e30eb0eefd4a9ab58204effc61c62184a083ec09fbb","observation_id":"d98ffec1-12da-4a37-ab73-142cbea8de42","resolution":{"observed_at":"2026-07-02T19:27:18.624793Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14107","snapshot_observed_at":"2026-08-02T13:38:11.263118Z","title":"URL: https://arxiv.org/abs/2505.14107","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22555","last_updated":"2026-05-19T12:55:39Z","snapshot_observed_at":"2026-08-07T01:22:20.977020Z","submitted_at":"2026-05-19T12:55:39Z","title":"DeepLens Diagnosis Agent: Agentic Workflow Design Lets a Small Reasoning Model Compete with Frontier LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T13:38:11.263118Z"},"links":{"cited_paper":"/paper/2505.14107","citing_paper":"/paper/2607.22555"},"observation_digest":"sha256:18305c5de64f867829a9e10ccc894fbb8cae3cdc77249dc0f14677221074ac56","observation_id":"fbbe7ad0-62de-42bd-a871-203c3e9afd2d","resolution":{"observed_at":"2026-08-02T13:38:11.263118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14107","snapshot_observed_at":"2026-08-01T01:07:59.356644Z","title":"arXiv [cs.CL](2025).2505.14107","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25933","last_updated":"2026-07-28T16:19:03Z","snapshot_observed_at":"2026-08-08T00:34:59.862133Z","submitted_at":"2026-07-28T16:19:03Z","title":"Evaluating Multi-Turn Multimodal Diagnostic Reasoning on Challenging Real-World Clinical Cases","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T01:07:59.356644Z"},"links":{"cited_paper":"/paper/2505.14107","citing_paper":"/paper/2607.25933"},"observation_digest":"sha256:b1d95f0803cb638dc45fcca33bd262ffc946a053bd661ede5e1bdc9080e2af7d","observation_id":"3530e665-cd62-480a-96b0-5471f5a47e1d","resolution":{"observed_at":"2026-08-01T01:07:59.356644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14107/citation-record","integrity":"/paper/2505.14107/integrity","json":"/paper/2505.14107/citation-record.json","paper":"/paper/2505.14107"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:37.229944Z","title":null,"venue":null,"work_id":"5410bdde-6927-44e3-937d-8257826acfe8","year":2024},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:20.680647Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:c1ca8b34c31f225a5d4f4c835cfb5908f2b8f4873858bdac3169035b52b5523a","observation_id":"56360b9f-9e2f-49b4-8488-d891ecf33e37","resolution":{"observed_at":"2026-08-07T15:42:37.297073Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:20.789835Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:20.789835Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:1bd3f9491e951eedc83366122291d674ee4e98e686264fa7341756982167b0fe","observation_id":"add5754f-9f3e-4d26-9342-ff214d10c0a2","resolution":{"observed_at":"2026-08-07T15:42:20.789835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18925","last_updated":"2024-12-25T15:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-25T15:12:34Z","title":"HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18925","snapshot_observed_at":"2026-08-07T15:42:20.896208Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:20.896208Z"},"links":{"cited_paper":"/paper/2412.18925","citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:89b87066c5cab3ddb1b97c0594b2f9d5a2a3c1a67b8901fdd72e55ee1c75c7ac","observation_id":"29a188e5-a87d-4848-bc63-f8bab946a0fa","resolution":{"observed_at":"2026-08-07T15:42:20.896208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-07T17:24:22.925386Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-08-07T15:42:20.985769Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:20.985769Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:fb065cc3287bdbc8178c26df3728a007b9c7fa9065c01778b4a432af7ea83b7a","observation_id":"1026facc-1e92-45cb-be99-89ba8001c0c8","resolution":{"observed_at":"2026-08-07T15:42:20.985769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:37.048365Z","title":null,"venue":null,"work_id":"048424bc-946f-4919-9b27-16292422f0ea","year":2025},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:21.068068Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:4f2a91ccb47f3a497fb0abd9b25a1f7fe822e35e97d64d93d818584683dbe522","observation_id":"11adcf86-c5af-4869-896e-1239510694c2","resolution":{"observed_at":"2026-08-07T15:42:37.158163Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:36.823049Z","title":null,"venue":null,"work_id":"be28199a-55a0-4d80-8f7c-66e883bed7c3","year":2024},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:21.167084Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:19e24cd5821b6d1d8e11c04e84343cb0a72e302a77962692f66a9a07eccf14bf","observation_id":"0a1a466e-dcb9-4c1c-8e0c-34cc4d7966a2","resolution":{"observed_at":"2026-08-07T15:42:36.899551Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:36.611247Z","title":null,"venue":null,"work_id":"b39a32df-b167-433b-8afb-c4203ef721d6","year":2025},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:21.281936Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:259618f955307b2cb1b044ba39967ae7d51690bd2e3258838c3b737383ac7626","observation_id":"23b4fb40-e8a3-4f52-9475-dc012462c6f2","resolution":{"observed_at":"2026-08-07T15:42:36.704308Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04519","last_updated":"2025-01-08T14:12:57Z","snapshot_observed_at":"2026-08-04T20:57:22.329262Z","submitted_at":"2025-01-08T14:12:57Z","title":"rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04519","snapshot_observed_at":"2026-08-07T15:42:21.412901Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:21.412901Z"},"links":{"cited_paper":"/paper/2501.04519","citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:3dadb2526c66ccb42d810b5cdf273bbc146f8b3be84c62c3549375df82066f67","observation_id":"50cd3b33-c295-4122-838b-a37faeff1e13","resolution":{"observed_at":"2026-08-07T15:42:21.412901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:36.422196Z","title":null,"venue":null,"work_id":"0b62f831-ef62-45e1-afd2-1e6768c68ab5","year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:21.517209Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:cda27ffe6720a1c74d2e09262152dccc30d01d3e1900033b212cfb255b64a38c","observation_id":"2f8a5f54-5954-4049-8445-244175106aa9","resolution":{"observed_at":"2026-08-07T15:42:36.512527Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08322","last_updated":"2023-11-06T13:24:16Z","snapshot_observed_at":"2026-08-07T23:54:46.322439Z","submitted_at":"2023-05-15T03:20:19Z","title":"C-Eval: A Multi-Level Multi-Discipline Chinese Evaluation Suite for Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08322","snapshot_observed_at":"2026-08-07T15:42:21.748095Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:21.748095Z"},"links":{"cited_paper":"/paper/2305.08322","citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:657c3e9ce897c3df4e7b75440b48cd55a1bc679cd7558892169dfff90fa3d69c","observation_id":"6ec658c3-c211-4854-bccd-9d19e1538875","resolution":{"observed_at":"2026-08-07T15:42:21.748095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16489","last_updated":"2024-11-25T15:31:27Z","snapshot_observed_at":"2026-07-06T19:56:39.115630Z","submitted_at":"2024-11-25T15:31:27Z","title":"O1 Replication Journey -- Part 2: Surpassing O1-preview through Simple Distillation, Big Progress or Bitter Lesson?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16489","snapshot_observed_at":"2026-08-07T15:42:21.824586Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:21.824586Z"},"links":{"cited_paper":"/paper/2411.16489","citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:b2fc78b4df2b5c985586a99d2301283b4e6e472ea8bea8f80c3551fe64f3ab6e","observation_id":"13095c2b-6ad1-4105-8fc5-ab73c61da6ea","resolution":{"observed_at":"2026-08-07T15:42:21.824586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06458","last_updated":"2025-01-11T07:10:23Z","snapshot_observed_at":"2026-08-07T08:07:31.851127Z","submitted_at":"2025-01-11T07:10:23Z","title":"O1 Replication Journey -- Part 3: Inference-time Scaling for Medical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06458","snapshot_observed_at":"2026-08-07T15:42:21.902894Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:21.902894Z"},"links":{"cited_paper":"/paper/2501.06458","citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:5c03fd2866e3c42ed3d3dae78e54cbaf7464967b5a3aa2dd0eef0732e4517862","observation_id":"d13da93f-2bb2-43c4-8a63-ad77e29ae2cb","resolution":{"observed_at":"2026-08-07T15:42:21.902894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:21.963612Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:21.963612Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:6aa5713ac77c0656258a7fc668120a1ff1a76afe434d2a978eb49097cdcbf9f5","observation_id":"5a3d7ed5-6f5a-4d77-bb14-e3551883f2f3","resolution":{"observed_at":"2026-08-07T15:42:21.963612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00658","last_updated":"2024-10-15T09:16:38Z","snapshot_observed_at":"2026-08-05T12:38:35.392849Z","submitted_at":"2024-02-01T15:18:33Z","title":"Learning Planning-based Reasoning by Trajectories Collection and Process Reward Synthesizing","version":3},"cited_work":{"arxiv_id":"2402.00658","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.00658","snapshot_observed_at":"2026-08-07T15:42:26.911183Z","title":"Learning Planning-based Reasoning by Trajectories Collection and Process Reward Synthesizing","venue":"cs.AI","work_id":"0787ec82-e2b6-40ef-a5b0-81a31a0967d7","year":2024},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:22.042716Z"},"links":{"cited_paper":"/paper/2402.00658","citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:f4160e0e89ea084476e1b9eafce6a2c72c7f7e37098e0b54fb1bcbb43b67514e","observation_id":"7749b063-e0fb-4649-b3c8-43bf035ed78e","resolution":{"observed_at":"2026-08-07T15:42:27.076360Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:22.163572Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:22.163572Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:149045ab8ef50d4bdebf673eba76e75d573827b7eacd6b4aabdbe749f42807f0","observation_id":"8acdc184-0a55-44fe-a814-696c7e73685e","resolution":{"observed_at":"2026-08-07T15:42:22.163572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.06146","last_updated":"2019-09-13T11:18:20Z","snapshot_observed_at":"2026-07-06T08:21:28.880621Z","submitted_at":"2019-09-13T11:18:20Z","title":"PubMedQA: A Dataset for Biomedical Research Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.06146","snapshot_observed_at":"2026-08-07T15:42:22.245082Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:22.245082Z"},"links":{"cited_paper":"/paper/1909.06146","citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:9cd280554437d6f85f6f1f3c46c002b5d2e07e09999d26a3f5568c8a18b3fff8","observation_id":"3f1a278f-7fe7-45b2-84a6-794c38506942","resolution":{"observed_at":"2026-08-07T15:42:22.245082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:36.151629Z","title":null,"venue":null,"work_id":"e526dd66-2d48-4eb8-99f6-f870e782b53b","year":2024},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:22.318276Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:6afdd23cc22f95fba31d999fe7cb0a569d7416084b1216bb8d004ce732515f7a","observation_id":"252428e3-ca33-4985-8889-e7b155bfcaf2","resolution":{"observed_at":"2026-08-07T15:42:36.278415Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:35.943002Z","title":null,"venue":null,"work_id":"9b664d6e-8381-494f-a308-95b7d6a79cbe","year":2023},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:22.418200Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:0b80448d124327f6684858381ec465902c34e22aa959c39b7a831e41627d526d","observation_id":"5fced3ee-b9e0-408b-9371-699cdb69fb9e","resolution":{"observed_at":"2026-08-07T15:42:36.014916Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:35.642217Z","title":null,"venue":null,"work_id":"234fca4d-ef7a-4ed8-bef7-e16b4f12540f","year":2023},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:22.509608Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:828e070965c2bc642b2b8c7095c4db3d435ef561006eab9cc3e04ac1c187e71b","observation_id":"50458228-0e58-4fb2-bd2e-832ae2561881","resolution":{"observed_at":"2026-08-07T15:42:35.775621Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09413","last_updated":"2024-12-22T10:44:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-12T16:20:36Z","title":"Imitate, Explore, and Self-Improve: A Reproduction Report on Slow-thinking Reasoning Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09413","snapshot_observed_at":"2026-08-07T15:42:22.583653Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:22.583653Z"},"links":{"cited_paper":"/paper/2412.09413","citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:89b715aee650af7da597d612934a03362779e1549d7b224026bc1d7a7d29cdfb","observation_id":"a7a65e49-e29f-4dbf-8a23-0a860b2877ba","resolution":{"observed_at":"2026-08-07T15:42:22.583653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03590","last_updated":"2024-11-06T01:09:17Z","snapshot_observed_at":"2026-07-06T19:45:53.289704Z","submitted_at":"2024-11-06T01:09:17Z","title":"From Medprompt to o1: Exploration of Run-Time Strategies for Medical Challenge Problems and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03590","snapshot_observed_at":"2026-08-07T15:42:22.658240Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:22.658240Z"},"links":{"cited_paper":"/paper/2411.03590","citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:76523678786cbc23d4c9a315e84a33697f0ac8fc94d31f16f41c9e4c8ee3a1a4","observation_id":"e988c9fd-a9fc-4a70-80cb-4fd7071f6588","resolution":{"observed_at":"2026-08-07T15:42:22.658240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:35.433768Z","title":null,"venue":null,"work_id":"b3558213-fb89-4f41-8df6-e4b9d422c854","year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:22.738801Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:d288ac5913dd394169e7386a37286273ad2d20af44509407d2e6676473e26879","observation_id":"ed0aff7f-6605-46a4-80eb-1c7516581bba","resolution":{"observed_at":"2026-08-07T15:42:35.540492Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:35.155403Z","title":null,"venue":null,"work_id":"357e13e2-e208-4a5f-8ecd-93830484c9b2","year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:22.826660Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:f2152ca09cf780b091751095e81a3d65e8cc38302fb23139bfc19f53b34601cd","observation_id":"adb21f5c-2b62-4a06-b4c6-294df9f95d0c","resolution":{"observed_at":"2026-08-07T15:42:35.305787Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:34.966000Z","title":null,"venue":null,"work_id":"8711fc04-0f94-44bd-9818-74af7f6d1433","year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:22.923453Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:ab5d8382becea63a6ed3e53efc022dffd363481b687d4b7c3cd41fcd17c1b8b3","observation_id":"ef8e2c66-11bc-490a-96b2-52c7ef4f4a05","resolution":{"observed_at":"2026-08-07T15:42:35.060820Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:34.823185Z","title":null,"venue":null,"work_id":"4f75bf9e-8e18-43a3-b99a-42659961c430","year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:23.014155Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:13e188988f9d4ee6a04b3210fcce89bc8fd0910232283159820dff7e9f6fae7a","observation_id":"86d4f465-4b4c-4223-91a8-df8860c40727","resolution":{"observed_at":"2026-08-07T15:42:34.892989Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:34.666125Z","title":null,"venue":null,"work_id":"a1470834-e6dc-4b92-8e98-0ad3a7e50e07","year":2022},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:23.136683Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:732a3e621258db31bdc610a3ebe949259aa6f88d4b6c469ecedf93cadd35f273","observation_id":"d753f713-4f60-428d-adfe-305ab0f63ce4","resolution":{"observed_at":"2026-08-07T15:42:34.737803Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18982","last_updated":"2024-10-08T15:13:01Z","snapshot_observed_at":"2026-07-06T19:39:15.025945Z","submitted_at":"2024-10-08T15:13:01Z","title":"O1 Replication Journey: A Strategic Progress Report -- Part 1","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18982","snapshot_observed_at":"2026-08-07T15:42:23.212775Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:23.212775Z"},"links":{"cited_paper":"/paper/2410.18982","citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:b4de5cdeb299ae11c9c826c309ac90a62284baf3803645163c9887eecab7ff4e","observation_id":"e0f2a2b3-80f0-445d-ad20-e698540706d5","resolution":{"observed_at":"2026-08-07T15:42:23.212775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04691","last_updated":"2025-03-10T17:28:31Z","snapshot_observed_at":"2026-08-07T17:23:53.412693Z","submitted_at":"2025-03-06T18:35:39Z","title":"Quantifying the Reasoning Abilities of LLMs on Real-world Clinical Cases","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04691","snapshot_observed_at":"2026-08-07T15:42:23.341138Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:23.341138Z"},"links":{"cited_paper":"/paper/2503.04691","citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:9c2f46a8778a577d9903df5a97d16e7244108af4ff4a8998ce84cd33bd4105df","observation_id":"c52ef2d4-c7d1-47c7-8cb6-135021e83135","resolution":{"observed_at":"2026-08-07T15:42:23.341138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:34.448895Z","title":null,"venue":null,"work_id":"9a7523d7-ca3c-4364-9881-47345afaae38","year":2023},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:23.423821Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:8ffbe79d2873363b7ace5efe290e9db84323add9e36aa0bd6b16ae18154dded2","observation_id":"7b82acba-893c-41df-b3ed-d825fbb530bc","resolution":{"observed_at":"2026-08-07T15:42:34.518832Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01815","last_updated":"2017-12-05T18:45:38Z","snapshot_observed_at":"2026-08-02T00:39:04.960144Z","submitted_at":"2017-12-05T18:45:38Z","title":"Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01815","snapshot_observed_at":"2026-08-07T15:42:23.541553Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:23.541553Z"},"links":{"cited_paper":"/paper/1712.01815","citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:fcce14684bc4df193ce5ed40497ab4cb38551df56d826e28902e21b9256025bc","observation_id":"143ce6d6-de68-44ed-84b8-5b90c3a4a49a","resolution":{"observed_at":"2026-08-07T15:42:23.541553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T15:42:23.635382Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:23.635382Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:7fc8aa751b0b3f283ab81ba3cf0dba887ea12f04c2658a645bbeafeadd9abacd","observation_id":"03d0adc0-8f96-4fce-9a3e-a7ade274a3dd","resolution":{"observed_at":"2026-08-07T15:42:23.635382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:34.259746Z","title":null,"venue":null,"work_id":"0c28a753-175a-47de-a695-a1e85093458e","year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:23.729601Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:89227a5f85fcd51b9023708d059545a9ce51c23c0afedbd54669421c9cd2bd01","observation_id":"dfb2780e-d949-4312-b15e-44740ee94f1b","resolution":{"observed_at":"2026-08-07T15:42:34.329538Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:34.089236Z","title":null,"venue":null,"work_id":"c8521645-d172-4de7-986c-f3501613e237","year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:23.825815Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:ae37e3860fe15d33b03b4224206c8d537aed9ae26e2dee7518173629bbbe3671","observation_id":"b4bf1c95-d465-4baf-bf40-c34333cbcdc8","resolution":{"observed_at":"2026-08-07T15:42:34.165599Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:33.917572Z","title":null,"venue":null,"work_id":"8f40c44d-6ff7-4ee0-9a3e-6e5cd3b4ca1e","year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:23.921620Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:bec574da9f7b0517a634acc086b718c266406c3364d5168ac47e53b17fcb983e","observation_id":"ec7c2477-4f05-4195-bce0-ed7d2be78f22","resolution":{"observed_at":"2026-08-07T15:42:33.999351Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-07T15:42:24.112367Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:24.112367Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:f9c07531a65dd9632a8cf1bc0612757557b199799fdad6944a2bda49022dbfed","observation_id":"c8024d9a-767f-437d-91b5-064645d21feb","resolution":{"observed_at":"2026-08-07T15:42:24.112367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08833","last_updated":"2024-04-04T15:16:57Z","snapshot_observed_at":"2026-07-06T16:07:10.648879Z","submitted_at":"2023-08-17T07:51:23Z","title":"CMB: A Comprehensive Medical Benchmark in Chinese","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08833","snapshot_observed_at":"2026-08-07T15:42:24.190092Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:24.190092Z"},"links":{"cited_paper":"/paper/2308.08833","citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:a8d9bc073cac0d0a4a3525467021c10e5345ee0b0b6d32bdc1f46c7971dcafff","observation_id":"1f349e7e-9776-4a43-a14d-1feee6535dca","resolution":{"observed_at":"2026-08-07T15:42:24.190092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:24.277569Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:24.277569Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:d9de47802c27598e86a202e9bcc8bedcfefbbc0c38e8a7fd8a0f871b3e58f067","observation_id":"6ca70e4c-e4fc-44f5-9602-498d4d853e7c","resolution":{"observed_at":"2026-08-07T15:42:24.277569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:24.437348Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:24.437348Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:516f55885c43dc273f6b77e1968f49ee6896fda4550f758d36ffd69d970d0a82","observation_id":"b70375a0-142c-47ef-b790-23de3e044cce","resolution":{"observed_at":"2026-08-07T15:42:24.437348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:33.549096Z","title":null,"venue":null,"work_id":"6c80bf14-ce6a-43ef-8d66-090fdc007388","year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:24.591939Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:ab1dc38af5fcb8db16eb84c724868800a3ad5232e2c19bd83d47ba6731d939f7","observation_id":"a1a2fb92-3829-4cc4-b075-bef9db82819a","resolution":{"observed_at":"2026-08-07T15:42:33.625676Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:33.356322Z","title":null,"venue":null,"work_id":"a56501c9-5cc9-46a1-9177-52ac32d35ea7","year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:24.700756Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:7a4ffafcc71ad2d6d7314eeb91d828c7171703475f4774da46567579845a849a","observation_id":"c0d1f68f-f404-453c-94e5-88b1a5f37ff6","resolution":{"observed_at":"2026-08-07T15:42:33.452128Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09213","last_updated":"2025-07-30T08:05:40Z","snapshot_observed_at":"2026-07-06T20:21:42.341172Z","submitted_at":"2025-01-16T00:19:19Z","title":"FineMedLM-o1: Enhancing Medical Knowledge Reasoning Ability of LLM from Supervised Fine-Tuning to Test-Time Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09213","snapshot_observed_at":"2026-08-07T15:42:24.782003Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:24.782003Z"},"links":{"cited_paper":"/paper/2501.09213","citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:c1f888fc86269e892a10d85bdfbb88d7f07662f927b83bf2210ee18095d1e2c1","observation_id":"8e0f9c04-a308-4aa7-ab73-06a7f94f0cf9","resolution":{"observed_at":"2026-08-07T15:42:24.782003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00154","last_updated":"2024-12-10T04:39:25Z","snapshot_observed_at":"2026-08-05T17:55:01.214018Z","submitted_at":"2024-11-29T07:19:56Z","title":"o1-Coder: an o1 Replication for Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00154","snapshot_observed_at":"2026-08-07T15:42:24.855422Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:24.855422Z"},"links":{"cited_paper":"/paper/2412.00154","citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:68d0f4a95d3f0cd5e0c28338a5ffc0c6407a858c41d52f9fcf65a5baad2cd9a5","observation_id":"9ecad0b3-74e9-43dd-a2f4-f0a0ed2b5f08","resolution":{"observed_at":"2026-08-07T15:42:24.855422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:33.194955Z","title":null,"venue":null,"work_id":"08a19b74-73ae-45e2-a442-08b98c46d081","year":2024},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:24.949716Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:32005c49fa673b058f0f0b2cd7a8c98c25ce12c8500eb6b7b2b261c1f800b1ad","observation_id":"bdbf2e02-346c-4d5c-80a6-1ea18350862f","resolution":{"observed_at":"2026-08-07T15:42:33.281918Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18362","last_updated":"2025-06-06T13:00:07Z","snapshot_observed_at":"2026-07-06T20:28:24.203633Z","submitted_at":"2025-01-30T14:07:56Z","title":"MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18362","snapshot_observed_at":"2026-08-07T15:42:25.004807Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:25.004807Z"},"links":{"cited_paper":"/paper/2501.18362","citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:6e4015a72f71458cd23a1b7705b08d3496ea5c0fca9854a39c0db405b123692b","observation_id":"ee58effb-e067-41e3-bf66-4c5f270dcafe","resolution":{"observed_at":"2026-08-07T15:42:25.004807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:33.006320Z","title":null,"venue":null,"work_id":"4de1105c-66fe-423b-95d9-68b50e371e06","year":2024},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:25.067031Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:58ce63ce211505c856e83cc178c41f2bb84774b5210e58224bd71c9259cb54f0","observation_id":"4f9f9bad-5ba3-4f51-a0fb-1237c3b00e20","resolution":{"observed_at":"2026-08-07T15:42:33.096586Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:32.856759Z","title":"- Use appropriate Markdown syntax for headings based on the original heading hierarchy (e.g., ‘#‘, ‘##‘, ‘###‘)","venue":null,"work_id":"9dfb6093-d2fb-4153-b9fd-a0718098a0dd","year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:25.150270Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:5b0648a79c3080e4fa21bfca22930d3ae1e872db27ab838c15f389acc8fc5299","observation_id":"cb762cc9-3243-49ea-adb5-5a1fa467d0ce","resolution":{"observed_at":"2026-08-07T15:42:32.955211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:32.708505Z","title":"- Completely delete citations and footnotes, including their in-text markers","venue":null,"work_id":"56788289-35a5-4e09-b219-223739dc50e0","year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:25.216414Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:de0c1c9091a09d3ac447ff3dc29736aaabf1118a3c6a7f1a21818c406fca9c7e","observation_id":"cbd173d9-fbc5-4850-9362-586f09d2e2d9","resolution":{"observed_at":"2026-08-07T15:42:32.770494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:32.457900Z","title":null,"venue":null,"work_id":"94067276-3fd4-4482-aab8-4985e28170ca","year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:25.292911Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:2bf090f3aeb3f665df70e2f2646751b342764691167c95e751fe3d45a825ec9f","observation_id":"f00fc92c-ce94-42eb-95ef-b59b375244f5","resolution":{"observed_at":"2026-08-07T15:42:32.596816Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:32.138572Z","title":"- Only perform formatting and cleaning adjustments without modifying the original content","venue":null,"work_id":"c03a7907-edb3-4a3a-9eb4-63b12e49f313","year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:25.349954Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:6bbc9c4c9e4f795687352daa6290150d574b2dd7e245ded346f5dc4dae4a964d","observation_id":"0bf3ae46-805e-4e72-a9d4-2a191cdb0763","resolution":{"observed_at":"2026-08-07T15:42:32.345656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:31.731403Z","title":null,"venue":null,"work_id":"4093c321-cedd-4b6b-af91-9c62f05adcad","year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:25.419255Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:ded75abc5999d8e3ab6d7a501af95790a03977c0bcc996a07c4bc3308ebed1e7","observation_id":"3b025b0b-76e8-4009-a527-6f4414c86a56","resolution":{"observed_at":"2026-08-07T15:42:31.993742Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:31.406745Z","title":"- **Prohibited Content**: Any direct diagnostic statements involving disease names","venue":null,"work_id":"d24ee53c-cf88-4b59-b7b4-c3c60a403418","year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:25.491524Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:64709d09fdd756d4a4de90a80a0660523602b7034c737a5d0cc61ee442f5d2b6","observation_id":"fe1a29ce-ff78-487b-b7e8-383fd5d81997","resolution":{"observed_at":"2026-08-07T15:42:31.554814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:31.162331Z","title":null,"venue":null,"work_id":"f81f0fd4-d2b3-49df-b1b1-e5a33c338483","year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:25.553291Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:fc759c26f3b3950770243f5a3b04f0c88d22e2cd925563b137e4456afb8ff4ec","observation_id":"cc00d117-d35b-460e-9deb-1529740beb7b","resolution":{"observed_at":"2026-08-07T15:42:31.228417Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:30.857475Z","title":null,"venue":null,"work_id":"c15cea21-d57c-42d4-9b44-2724eb8a0314","year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:25.614692Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:d566b4676df024575121fef8cb49679a62f7423a6da1b88bd51a8722c7905640","observation_id":"7ec7ea28-49a4-404e-84cf-37fc9aa3e8ac","resolution":{"observed_at":"2026-08-07T15:42:31.015175Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:30.481542Z","title":"DiagnosisArena-MCQ Evaluation Prompt You are an expert in the field of rare diseases","venue":null,"work_id":"1fe18cff-a590-4537-a967-26a87011f897","year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:25.692156Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:78f481debfb052218198ffad4ff83f5135a9226466cb5a643b7355feb74332c2","observation_id":"8ca475ba-f535-4936-94d2-b5a53b8afc8b","resolution":{"observed_at":"2026-08-07T15:42:30.685315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:30.200867Z","title":null,"venue":null,"work_id":"ba9472b1-4b1a-4268-9faf-c812a7d663d6","year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:25.769469Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:d756d8f50b577037ff8f2a4e75d8d5c6aaf8e02991500a97b8b15286d36b0cd0","observation_id":"a19227c1-4dd3-450b-8594-6b35a146e585","resolution":{"observed_at":"2026-08-07T15:42:30.306619Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:29.918094Z","title":"C Cases C.1 Benchmark Cases In this case, Case Information, Physical Examination, and Diagnostic Tests are components of the patient’s medical record","venue":null,"work_id":"6e7e9b41-803a-48be-a1bf-68adab90d33b","year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:25.833573Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:307b6cf9f3ae1f1892227945fd7914fea907e146215cd162510232cd0207ce82","observation_id":"0ae94c43-e39a-435b-b59a-1fd19ee19465","resolution":{"observed_at":"2026-08-07T15:42:30.090590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:29.674846Z","title":"Highly mobile, filamentous, causing embolic symptoms or arrhythmias","venue":null,"work_id":"e2471bb3-df54-40f2-9308-78fce4631327","year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:25.898275Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:5e19c2560ec141c95ea5d302e287a882c892cd980f19a23cc7c13d83e43f125b","observation_id":"83fdf6e5-502b-413a-8de7-2fbffa51c1bf","resolution":{"observed_at":"2026-08-07T15:42:29.800933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:29.457171Z","title":"Could be in LVOT, leading to similar symptoms","venue":null,"work_id":"aaa544e1-768d-4c47-acbb-acbf303f444f","year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:25.969036Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:3c201a432fd91c0a3b15ee935673255a652f8d05c06fa0b03fab2b4836555049","observation_id":"406b80e0-21cc-494b-a5d9-0dee71f9d2ab","resolution":{"observed_at":"2026-08-07T15:42:29.553124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:29.088869Z","title":"Mobile and can cause obstruction","venue":null,"work_id":"8bcbf4d1-338f-4ce5-b0ab-5b62d9df49e1","year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:26.033021Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:9f761ba8ab992d9969691e2547c7a91c0c4d140fce978177a5735dc4bd6985cf","observation_id":"dda23e77-1902-4c30-988e-5ec19956f861","resolution":{"observed_at":"2026-08-07T15:42:29.300596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:28.771423Z","title":null,"venue":null,"work_id":"5d251842-ed96-4b77-8a0e-1aacfe2823a7","year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:26.090955Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:3d71888d1c9e23c47069618bff03360fde859216bae7b9c69659981e4a511438","observation_id":"a5b39362-9d2f-44e3-8ac8-e07a2071d6d2","resolution":{"observed_at":"2026-08-07T15:42:28.890974Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:28.418140Z","title":"Wait, but the movement pattern and CT findings might make fibroelastoma more likely than Lambl’s","venue":null,"work_id":"4863cf6c-904a-4e67-bf9d-635b0ed0a1dd","year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:26.152160Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:fbc4b33719a79e25d93f8ebcbd0ae9418eebe8e1a809ed7b7c8033f475d51565","observation_id":"cac5c5c8-f692-4bac-abe8-81a1ebf3cb64","resolution":{"observed_at":"2026-08-07T15:42:28.599013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:27.736878Z","title":"The key is the mobile mass in LVOT causing possible embolic events (leading to AFib) or obstruction","venue":null,"work_id":"7cc6f62e-2655-41af-a845-a18d1df56055","year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:26.229267Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:7910631930b4ed7c4a6b4bd7e28f99381f731c398e5f4e319eb3cc6d0b09031d","observation_id":"9b4dd91b-2b5a-48e0-a433-31f02bff4043","resolution":{"observed_at":"2026-08-07T15:42:27.907921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:28.091647Z","title":null,"venue":null,"work_id":"ff9cbe1f-1471-4d2e-a355-e334d7432515","year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:26.328940Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:bc3d8e4e47453bc246ec69231b3c5e58a4a42dbe1a42fad3b88a57aa53eb246c","observation_id":"d33dae21-4284-4cfc-8e96-560b5b0f64f2","resolution":{"observed_at":"2026-08-07T15:42:28.214479Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:27.540167Z","title":null,"venue":null,"work_id":"cd3e8bbb-fd73-4fad-ad97-a3b7e7fbf04f","year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:26.489072Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:e6c258c736fde04b8fd9db19eb8c9f5c5498799270499b65cf915818a1c14b23","observation_id":"5ffe65f1-7028-494e-b52a-c5be7314a30a","resolution":{"observed_at":"2026-08-07T15:42:27.623039Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T15:42:21.630549Z","title":"arXiv preprint arXiv:2009.03300","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:21.630549Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:ef05fd2b659f6304298825411e972413ecd2e7def2a543eddcca5e3d72f68ac5","observation_id":"bde34791-774d-430d-b597-946b2915abad","resolution":{"observed_at":"2026-08-07T15:42:21.630549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:33.747114Z","title":"Advances in neural information processing systems, 35:24824–24837","venue":null,"work_id":"60fc9d96-8a3f-469b-aca8-6faebc2bdce1","year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:24.508298Z"},"links":{"citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:ceb11fa750461bc704373cfb77949b6cb9cc9d27f3f4fda51f1b0b48b31a3e66","observation_id":"5ef940ea-ed06-44c9-ae68-bc31d44abad0","resolution":{"observed_at":"2026-08-07T15:42:33.810735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12671","last_updated":"2025-03-05T08:23:04Z","snapshot_observed_at":"2026-08-07T18:09:45.002146Z","submitted_at":"2025-02-18T09:21:12Z","title":"Baichuan-M1: Pushing the Medical Capability of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12671","snapshot_observed_at":"2026-08-07T15:42:24.011816Z","title":"arXiv preprint arXiv:2502.12671","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models","version":4},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:24.011816Z"},"links":{"cited_paper":"/paper/2502.12671","citing_paper":"/paper/2505.14107"},"observation_digest":"sha256:8b0a237aa20c757c9a4334aad42ed244d683375e3acc41fe62a4d4d26ff175b8","observation_id":"4c32e658-c443-46e1-aeed-e7fb5d426ae3","resolution":{"observed_at":"2026-08-07T15:42:24.011816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.14107","last_updated":"2025-05-29T08:24:00Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T23:55:00.741921Z","submitted_at":"2025-05-20T09:14:53Z","title":"DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":3,"unresolved":51,"verified_exact":1,"verified_fuzzy":12},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 10 inbound Pith citation observations for arXiv:2505.14107."}