{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:YEBWTL32ROCKEEYS5KFUPILYIP","short_pith_number":"pith:YEBWTL32","schema_version":"1.0","canonical_sha256":"c10369af7a8b84a21312ea8b47a17843e706cafc056c00998c62af19d82314d1","source":{"kind":"arxiv","id":"2505.11733","version":2},"attestation_state":"computed","paper":{"title":"MedCaseReasoning: Evaluating and learning diagnostic reasoning from clinical case reports","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Alejandro Lozano, Angela Zhang, Arvind Suresh, Eric Wu, Jacqueline J. Tao, James Zou, Kevin Wei, Kevin Wu, Min Woo Sun, Rahul Thapa","submitted_at":"2025-05-16T22:34:36Z","abstract_excerpt":"Doctors and patients alike increasingly use Large Language Models (LLMs) to diagnose clinical cases. However, unlike domains such as math or coding, where correctness can be objectively defined by the final answer, medical diagnosis requires both the outcome and the reasoning process to be accurate. Currently, widely used medical benchmarks like MedQA and MMLU assess only accuracy in the final answer, overlooking the quality and faithfulness of the clinical reasoning process. To address this limitation, we introduce MedCaseReasoning, the first open-access dataset for evaluating LLMs on their a"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2505.11733","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2025-05-16T22:34:36Z","cross_cats_sorted":[],"title_canon_sha256":"4794b45d6ef1562acb2c37bb2eb3bbe809339ff1a70851e6da0f3694e89a96ae","abstract_canon_sha256":"db278be9f29dc52cdb873bacfaf3ad1934064453a222786723c0f5f1830ecf11"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:06:13.616423Z","signature_b64":"M8D6X65QbOAJYrWJ/iBnR3hmrcf4aniEobG/dIIAoPe6HhIZQPhtH42wKv5GQ9vm+VC6Ga7tqDjUjVt6OL+4DA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"c10369af7a8b84a21312ea8b47a17843e706cafc056c00998c62af19d82314d1","last_reissued_at":"2026-07-05T11:06:13.615892Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:06:13.615892Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"MedCaseReasoning: Evaluating and learning diagnostic reasoning from clinical case reports","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Alejandro Lozano, Angela Zhang, Arvind Suresh, Eric Wu, Jacqueline J. Tao, James Zou, Kevin Wei, Kevin Wu, Min Woo Sun, Rahul Thapa","submitted_at":"2025-05-16T22:34:36Z","abstract_excerpt":"Doctors and patients alike increasingly use Large Language Models (LLMs) to diagnose clinical cases. However, unlike domains such as math or coding, where correctness can be objectively defined by the final answer, medical diagnosis requires both the outcome and the reasoning process to be accurate. Currently, widely used medical benchmarks like MedQA and MMLU assess only accuracy in the final answer, overlooking the quality and faithfulness of the clinical reasoning process. To address this limitation, we introduce MedCaseReasoning, the first open-access dataset for evaluating LLMs on their a"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2505.11733","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2505.11733/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2505.11733","created_at":"2026-07-05T11:06:13.615960+00:00"},{"alias_kind":"arxiv_version","alias_value":"2505.11733v2","created_at":"2026-07-05T11:06:13.615960+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.11733","created_at":"2026-07-05T11:06:13.615960+00:00"},{"alias_kind":"pith_short_12","alias_value":"YEBWTL32ROCK","created_at":"2026-07-05T11:06:13.615960+00:00"},{"alias_kind":"pith_short_16","alias_value":"YEBWTL32ROCKEEYS","created_at":"2026-07-05T11:06:13.615960+00:00"},{"alias_kind":"pith_short_8","alias_value":"YEBWTL32","created_at":"2026-07-05T11:06:13.615960+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":12,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.30295","citing_title":"MedCase-Structured: A Text-to-FHIR Dataset for Benchmarking Diagnostic Reasoning in Clinically Realistic EHR Settings","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2606.05436","citing_title":"Ten Headache Specialists versus Artificial Intelligence for Clinical Literature Summarization: A Critical Evaluation and Comparison","ref_index":162,"is_internal_anchor":false},{"citing_arxiv_id":"2605.30295","citing_title":"MedCase-Structured: A Text-to-FHIR Dataset for Benchmarking Diagnostic Reasoning in Clinically Realistic EHR Settings","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2605.30295","citing_title":"MedCase-Structured: A Text-to-FHIR Dataset for Benchmarking Diagnostic Reasoning in Clinically Realistic EHR Settings","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01301","citing_title":"Med-HEAL: Analyzing and Mitigating Hallucinations in Medical LLMs with Hallucination-Aware In-Context Learning","ref_index":53,"is_internal_anchor":false},{"citing_arxiv_id":"2605.23629","citing_title":"DDX-TRACE: A Benchmark for Medical Diagnostic Trajectories in VLMs","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2605.22047","citing_title":"Active Evidence-Seeking and Diagnostic Reasoning in Large Language Models for Clinical Decision Support","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2603.24649","citing_title":"MedOpenClaw and MedFlowBench: Auditing Medical Agents in Full-Study Workflows","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2603.27820","citing_title":"Improving Clinical Diagnosis with Counterfactual Multi-Agent Reasoning","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10755","citing_title":"MMRareBench: A Rare-Disease Multimodal and Multi-Image Medical Benchmark","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10755","citing_title":"MMRareBench: A Rare-Disease Multimodal and Multi-Image Medical Benchmark","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2604.08016","citing_title":"Wiring the 'Why': A Unified Taxonomy and Survey of Abductive Reasoning in LLMs","ref_index":102,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/YEBWTL32ROCKEEYS5KFUPILYIP","json":"https://pith.science/pith/YEBWTL32ROCKEEYS5KFUPILYIP.json","graph_json":"https://pith.science/api/pith-number/YEBWTL32ROCKEEYS5KFUPILYIP/graph.json","events_json":"https://pith.science/api/pith-number/YEBWTL32ROCKEEYS5KFUPILYIP/events.json","paper":"https://pith.science/paper/YEBWTL32"},"agent_actions":{"view_html":"https://pith.science/pith/YEBWTL32ROCKEEYS5KFUPILYIP","download_json":"https://pith.science/pith/YEBWTL32ROCKEEYS5KFUPILYIP.json","view_paper":"https://pith.science/paper/YEBWTL32","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2505.11733&json=true","fetch_graph":"https://pith.science/api/pith-number/YEBWTL32ROCKEEYS5KFUPILYIP/graph.json","fetch_events":"https://pith.science/api/pith-number/YEBWTL32ROCKEEYS5KFUPILYIP/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/YEBWTL32ROCKEEYS5KFUPILYIP/action/timestamp_anchor","attest_storage":"https://pith.science/pith/YEBWTL32ROCKEEYS5KFUPILYIP/action/storage_attestation","attest_author":"https://pith.science/pith/YEBWTL32ROCKEEYS5KFUPILYIP/action/author_attestation","sign_citation":"https://pith.science/pith/YEBWTL32ROCKEEYS5KFUPILYIP/action/citation_signature","submit_replication":"https://pith.science/pith/YEBWTL32ROCKEEYS5KFUPILYIP/action/replication_record"}},"created_at":"2026-07-05T11:06:13.615960+00:00","updated_at":"2026-07-05T11:06:13.615960+00:00"}