{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:EJP7CXB4DQ2LCN6CTIDNNIJQSD","short_pith_number":"pith:EJP7CXB4","schema_version":"1.0","canonical_sha256":"225ff15c3c1c34b137c29a06d6a13090ff42b02e2256d71b9e4d89854a21e781","source":{"kind":"arxiv","id":"2503.10647","version":1},"attestation_state":"computed","paper":{"title":"The Reliability of LLMs for Medical Diagnosis: An Examination of Consistency, Manipulation, and Contextual Awareness","license":"http://creativecommons.org/licenses/by-sa/4.0/","headline":"","cross_cats":["cs.AI","cs.CY","cs.HC"],"primary_cat":"cs.CL","authors_text":"Krishna Subedi","submitted_at":"2025-03-02T11:50:16Z","abstract_excerpt":"Universal healthcare access is critically needed, especially in resource-limited settings. Large Language Models (LLMs) offer promise for democratizing healthcare with advanced diagnostics, but their reliability requires thorough evaluation, especially in trust-dependent environments. This study assesses LLMs' diagnostic reliability focusing on consistency, manipulation resilience, and contextual integration, crucial for safe and ethical use in universal healthcare.\n  We evaluated leading LLMs using 52 patient cases, expanded into variants with demographic changes, symptom rewordings, and exam"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2503.10647","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-sa/4.0/","primary_cat":"cs.CL","submitted_at":"2025-03-02T11:50:16Z","cross_cats_sorted":["cs.AI","cs.CY","cs.HC"],"title_canon_sha256":"d2e22c8ac9b158a91d3b0a204570faf5da8b1eea86076a551e52b88d757da8ff","abstract_canon_sha256":"929176d3f778b9261fdcd4d6e30c602a9fb52f91e3b5a3c011acf37e95029faf"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:31:28.161819Z","signature_b64":"e3VekHplZD1tMnXBD3Qei8LBkOaPjYbju+pTPIco3tRSXqsJB7MgHGIyCvG84TAXv4IMfNmQjF/shmYlk/tJAg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"225ff15c3c1c34b137c29a06d6a13090ff42b02e2256d71b9e4d89854a21e781","last_reissued_at":"2026-07-05T10:31:28.160707Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:31:28.160707Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"The Reliability of LLMs for Medical Diagnosis: An Examination of Consistency, Manipulation, and Contextual Awareness","license":"http://creativecommons.org/licenses/by-sa/4.0/","headline":"","cross_cats":["cs.AI","cs.CY","cs.HC"],"primary_cat":"cs.CL","authors_text":"Krishna Subedi","submitted_at":"2025-03-02T11:50:16Z","abstract_excerpt":"Universal healthcare access is critically needed, especially in resource-limited settings. Large Language Models (LLMs) offer promise for democratizing healthcare with advanced diagnostics, but their reliability requires thorough evaluation, especially in trust-dependent environments. This study assesses LLMs' diagnostic reliability focusing on consistency, manipulation resilience, and contextual integration, crucial for safe and ethical use in universal healthcare.\n  We evaluated leading LLMs using 52 patient cases, expanded into variants with demographic changes, symptom rewordings, and exam"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2503.10647","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2503.10647/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2503.10647","created_at":"2026-07-05T10:31:28.160854+00:00"},{"alias_kind":"arxiv_version","alias_value":"2503.10647v1","created_at":"2026-07-05T10:31:28.160854+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2503.10647","created_at":"2026-07-05T10:31:28.160854+00:00"},{"alias_kind":"pith_short_12","alias_value":"EJP7CXB4DQ2L","created_at":"2026-07-05T10:31:28.160854+00:00"},{"alias_kind":"pith_short_16","alias_value":"EJP7CXB4DQ2LCN6C","created_at":"2026-07-05T10:31:28.160854+00:00"},{"alias_kind":"pith_short_8","alias_value":"EJP7CXB4","created_at":"2026-07-05T10:31:28.160854+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2605.30646","citing_title":"Same Patient, Different Words, Different Diagnosis? Evaluating Semantic Stability in Clinical LLMs","ref_index":2,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/EJP7CXB4DQ2LCN6CTIDNNIJQSD","json":"https://pith.science/pith/EJP7CXB4DQ2LCN6CTIDNNIJQSD.json","graph_json":"https://pith.science/api/pith-number/EJP7CXB4DQ2LCN6CTIDNNIJQSD/graph.json","events_json":"https://pith.science/api/pith-number/EJP7CXB4DQ2LCN6CTIDNNIJQSD/events.json","paper":"https://pith.science/paper/EJP7CXB4"},"agent_actions":{"view_html":"https://pith.science/pith/EJP7CXB4DQ2LCN6CTIDNNIJQSD","download_json":"https://pith.science/pith/EJP7CXB4DQ2LCN6CTIDNNIJQSD.json","view_paper":"https://pith.science/paper/EJP7CXB4","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2503.10647&json=true","fetch_graph":"https://pith.science/api/pith-number/EJP7CXB4DQ2LCN6CTIDNNIJQSD/graph.json","fetch_events":"https://pith.science/api/pith-number/EJP7CXB4DQ2LCN6CTIDNNIJQSD/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/EJP7CXB4DQ2LCN6CTIDNNIJQSD/action/timestamp_anchor","attest_storage":"https://pith.science/pith/EJP7CXB4DQ2LCN6CTIDNNIJQSD/action/storage_attestation","attest_author":"https://pith.science/pith/EJP7CXB4DQ2LCN6CTIDNNIJQSD/action/author_attestation","sign_citation":"https://pith.science/pith/EJP7CXB4DQ2LCN6CTIDNNIJQSD/action/citation_signature","submit_replication":"https://pith.science/pith/EJP7CXB4DQ2LCN6CTIDNNIJQSD/action/replication_record"}},"created_at":"2026-07-05T10:31:28.160854+00:00","updated_at":"2026-07-05T10:31:28.160854+00:00"}