{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:MLOEEAR64K5MKECMXTSPEQUHNO","short_pith_number":"pith:MLOEEAR6","schema_version":"1.0","canonical_sha256":"62dc42023ee2bac5104cbce4f242876b831df387d218d95e67f6edae5c2cf21d","source":{"kind":"arxiv","id":"2405.19567","version":2},"attestation_state":"computed","paper":{"title":"Dr-LLaVA: Visual Instruction Tuning with Symbolic Clinical Grounding","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL","cs.CV","cs.LG"],"primary_cat":"cs.AI","authors_text":"Ahmed Alaa, Alexander Schubert, Atul J. Butte, Gregory M. Goldgof, Shenghuan Sun, Thomas Hartvigsen, Zhiqing Sun","submitted_at":"2024-05-29T23:19:28Z","abstract_excerpt":"Vision-Language Models (VLM) can support clinicians by analyzing medical images and engaging in natural language interactions to assist in diagnostic and treatment tasks. However, VLMs often exhibit \"hallucinogenic\" behavior, generating textual outputs not grounded in contextual multimodal information. This challenge is particularly pronounced in the medical domain, where we do not only require VLM outputs to be accurate in single interactions but also to be consistent with clinical reasoning and diagnostic pathways throughout multi-turn conversations. For this purpose, we propose a new alignm"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2405.19567","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.AI","submitted_at":"2024-05-29T23:19:28Z","cross_cats_sorted":["cs.CL","cs.CV","cs.LG"],"title_canon_sha256":"f68251dd943060d99847c99df5d3ed5f24ab6469440f9529230d6903864d3150","abstract_canon_sha256":"efab646dfcfc4e8b52a2e1d67752eceb1ec1da14a00af75ee0fdd96d01d2bf47"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:18:26.318135Z","signature_b64":"s1o3iGUA21t0H47O7F8aD7ukRMyT18GUPlKYVwClmrHKfKrc8WbNsVOtqO9scslfpHdnCovRkRTKgSKWqXSYAA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"62dc42023ee2bac5104cbce4f242876b831df387d218d95e67f6edae5c2cf21d","last_reissued_at":"2026-07-05T09:18:26.317524Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:18:26.317524Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Dr-LLaVA: Visual Instruction Tuning with Symbolic Clinical Grounding","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL","cs.CV","cs.LG"],"primary_cat":"cs.AI","authors_text":"Ahmed Alaa, Alexander Schubert, Atul J. Butte, Gregory M. Goldgof, Shenghuan Sun, Thomas Hartvigsen, Zhiqing Sun","submitted_at":"2024-05-29T23:19:28Z","abstract_excerpt":"Vision-Language Models (VLM) can support clinicians by analyzing medical images and engaging in natural language interactions to assist in diagnostic and treatment tasks. However, VLMs often exhibit \"hallucinogenic\" behavior, generating textual outputs not grounded in contextual multimodal information. This challenge is particularly pronounced in the medical domain, where we do not only require VLM outputs to be accurate in single interactions but also to be consistent with clinical reasoning and diagnostic pathways throughout multi-turn conversations. For this purpose, we propose a new alignm"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2405.19567","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2405.19567/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2405.19567","created_at":"2026-07-05T09:18:26.317600+00:00"},{"alias_kind":"arxiv_version","alias_value":"2405.19567v2","created_at":"2026-07-05T09:18:26.317600+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2405.19567","created_at":"2026-07-05T09:18:26.317600+00:00"},{"alias_kind":"pith_short_12","alias_value":"MLOEEAR64K5M","created_at":"2026-07-05T09:18:26.317600+00:00"},{"alias_kind":"pith_short_16","alias_value":"MLOEEAR64K5MKECM","created_at":"2026-07-05T09:18:26.317600+00:00"},{"alias_kind":"pith_short_8","alias_value":"MLOEEAR6","created_at":"2026-07-05T09:18:26.317600+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.28556","citing_title":"IMCBench: A benchmark for multimodal LLMs in Image-grounded Medical Conversations","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20277","citing_title":"Regulating Anatomy-Aware Rewards via Trajectory-Integral Feedback for Volumetric Computed Tomography Analysis","ref_index":57,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/MLOEEAR64K5MKECMXTSPEQUHNO","json":"https://pith.science/pith/MLOEEAR64K5MKECMXTSPEQUHNO.json","graph_json":"https://pith.science/api/pith-number/MLOEEAR64K5MKECMXTSPEQUHNO/graph.json","events_json":"https://pith.science/api/pith-number/MLOEEAR64K5MKECMXTSPEQUHNO/events.json","paper":"https://pith.science/paper/MLOEEAR6"},"agent_actions":{"view_html":"https://pith.science/pith/MLOEEAR64K5MKECMXTSPEQUHNO","download_json":"https://pith.science/pith/MLOEEAR64K5MKECMXTSPEQUHNO.json","view_paper":"https://pith.science/paper/MLOEEAR6","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2405.19567&json=true","fetch_graph":"https://pith.science/api/pith-number/MLOEEAR64K5MKECMXTSPEQUHNO/graph.json","fetch_events":"https://pith.science/api/pith-number/MLOEEAR64K5MKECMXTSPEQUHNO/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/MLOEEAR64K5MKECMXTSPEQUHNO/action/timestamp_anchor","attest_storage":"https://pith.science/pith/MLOEEAR64K5MKECMXTSPEQUHNO/action/storage_attestation","attest_author":"https://pith.science/pith/MLOEEAR64K5MKECMXTSPEQUHNO/action/author_attestation","sign_citation":"https://pith.science/pith/MLOEEAR64K5MKECMXTSPEQUHNO/action/citation_signature","submit_replication":"https://pith.science/pith/MLOEEAR64K5MKECMXTSPEQUHNO/action/replication_record"}},"created_at":"2026-07-05T09:18:26.317600+00:00","updated_at":"2026-07-05T09:18:26.317600+00:00"}