{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:AEHJQOE6AFCRCFR5FRRG4UOPIS","short_pith_number":"pith:AEHJQOE6","schema_version":"1.0","canonical_sha256":"010e98389e014511163d2c626e51cf44a7f3b1eb590c6b1c677f6ddf01423963","source":{"kind":"arxiv","id":"2404.00578","version":1},"attestation_state":"computed","paper":{"title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Bo Zhao, Fan Bai, Max Q.-H. Meng, Tiejun Huang, Yuxin Du","submitted_at":"2024-03-31T06:55:12Z","abstract_excerpt":"Medical image analysis is essential to clinical diagnosis and treatment, which is increasingly supported by multi-modal large language models (MLLMs). However, previous research has primarily focused on 2D medical images, leaving 3D images under-explored, despite their richer spatial information. This paper aims to advance 3D medical image analysis with MLLMs. To this end, we present a large-scale 3D multi-modal medical dataset, M3D-Data, comprising 120K image-text pairs and 662K instruction-response pairs specifically tailored for various 3D medical tasks, such as image-text retrieval, report"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2404.00578","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2024-03-31T06:55:12Z","cross_cats_sorted":[],"title_canon_sha256":"9b9d65b487eb6059eedabb861979fe8e2b511f8cba18eec4ab820e1f9ac47c08","abstract_canon_sha256":"a2c6ad13c2cbf98aff5701551a2f271c6f7154f68e168cd6dc628b4c304a47fd"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:02:53.793446Z","signature_b64":"5/RFwqk1rM/lpx8VGFmF/ZEH6LYToyOhH8ZErRo3G0LZJVS0w3Nd2p+aVxgGfWFqscTd39ThhfzTky38vZkxCw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"010e98389e014511163d2c626e51cf44a7f3b1eb590c6b1c677f6ddf01423963","last_reissued_at":"2026-07-05T08:02:53.792974Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:02:53.792974Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Bo Zhao, Fan Bai, Max Q.-H. Meng, Tiejun Huang, Yuxin Du","submitted_at":"2024-03-31T06:55:12Z","abstract_excerpt":"Medical image analysis is essential to clinical diagnosis and treatment, which is increasingly supported by multi-modal large language models (MLLMs). However, previous research has primarily focused on 2D medical images, leaving 3D images under-explored, despite their richer spatial information. This paper aims to advance 3D medical image analysis with MLLMs. To this end, we present a large-scale 3D multi-modal medical dataset, M3D-Data, comprising 120K image-text pairs and 662K instruction-response pairs specifically tailored for various 3D medical tasks, such as image-text retrieval, report"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2404.00578","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2404.00578/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2404.00578","created_at":"2026-07-05T08:02:53.793026+00:00"},{"alias_kind":"arxiv_version","alias_value":"2404.00578v1","created_at":"2026-07-05T08:02:53.793026+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2404.00578","created_at":"2026-07-05T08:02:53.793026+00:00"},{"alias_kind":"pith_short_12","alias_value":"AEHJQOE6AFCR","created_at":"2026-07-05T08:02:53.793026+00:00"},{"alias_kind":"pith_short_16","alias_value":"AEHJQOE6AFCRCFR5","created_at":"2026-07-05T08:02:53.793026+00:00"},{"alias_kind":"pith_short_8","alias_value":"AEHJQOE6","created_at":"2026-07-05T08:02:53.793026+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":32,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.25279","citing_title":"MRI2Rep: Autoregressive Structured Report Generation for 3D Liver MRI","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2606.23888","citing_title":"E-MRL: Cross-view Aligned Evidence-driven Multimodal Reinforcement Learning for Reliable 3D Tumor Analysis","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2605.13544","citing_title":"CA-GCL: Cross-Anatomy Global-Local Contrastive Learning for Robust 3D Medical Image Understanding","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2606.30313","citing_title":"TRACE: A Concept Bottleneck Model for Longitudinal 3D Glioblastoma Response Assessment","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2606.11740","citing_title":"UniReason-Med: A Shared Grounded Reasoning Interface for 2D-to-3D Transfer in Medical VQA","ref_index":165,"is_internal_anchor":false},{"citing_arxiv_id":"2606.04365","citing_title":"Multi-Granularity 3D Kidney Lesion Characterization from CT Volumes","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08787","citing_title":"Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2605.24371","citing_title":"SliceWorld: A Predictive and Controllable World-State Model for CT Report Generation","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2606.30313","citing_title":"TRACE: A Concept Bottleneck Model for Longitudinal 3D Glioblastoma Response Assessment","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2605.26621","citing_title":"MedVol-R1: Reward-Driven Evidence Grounding for Volumetric Reasoning Segmentation","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00123","citing_title":"CardioLens: Revealing the Clinical Reality Gap of MLLMs via Multi-Sequence Cardiac MRI Evaluations","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2605.31437","citing_title":"Astra: a generalizable report generation foundation model for 3D computed tomography","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00602","citing_title":"ASAP: Advancing Medical Volumetric Representation Learning with Anatomy-aware Semantically-adaptive Pre-training","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2606.22546","citing_title":"Venice-H1: Failure-Aware Query Re-Ranking with Multi-Scale Grid Signatures for Referring Image Segmentation","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2605.21835","citing_title":"An Open Multi-Center Whole-Body FDG PET/CT Foundation Model for Tumor Segmentation","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20277","citing_title":"Regulating Anatomy-Aware Rewards via Trajectory-Integral Feedback for Volumetric Computed Tomography Analysis","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20525","citing_title":"NeuroQA: A Large-Scale Image-Grounded Benchmark for 3D Brain MRI Understanding","ref_index":73,"is_internal_anchor":false},{"citing_arxiv_id":"2605.15997","citing_title":"Segmentation, Detection and Explanation: A Unified Framework for CT Appearance Reasoning","ref_index":37,"is_internal_anchor":false},{"citing_arxiv_id":"2601.03054","citing_title":"IBISAgent: Reinforcing Pixel-Level Visual Reasoning in MLLMs for Universal Biomedical Object Referring and Segmentation","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12570","citing_title":"M3Net: A Macro-to-Meso-to-Micro Clinical-inspired Hierarchical 3D Network for Pulmonary Nodule Classification","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2605.13544","citing_title":"CA-GCL: Cross-Anatomy Global-Local Contrastive Learning for Robust 3D Medical Image Understanding","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2604.02748","citing_title":"Visual Instruction-Finetuned Language Model for Versatile Brain MR Image Tasks","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2604.04133","citing_title":"Learning Robust Visual Features in Computed Tomography Enables Efficient Transfer Learning for Clinical Tasks","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08787","citing_title":"Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09679","citing_title":"DeepTumorVQA: A Hierarchical 3D CT Benchmark for Stage-Wise Evaluation of Medical VLMs and Tool-Augmented Agents","ref_index":7,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/AEHJQOE6AFCRCFR5FRRG4UOPIS","json":"https://pith.science/pith/AEHJQOE6AFCRCFR5FRRG4UOPIS.json","graph_json":"https://pith.science/api/pith-number/AEHJQOE6AFCRCFR5FRRG4UOPIS/graph.json","events_json":"https://pith.science/api/pith-number/AEHJQOE6AFCRCFR5FRRG4UOPIS/events.json","paper":"https://pith.science/paper/AEHJQOE6"},"agent_actions":{"view_html":"https://pith.science/pith/AEHJQOE6AFCRCFR5FRRG4UOPIS","download_json":"https://pith.science/pith/AEHJQOE6AFCRCFR5FRRG4UOPIS.json","view_paper":"https://pith.science/paper/AEHJQOE6","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2404.00578&json=true","fetch_graph":"https://pith.science/api/pith-number/AEHJQOE6AFCRCFR5FRRG4UOPIS/graph.json","fetch_events":"https://pith.science/api/pith-number/AEHJQOE6AFCRCFR5FRRG4UOPIS/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/AEHJQOE6AFCRCFR5FRRG4UOPIS/action/timestamp_anchor","attest_storage":"https://pith.science/pith/AEHJQOE6AFCRCFR5FRRG4UOPIS/action/storage_attestation","attest_author":"https://pith.science/pith/AEHJQOE6AFCRCFR5FRRG4UOPIS/action/author_attestation","sign_citation":"https://pith.science/pith/AEHJQOE6AFCRCFR5FRRG4UOPIS/action/citation_signature","submit_replication":"https://pith.science/pith/AEHJQOE6AFCRCFR5FRRG4UOPIS/action/replication_record"}},"created_at":"2026-07-05T08:02:53.793026+00:00","updated_at":"2026-07-05T08:02:53.793026+00:00"}