{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:RV4BK2TINJJE4KX3MJST3QSER3","short_pith_number":"pith:RV4BK2TI","schema_version":"1.0","canonical_sha256":"8d78156a686a524e2afb62653dc2448ec3fc496e630f9eb35da3c604cb5e672f","source":{"kind":"arxiv","id":"2502.09838","version":3},"attestation_state":"computed","paper":{"title":"HealthGPT: A Medical Large Vision-Language Model for Unifying Comprehension and Generation via Heterogeneous Knowledge Adaptation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Beng Chin Ooi, Binhe Yu, Hao Jiang, Haoyuan Li, Hui Lin, Jun Xiao, Mengze Li, Sijing Li, Siliang Tang, Tianwei Lin, Wanggui He, Wenqiao Zhang, Xiaohui Song, Yueting Zhuang, Yuqian Yuan","submitted_at":"2025-02-14T00:42:36Z","abstract_excerpt":"We present HealthGPT, a powerful Medical Large Vision-Language Model (Med-LVLM) that integrates medical visual comprehension and generation capabilities within a unified autoregressive paradigm. Our bootstrapping philosophy is to progressively adapt heterogeneous comprehension and generation knowledge to pre-trained large language models (LLMs). This is achieved through a novel heterogeneous low-rank adaptation (H-LoRA) technique, which is complemented by a tailored hierarchical visual perception approach and a three-stage learning strategy. To effectively learn the HealthGPT, we devise a comp"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.09838","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-02-14T00:42:36Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"b02b2c8cb69a75c6f1b4385d6ddd671b855b26ad239aba5caf727460d04f3ff5","abstract_canon_sha256":"923395a4c36d5c5529b6ae2c494cd5a904ff551f5d8db211ca1a70da6da1fe52"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:17:54.320670Z","signature_b64":"ozNITCzFMh//fR1rox5hsdrcFSQDxjP7Q7NheHr9SmNWQheH3NnQ3DQLLOrd0HOBz/fEY4nBVYx832Z2FEUiAw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"8d78156a686a524e2afb62653dc2448ec3fc496e630f9eb35da3c604cb5e672f","last_reissued_at":"2026-07-05T10:17:54.320187Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:17:54.320187Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"HealthGPT: A Medical Large Vision-Language Model for Unifying Comprehension and Generation via Heterogeneous Knowledge Adaptation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Beng Chin Ooi, Binhe Yu, Hao Jiang, Haoyuan Li, Hui Lin, Jun Xiao, Mengze Li, Sijing Li, Siliang Tang, Tianwei Lin, Wanggui He, Wenqiao Zhang, Xiaohui Song, Yueting Zhuang, Yuqian Yuan","submitted_at":"2025-02-14T00:42:36Z","abstract_excerpt":"We present HealthGPT, a powerful Medical Large Vision-Language Model (Med-LVLM) that integrates medical visual comprehension and generation capabilities within a unified autoregressive paradigm. Our bootstrapping philosophy is to progressively adapt heterogeneous comprehension and generation knowledge to pre-trained large language models (LLMs). This is achieved through a novel heterogeneous low-rank adaptation (H-LoRA) technique, which is complemented by a tailored hierarchical visual perception approach and a three-stage learning strategy. To effectively learn the HealthGPT, we devise a comp"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.09838","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.09838/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.09838","created_at":"2026-07-05T10:17:54.320247+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.09838v3","created_at":"2026-07-05T10:17:54.320247+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.09838","created_at":"2026-07-05T10:17:54.320247+00:00"},{"alias_kind":"pith_short_12","alias_value":"RV4BK2TINJJE","created_at":"2026-07-05T10:17:54.320247+00:00"},{"alias_kind":"pith_short_16","alias_value":"RV4BK2TINJJE4KX3","created_at":"2026-07-05T10:17:54.320247+00:00"},{"alias_kind":"pith_short_8","alias_value":"RV4BK2TI","created_at":"2026-07-05T10:17:54.320247+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":19,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.23888","citing_title":"E-MRL: Cross-view Aligned Evidence-driven Multimodal Reinforcement Learning for Reliable 3D Tumor Analysis","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2606.11740","citing_title":"UniReason-Med: A Shared Grounded Reasoning Interface for 2D-to-3D Transfer in Medical VQA","ref_index":78,"is_internal_anchor":false},{"citing_arxiv_id":"2606.30577","citing_title":"APRIL-MedSeg: A Modular Medical Image Segmentation Toolbox Embracing Modern Paradigms","ref_index":168,"is_internal_anchor":false},{"citing_arxiv_id":"2605.22547","citing_title":"Case-Aware Medical Image Classification with Multimodal Knowledge Graphs and Reliability-Guided Refinement","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2606.30577","citing_title":"APRIL-MedSeg: A Modular Medical Image Segmentation Toolbox Embracing Modern Paradigms","ref_index":143,"is_internal_anchor":false},{"citing_arxiv_id":"2605.26102","citing_title":"InstructSAM: Segment Any Instance with Any Instructions","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2605.30011","citing_title":"VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2605.22547","citing_title":"Case-Aware Medical Image Classification with Multimodal Knowledge Graphs and Reliability-Guided Refinement","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2602.01167","citing_title":"Do All Individual Layers Help? An Empirical Study of Task-Interfering Layers in Vision-Language Models","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20277","citing_title":"Regulating Anatomy-Aware Rewards via Trajectory-Integral Feedback for Volumetric Computed Tomography Analysis","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18621","citing_title":"CrossView Suite: Harnessing Cross-view Spatial Intelligence of MLLMs with Dataset, Model and Benchmark","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19559","citing_title":"EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2506.05831","citing_title":"HeartcareGPT: A Unified Multimodal ECG Suite for Dual Signal-Image Modeling and Understanding","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2510.26083","citing_title":"Nirvana: A Specialized Generalist Model With Task-Aware Memory Mechanism","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2603.20698","citing_title":"Clinical Cognition Alignment for Gastrointestinal Diagnosis with Multimodal LLMs","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10755","citing_title":"MMRareBench: A Rare-Disease Multimodal and Multi-Image Medical Benchmark","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10755","citing_title":"MMRareBench: A Rare-Disease Multimodal and Multi-Image Medical Benchmark","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2604.11789","citing_title":"LMMs Meet Object-Centric Vision: Understanding, Segmentation, Editing and Generation","ref_index":93,"is_internal_anchor":false},{"citing_arxiv_id":"2604.13756","citing_title":"MedRCube: A Multidimensional Framework for Fine-Grained and In-Depth Evaluation of MLLMs in Medical Imaging","ref_index":36,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/RV4BK2TINJJE4KX3MJST3QSER3","json":"https://pith.science/pith/RV4BK2TINJJE4KX3MJST3QSER3.json","graph_json":"https://pith.science/api/pith-number/RV4BK2TINJJE4KX3MJST3QSER3/graph.json","events_json":"https://pith.science/api/pith-number/RV4BK2TINJJE4KX3MJST3QSER3/events.json","paper":"https://pith.science/paper/RV4BK2TI"},"agent_actions":{"view_html":"https://pith.science/pith/RV4BK2TINJJE4KX3MJST3QSER3","download_json":"https://pith.science/pith/RV4BK2TINJJE4KX3MJST3QSER3.json","view_paper":"https://pith.science/paper/RV4BK2TI","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.09838&json=true","fetch_graph":"https://pith.science/api/pith-number/RV4BK2TINJJE4KX3MJST3QSER3/graph.json","fetch_events":"https://pith.science/api/pith-number/RV4BK2TINJJE4KX3MJST3QSER3/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/RV4BK2TINJJE4KX3MJST3QSER3/action/timestamp_anchor","attest_storage":"https://pith.science/pith/RV4BK2TINJJE4KX3MJST3QSER3/action/storage_attestation","attest_author":"https://pith.science/pith/RV4BK2TINJJE4KX3MJST3QSER3/action/author_attestation","sign_citation":"https://pith.science/pith/RV4BK2TINJJE4KX3MJST3QSER3/action/citation_signature","submit_replication":"https://pith.science/pith/RV4BK2TINJJE4KX3MJST3QSER3/action/replication_record"}},"created_at":"2026-07-05T10:17:54.320247+00:00","updated_at":"2026-07-05T10:17:54.320247+00:00"}