{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:R3S37PPA4KAUCNEY4SY3ZAIST4","short_pith_number":"pith:R3S37PPA","schema_version":"1.0","canonical_sha256":"8ee5bfbde0e281413498e4b1bc81129f009d04c692ccd12b95fa1af793b45fee","source":{"kind":"arxiv","id":"2410.14200","version":1},"attestation_state":"computed","paper":{"title":"E3D-GPT: Enhanced 3D Visual Foundation for Medical Vision-Language Model","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["cs.CL","cs.CV"],"primary_cat":"eess.IV","authors_text":"Haoran Lai, Qingsong Yao, Rongsheng Wang, S.Kevin Zhou, Weifu Lv, Wei Wei, Xiaodong Tao, Zhiyang He, Zihang Jiang","submitted_at":"2024-10-18T06:31:40Z","abstract_excerpt":"The development of 3D medical vision-language models holds significant potential for disease diagnosis and patient treatment. However, compared to 2D medical images, 3D medical images, such as CT scans, face challenges related to limited training data and high dimension, which severely restrict the progress of 3D medical vision-language models. To address these issues, we collect a large amount of unlabeled 3D CT data and utilize self-supervised learning to construct a 3D visual foundation model for extracting 3D visual features. Then, we apply 3D spatial convolutions to aggregate and project "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2410.14200","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"eess.IV","submitted_at":"2024-10-18T06:31:40Z","cross_cats_sorted":["cs.CL","cs.CV"],"title_canon_sha256":"466ca5dc0c4328f9933d278dbe1a59ec928df43963011a170151fae3e6d7c43a","abstract_canon_sha256":"163ff61e25d8ca907167fb0a225acb011b70bf73657b07a48125314abc2dd0fd"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:22:28.974781Z","signature_b64":"MvJ+KXUr8U6vNtZVJirJwEevhIEHQGkB0fFdYzIOGKJOCyICz5v3wGQiR2saCLC5Fnr7iywrAOC180BfWtnfDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"8ee5bfbde0e281413498e4b1bc81129f009d04c692ccd12b95fa1af793b45fee","last_reissued_at":"2026-07-05T09:22:28.974177Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:22:28.974177Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"E3D-GPT: Enhanced 3D Visual Foundation for Medical Vision-Language Model","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["cs.CL","cs.CV"],"primary_cat":"eess.IV","authors_text":"Haoran Lai, Qingsong Yao, Rongsheng Wang, S.Kevin Zhou, Weifu Lv, Wei Wei, Xiaodong Tao, Zhiyang He, Zihang Jiang","submitted_at":"2024-10-18T06:31:40Z","abstract_excerpt":"The development of 3D medical vision-language models holds significant potential for disease diagnosis and patient treatment. However, compared to 2D medical images, 3D medical images, such as CT scans, face challenges related to limited training data and high dimension, which severely restrict the progress of 3D medical vision-language models. To address these issues, we collect a large amount of unlabeled 3D CT data and utilize self-supervised learning to construct a 3D visual foundation model for extracting 3D visual features. Then, we apply 3D spatial convolutions to aggregate and project "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.14200","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2410.14200/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2410.14200","created_at":"2026-07-05T09:22:28.974235+00:00"},{"alias_kind":"arxiv_version","alias_value":"2410.14200v1","created_at":"2026-07-05T09:22:28.974235+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.14200","created_at":"2026-07-05T09:22:28.974235+00:00"},{"alias_kind":"pith_short_12","alias_value":"R3S37PPA4KAU","created_at":"2026-07-05T09:22:28.974235+00:00"},{"alias_kind":"pith_short_16","alias_value":"R3S37PPA4KAUCNEY","created_at":"2026-07-05T09:22:28.974235+00:00"},{"alias_kind":"pith_short_8","alias_value":"R3S37PPA","created_at":"2026-07-05T09:22:28.974235+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":7,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.17213","citing_title":"Revisiting LLM Adaptation for 3D CT Report Generation: A Study of Scaling and Diagnostic Priors","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08787","citing_title":"Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17765","citing_title":"AURORA: Contextual Orthogonalization for Geometric Representation Learning in Healthcare Foundation Models","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08685","citing_title":"Event Fields: Learning Latent Event Structure for Waveform Foundation Models","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08787","citing_title":"Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09765","citing_title":"WISTERIA: Learning Clinical Representations from Noisy Supervision via Multi-View Consistency in Electronic Health Records","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2604.16729","citing_title":"Agentic Large Language Models for Training-Free Neuro-Radiological Image Analysis","ref_index":15,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/R3S37PPA4KAUCNEY4SY3ZAIST4","json":"https://pith.science/pith/R3S37PPA4KAUCNEY4SY3ZAIST4.json","graph_json":"https://pith.science/api/pith-number/R3S37PPA4KAUCNEY4SY3ZAIST4/graph.json","events_json":"https://pith.science/api/pith-number/R3S37PPA4KAUCNEY4SY3ZAIST4/events.json","paper":"https://pith.science/paper/R3S37PPA"},"agent_actions":{"view_html":"https://pith.science/pith/R3S37PPA4KAUCNEY4SY3ZAIST4","download_json":"https://pith.science/pith/R3S37PPA4KAUCNEY4SY3ZAIST4.json","view_paper":"https://pith.science/paper/R3S37PPA","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2410.14200&json=true","fetch_graph":"https://pith.science/api/pith-number/R3S37PPA4KAUCNEY4SY3ZAIST4/graph.json","fetch_events":"https://pith.science/api/pith-number/R3S37PPA4KAUCNEY4SY3ZAIST4/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/R3S37PPA4KAUCNEY4SY3ZAIST4/action/timestamp_anchor","attest_storage":"https://pith.science/pith/R3S37PPA4KAUCNEY4SY3ZAIST4/action/storage_attestation","attest_author":"https://pith.science/pith/R3S37PPA4KAUCNEY4SY3ZAIST4/action/author_attestation","sign_citation":"https://pith.science/pith/R3S37PPA4KAUCNEY4SY3ZAIST4/action/citation_signature","submit_replication":"https://pith.science/pith/R3S37PPA4KAUCNEY4SY3ZAIST4/action/replication_record"}},"created_at":"2026-07-05T09:22:28.974235+00:00","updated_at":"2026-07-05T09:22:28.974235+00:00"}