DeepTumorVQA, a 9,262-volume 3D medical VQA benchmark, shows that current vision-language models handle measurement but remain far from clinical-grade lesion recognition and reasoning.
Nlm at imageclef 2018 visual question answering in the medical domain
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
citation-role summary
dataset 1
citation-polarity summary
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1roles
dataset 1polarities
use dataset 1representative citing papers
citing papers explorer
-
Are Vision Language Models Ready for Clinical Diagnosis? A 3D Medical Benchmark for Tumor-centric Visual Question Answering
DeepTumorVQA, a 9,262-volume 3D medical VQA benchmark, shows that current vision-language models handle measurement but remain far from clinical-grade lesion recognition and reasoning.