An automated curation pipeline extracts 11M high-fidelity medical image-text pairs from PMC, yielding CLIP and MLLM vision encoders that outperform baselines on 26 benchmarks and a clinical dermatology retrieval task.
InProceedings of the AAAI conference on artificial intelligence, vol
2 Pith papers cite this work. Polarity classification is still indexing.
2
Pith papers citing it
fields
cs.CV 2years
2026 2representative citing papers
Clinical VLMs over-rely on text modality, irrelevant clinical history, and prompt wording when making chest x-ray decisions on MIMIC-CXR data.
citing papers explorer
-
MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models
An automated curation pipeline extracts 11M high-fidelity medical image-text pairs from PMC, yielding CLIP and MLLM vision encoders that outperform baselines on 26 benchmarks and a clinical dermatology retrieval task.
-
Medical Context Distorts Decisions in Clinical Vision Language Models
Clinical VLMs over-rely on text modality, irrelevant clinical history, and prompt wording when making chest x-ray decisions on MIMIC-CXR data.