An automated curation pipeline extracts 11M high-fidelity medical image-text pairs from PMC, yielding CLIP and MLLM vision encoders that outperform baselines on 26 benchmarks and a clinical dermatology retrieval task.
Title resolution pending
2 Pith papers cite this work. Polarity classification is still indexing.
years
2026 2representative citing papers
MLLMs exhibit a consistent recognition-reasoning inversion on discrete visual symbols across domains, underperforming on elementary perception while appearing competent on higher-level reasoning via linguistic compensation.
citing papers explorer
-
MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models
An automated curation pipeline extracts 11M high-fidelity medical image-text pairs from PMC, yielding CLIP and MLLM vision encoders that outperform baselines on 26 benchmarks and a clinical dermatology retrieval task.
-
Cognitive Mismatch in Multimodal Large Language Models for Discrete Symbol Understanding
MLLMs exhibit a consistent recognition-reasoning inversion on discrete visual symbols across domains, underperforming on elementary perception while appearing competent on higher-level reasoning via linguistic compensation.