Fine-tuning Llava-1.5 on MM-GEN-generated task-specific questions improves chart, diagram, and spatial reasoning accuracy by 14-29% absolute over the base model.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation
Fine-tuning Llava-1.5 on MM-GEN-generated task-specific questions improves chart, diagram, and spatial reasoning accuracy by 14-29% absolute over the base model.