Fine-tuning Llava-1.5 on MM-GEN-generated task-specific questions improves chart, diagram, and spatial reasoning accuracy by 14-29% absolute over the base model.
Sharegpt4v: Improving large multi-modal models with better captions,
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
citation-role summary
background 1
citation-polarity summary
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1roles
background 1polarities
unclear 1representative citing papers
citing papers explorer
-
MM-GEN: Enhancing Task Performance Through Targeted Multimodal Data Curation
Fine-tuning Llava-1.5 on MM-GEN-generated task-specific questions improves chart, diagram, and spatial reasoning accuracy by 14-29% absolute over the base model.