A four-stage training pipeline with a clip-low GRPO variant improves a 1B VLM's emotion recognition accuracy from 78.68% to 81.45% on EmoSet-118K.
Mini-internvl: a flexible-transfer pocket multi-modal model with 5% parameters and 90% performance,
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
citation-role summary
background 1
citation-polarity summary
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1roles
background 1polarities
unclear 1representative citing papers
citing papers explorer
-
CLGRPO: Reasoning Ability Enhancement for Small VLMs
A four-stage training pipeline with a clip-low GRPO variant improves a 1B VLM's emotion recognition accuracy from 78.68% to 81.45% on EmoSet-118K.