Post-training of VLMs exhibits perception-reasoning asymmetry from token imbalance in SFT and reward coupling in RL, mitigated by loss reweighting (up to 18.2 gain) and perception-aware rewards (up to 6.0 gain).
In Proceedings of the IEEE/CVF International Conference on Computer Vision, pages 2376–2385
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CL 1years
2026 1verdicts
UNVERDICTED 1representative citing papers
citing papers explorer
-
On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training
Post-training of VLMs exhibits perception-reasoning asymmetry from token imbalance in SFT and reward coupling in RL, mitigated by loss reweighting (up to 18.2 gain) and perception-aware rewards (up to 6.0 gain).