CFPO is a counterfactual policy optimization method that regularizes RL policies in LVLMs by maximizing prediction discrepancy under suppressed visual cues, reporting 3-6% gains over baselines.
Cf- vlm: Counterfactual vision-language fine-tuning.arXiv preprint arXiv:2506.17267,
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2026 1verdicts
UNVERDICTED 1representative citing papers
citing papers explorer
-
CFPO: Counterfactual Policy Optimization for Multimodal Reasoning
CFPO is a counterfactual policy optimization method that regularizes RL policies in LVLMs by maximizing prediction discrepancy under suppressed visual cues, reporting 3-6% gains over baselines.