Robust-U1 equips MLLMs with self-recovery via supervised fine-tuning, RL using SSIM and CLIP rewards, and joint multimodal reasoning, yielding SOTA robustness on corruption benchmarks.
A semantic decoupling-based two-stage rainy-day attack for revealing weather robustness de- ficiencies in vision-language models.arXiv preprint arXiv:2601.13238,
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2026 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Robust-U1: Can MLLMs Self-Recover Corrupted Visual Content for Robust Understanding?
Robust-U1 equips MLLMs with self-recovery via supervised fine-tuning, RL using SSIM and CLIP rewards, and joint multimodal reasoning, yielding SOTA robustness on corruption benchmarks.