Guiding adversarial fine-tuning with detailed image captions instead of class labels improves zero-shot adversarial robustness and clean accuracy of CLIP across 16 datasets.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Quality Text, Robust Vision: The Role of Language in Enhancing Visual Robustness of Vision-Language Models
Guiding adversarial fine-tuning with detailed image captions instead of class labels improves zero-shot adversarial robustness and clean accuracy of CLIP across 16 datasets.