Randomly masking image patches when generating conditional prompts improves unseen-class accuracy for CoCoOp-style CLIP prompt learning by about 1 to 2 points on average, with negligible extra cost.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Accelerating Conditional Prompt Learning via Masked Image Modeling for Vision-Language Models
Randomly masking image patches when generating conditional prompts improves unseen-class accuracy for CoCoOp-style CLIP prompt learning by about 1 to 2 points on average, with negligible extra cost.