CLIPMem, a leave-one-out alignment-difference metric, shows CLIP memorizes mis-captioned and atypical image-text pairs most, and text-side augmentation or removal of memorized samples can cut memorization while raising utility.
Vitaly Feldman
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Captured by Captions: On Memorization and its Mitigation in CLIP Models
CLIPMem, a leave-one-out alignment-difference metric, shows CLIP memorizes mis-captioned and atypical image-text pairs most, and text-side augmentation or removal of memorized samples can cut memorization while raising utility.