AHNPL improves compositional reasoning in VLMs by generating image-side hard negatives from text embedding shifts and adding adaptive contrastive losses.
Adaptive prompt-based semantic embedding with inspire potential of implicit knowledge for cross-modal retrieval
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models
AHNPL improves compositional reasoning in VLMs by generating image-side hard negatives from text embedding shifts and adding adaptive contrastive losses.