AHNPL improves compositional reasoning in VLMs by generating image-side hard negatives from text embedding shifts and adding adaptive contrastive losses.
Image segmentation using text and image prompts
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Visual Perturbation and Adaptive Hard Negative Contrastive Learning for Compositional Reasoning in Vision-Language Models
AHNPL improves compositional reasoning in VLMs by generating image-side hard negatives from text embedding shifts and adding adaptive contrastive losses.