MaxMatch uses one-to-one optimal assignment between image and text embedding sets plus two diversity losses, and reports state-of-the-art image-text retrieval on MS-COCO and Flickr30k.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Maximal Matching Matters: Preventing Representation Collapse for Robust Cross-Modal Retrieval
MaxMatch uses one-to-one optimal assignment between image and text embedding sets plus two diversity losses, and reports state-of-the-art image-text retrieval on MS-COCO and Flickr30k.