CONCAP combines retrieved captions with retrieved concepts to improve multilingual image captioning, reaching 34.2 average CIDEr on XM3600 against 31.8 for Pangea and 25.9 for mBLIP while training on 566K pairs.
The Faiss library
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CL 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning
CONCAP combines retrieved captions with retrieved concepts to improve multilingual image captioning, reaching 34.2 average CIDEr on XM3600 against 31.8 for Pangea and 25.9 for mBLIP while training on 566K pairs.