VSUA improves image captioning by representing images as graphs of visual semantic units and using context-gated attention to align words with objects, attributes, and relations.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2019 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Aligning Linguistic Words and Visual Semantic Units for Image Captioning
VSUA improves image captioning by representing images as graphs of visual semantic units and using context-gated attention to align words with objects, attributes, and relations.