A two-stream BERT-style model pretrained on weakly aligned image-caption data transfers to VQA, VCR, referring expressions, and retrieval, outperforming task-specific models on all four.
Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2019 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks
A two-stream BERT-style model pretrained on weakly aligned image-caption data transfers to VQA, VCR, referring expressions, and retrieval, outperforming task-specific models on all four.