A retrieval-augmented training framework that aligns visual and linguistic primitive representations improves VQA models on a new multi-sourced compositional generalization benchmark, GQA-MSCG, with modest gains.
Compositional temporal ground- ing with structured variational cross-graph correspondence learning
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
REJECT 1representative citing papers
citing papers explorer
-
Multi-Sourced Compositional Generalization in Visual Question Answering
A retrieval-augmented training framework that aligns visual and linguistic primitive representations improves VQA models on a new multi-sourced compositional generalization benchmark, GQA-MSCG, with modest gains.