Vision language models frequently fail to include mentioned-but-not-depicted objects in their answers, revealing a limitation in virtual object tracking.
The imaginative mind.Human brain map- ping, 37(11):4197–4211, 2016
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Vision language models have difficulty recognizing virtual objects
Vision language models frequently fail to include mentioned-but-not-depicted objects in their answers, revealing a limitation in virtual object tracking.