Vision language models frequently fail to include mentioned-but-not-depicted objects in their answers, revealing a limitation in virtual object tracking.
The artist as neuroscientist.Nature, 434 (7031):301–307, 2005
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.CV 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Vision language models have difficulty recognizing virtual objects
Vision language models frequently fail to include mentioned-but-not-depicted objects in their answers, revealing a limitation in virtual object tracking.