ATLAS uses a single functional token to unify agentic and latent visual reasoning without image generation or external execution.
LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval
1 Pith paper cite this work, alongside 106 external citations. Polarity classification is still indexing.
1
Pith paper citing it
106
external citations · Crossref
fields
cs.CV 1years
2026 1verdicts
UNVERDICTED 1representative citing papers
citing papers explorer
-
ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both
ATLAS uses a single functional token to unify agentic and latent visual reasoning without image generation or external execution.