Adding a visual and textual chain-of-affordance reasoning step to a vision-language-action model improves robot manipulation success rates and generalization in the paper's evaluations.
TraceVLA: Visual trace prompting enhances spatial-temporal awareness for generalist robotic policies
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
citation-role summary
background 1
citation-polarity summary
fields
cs.RO 1years
2024 1verdicts
CONDITIONAL 1roles
background 1polarities
background 1representative citing papers
citing papers explorer
-
CoA-VLA: Improving Vision-Language-Action Models via Visual-Textual Chain-of-Affordance
Adding a visual and textual chain-of-affordance reasoning step to a vision-language-action model improves robot manipulation success rates and generalization in the paper's evaluations.