VTLA, a vision-tactile-language-action model trained purely in simulation, achieves over 90% success on peg insertion in simulation and 95% in the real world.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.RO 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
VTLA: Vision-Tactile-Language-Action Model with Preference Learning for Insertion Manipulation
VTLA, a vision-tactile-language-action model trained purely in simulation, achieves over 90% success on peg insertion in simulation and 95% in the real world.