Premover enables VLA policies to act on partial instructions by precomputing focus maps from intermediate backbone layers, reducing wall-clock time 13.6 percent on LIBERO while preserving 95 percent success rate.
PVI: Plug-in visual injection for vision-language-action models
2 Pith papers cite this work. Polarity classification is still indexing.
citation-role summary
citation-polarity summary
fields
cs.RO 2years
2026 2verdicts
UNVERDICTED 2roles
background 1polarities
background 1representative citing papers
DynaFLIP pre-trains dynamics-aware image encoders by aligning image, language, and 3D flow modalities through simplex-volume minimization plus regularizers on video triplets, yielding reusable backbones that improve manipulation policies by up to 22.5% in out-of-distribution settings.
citing papers explorer
-
Premover: Fast Vision-Language-Action Control by Acting Before Instructions Are Complete
Premover enables VLA policies to act on partial instructions by precomputing focus maps from intermediate backbone layers, reducing wall-clock time 13.6 percent on LIBERO while preserving 95 percent success rate.
-
DynaFLIP: Rethinking Robotics Perception via Tri-Modal-Dynamics Guided Representation
DynaFLIP pre-trains dynamics-aware image encoders by aligning image, language, and 3D flow modalities through simplex-volume minimization plus regularizers on video triplets, yielding reusable backbones that improve manipulation policies by up to 22.5% in out-of-distribution settings.