A dual-system world model shows that a single-step, not fully denoised, video-diffusion latent is enough to condition a real-time robot manipulation policy, reaching 63% on RL-Bench at 11.3 FPS.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.RO 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
MinD: Learning A Dual-System World Model for Real-Time Planning and Implicit Risk Analysis
A dual-system world model shows that a single-step, not fully denoised, video-diffusion latent is enough to condition a real-time robot manipulation policy, reaching 63% on RL-Bench at 11.3 FPS.