MODIP fine-tunes diffusion policies offline-to-online by training a world model, running MPC with terminal state values inside it to create targets, and using policy-independent TD critics, yielding gains over BC on D4RL and RoboMimic tasks.
Yuhang Wang, Hanwei Guo, Sizhe Wang, Long Qian, and Xuguang Lan
3 Pith papers cite this work. Polarity classification is still indexing.
fields
cs.LG 3verdicts
UNVERDICTED 3representative citing papers
PO-MPC unifies prior MPPI-based RL approaches under a single KL-regularized framework that uses the planner distribution as a prior, with new variations yielding performance gains in experiments.
MBDPO reformulates policy optimization as a diffusion process over searched trajectories in latent world models to reduce misalignment between search and value learning.
citing papers explorer
-
MODIP: Efficient Model-Based Optimization for Diffusion Policies
MODIP fine-tunes diffusion policies offline-to-online by training a world model, running MPC with terminal state values inside it to create targets, and using policy-independent TD critics, yielding gains over BC on D4RL and RoboMimic tasks.
-
A KL-regularization Framework for Learning to Plan with Adaptive Priors
PO-MPC unifies prior MPPI-based RL approaches under a single KL-regularized framework that uses the planner distribution as a prior, with new variations yielding performance gains in experiments.
-
Scaling World-Model Reinforcement Learning Through Diffusion Policy Optimization
MBDPO reformulates policy optimization as a diffusion process over searched trajectories in latent world models to reduce misalignment between search and value learning.