EP-based PPO with CPG and residual policies matches standard PPO performance on 12-DoF quadruped uneven-terrain locomotion while using 4.3 times less GPU memory during training.
Learning to walk in the real world with minimal human effort
2 Pith papers cite this work. Polarity classification is still indexing.
2
Pith papers citing it
citation-role summary
background 1
citation-polarity summary
years
2026 2verdicts
UNVERDICTED 2roles
background 1polarities
background 1representative citing papers
AutoSafe is a policy architecture that integrates structured safety monitoring for continuous safe online RL on continuous-control tasks and a physical cart-pole.
citing papers explorer
-
Neuromorphic Reinforcement Learning for Quadruped Locomotion Control on Uneven Terrain
EP-based PPO with CPG and residual policies matches standard PPO performance on 12-DoF quadruped uneven-terrain locomotion while using 4.3 times less GPU memory during training.
-
Safe Online Learning via Smooth Safety-Structured Policy Composition
AutoSafe is a policy architecture that integrates structured safety monitoring for continuous safe online RL on continuous-control tasks and a physical cart-pole.