An unbiased PPO gradient that ignores recovery-policy density, plus analytic recovery values and success-gated imitation, cuts training falls by 26–233× on locomotion tasks without sacrificing reward.
Mohammadhosein Hasanbeig, Alessandro Abate, and Daniel Kroening
1 Pith paper cite this work, alongside 436 external citations. Polarity classification is still indexing.
1
Pith paper citing it
436
external citations · OpenAlex
fields
cs.LG 1years
2026 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions
An unbiased PPO gradient that ignores recovery-policy density, plus analytic recovery values and success-gated imitation, cuts training falls by 26–233× on locomotion tasks without sacrificing reward.