A primal-dual policy-gradient method with ridge regularization is shown to converge globally, in the last iterate, to optimal feasible deterministic policies in continuous constrained MDPs under gradient-domination and white-noise assumptions.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.LG 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Learning Deterministic Policies with Policy Gradients in Constrained Markov Decision Processes
A primal-dual policy-gradient method with ridge regularization is shown to converge globally, in the last iterate, to optimal feasible deterministic policies in continuous constrained MDPs under gradient-domination and white-noise assumptions.