Pith. sign in

First-Order Policy Optimization for Robust Markov Decision Process

7 Pith papers cite this work. Polarity classification is still indexing.

7 Pith papers citing it

citation-role summary

background 1

citation-polarity summary

years

2026 6 2024 1

verdicts

UNVERDICTED 7

roles

background 1

polarities

background 1

representative citing papers

Robust Markov Decision Processes on Continuous State Spaces

math.OC · 2026-05-27 · unverdicted · novelty 6.0

Develops stochastic first-order methods for robust policy evaluation and approximate policy iteration in continuous-state robust MDPs, achieving 'O(1/ε^{2}) sample complexity for both evaluation and optimization.

Value Mirror Descent for Reinforcement Learning

math.OC · 2026-04-07 · unverdicted · novelty 5.0

Value mirror descent integrates mirror descent into value iteration for discounted MDPs, delivering near-optimal sample complexity of order |S||A|(1-γ)^{-3}ε^{-2} for general convex regularizers and bounded Bregman divergence between generated and optimal policies.

citing papers explorer

Showing 7 of 7 citing papers.