A two-stage actor-critic RL algorithm learns deterministic equilibrium policies for general time-inconsistent control problems by combining DPG on an auxiliary time-consistent problem with fixed-point iteration on auxiliary functions.
Policy iteration achieves regularized equilibrium under time inconsistency
3 Pith papers cite this work. Polarity classification is still indexing.
years
2026 3verdicts
UNVERDICTED 3representative citing papers
Establishes global existence of entropy-regularized equilibria for time-inconsistent continuous-time MFGs via Schauder fixed-point arguments and proves their convergence to original equilibria using compactness and Young measures, plus convergence of a policy iteration algorithm under short-horizon
Solutions to the regularized exploratory equilibrium HJB equation converge in suitable norms to a strong solution of the original EHJB as the entropy parameter vanishes, yielding existence of equilibria without conventional stringent regularity assumptions.
citing papers explorer
-
Deterministic Policy Gradient for Learning Equilibrium in Time-Inconsistent Control Problems
A two-stage actor-critic RL algorithm learns deterministic equilibrium policies for general time-inconsistent control problems by combining DPG on an auxiliary time-consistent problem with fixed-point iteration on auxiliary functions.
-
Equilibrium for Time-inconsistent Mean Field Games: A Systematic Analysis by Entropy Regularization
Establishes global existence of entropy-regularized equilibria for time-inconsistent continuous-time MFGs via Schauder fixed-point arguments and proves their convergence to original equilibria using compactness and Young measures, plus convergence of a policy iteration algorithm under short-horizon
-
Equilibrium under Time-Inconsistency: A New Existence Theory by Vanishing Entropy Regularization
Solutions to the regularized exploratory equilibrium HJB equation converge in suitable norms to a strong solution of the original EHJB as the entropy parameter vanishes, yielding existence of equilibria without conventional stringent regularity assumptions.