Radically uncoupled epsilon-greedy least-squares learning converges almost surely to the complete-information feedback Nash equilibrium in infinite-horizon nonzero-sum linear-quadratic stochastic games, at a rate governed by equilibrium stability and exploration decay.
arXiv:2601.20973 , year=
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
math.OC 1years
2026 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Learning under Opponent Unawareness in Linear-Quadratic Stochastic Games
Radically uncoupled epsilon-greedy least-squares learning converges almost surely to the complete-information feedback Nash equilibrium in infinite-horizon nonzero-sum linear-quadratic stochastic games, at a rate governed by equilibrium stability and exploration decay.