A centralized policy gradient for parallel state entropy maximization improves state coverage on small gridworlds, but the paper's concentration-rate proof is invalid.
Society of agents: Regret bounds of concurrent thompson sampling
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.LG 1years
2025 1verdicts
REJECT 1representative citing papers
citing papers explorer
-
Enhancing Diversity in Parallel Agents: A Maximum State Entropy Exploration Story
A centralized policy gradient for parallel state entropy maximization improves state coverage on small gridworlds, but the paper's concentration-rate proof is invalid.