For kernel-based reward-free RL, a simple uncertainty-maximizing exploration algorithm with unbiased samples achieves sample complexity ~O((H^3/eps)^(2+2/(p-1))) for polynomial eigendecay kernels, with an H-factor cost when no generative model is available.
Title resolution pending
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.LG 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Near-Optimal Sample Complexity in Reward-Free Kernel-Based Reinforcement Learning
For kernel-based reward-free RL, a simple uncertainty-maximizing exploration algorithm with unbiased samples achieves sample complexity ~O((H^3/eps)^(2+2/(p-1))) for polynomial eigendecay kernels, with an H-factor cost when no generative model is available.