Reusing past trajectories with a power-mean-corrected importance-weighting estimator gives policy-gradient methods a sample complexity of O~(epsilon^{-1}) in the full-reuse regime.
Next, we imposeAď ϵ 2 as well, from which we will recover a condition on the total sample complexityN K
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.LG 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Reusing Trajectories in Policy Gradients Enables Fast Convergence
Reusing past trajectories with a power-mean-corrected importance-weighting estimator gives policy-gradient methods a sample complexity of O~(epsilon^{-1}) in the full-reuse regime.