Reusing past trajectories with a power-mean-corrected importance-weighting estimator gives policy-gradient methods a sample complexity of O~(epsilon^{-1}) in the full-reuse regime.
1, then with the discussed conditions on iteration, batch, and sample complexities, Equation (166) is equivalent to: E
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.LG 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
Reusing Trajectories in Policy Gradients Enables Fast Convergence
Reusing past trajectories with a power-mean-corrected importance-weighting estimator gives policy-gradient methods a sample complexity of O~(epsilon^{-1}) in the full-reuse regime.