ZO-MGT achieves O(1/T) convergence in distributed zeroth-order optimization while suppressing heterogeneity bias at quadratic rate O((1-β)^2) using momentum and Rademacher perturbations.
FZOO: Fast zeroth-order optimizer for fine-tuning large language models towards adam-scale speed
2 Pith papers cite this work. Polarity classification is still indexing.
2
Pith papers citing it
citation-role summary
background 1
citation-polarity summary
years
2026 2verdicts
UNVERDICTED 2roles
background 1polarities
background 1representative citing papers
A retrospective survey and empirical evaluation of deep learning optimization algorithms that identifies trends, design trade-offs, and future directions.
citing papers explorer
-
Distributed Zeroth-Order Optimization with Rademacher Perturbations and Momentum Gradient Tracking
ZO-MGT achieves O(1/T) convergence in distributed zeroth-order optimization while suppressing heterogeneity bias at quadratic rate O((1-β)^2) using momentum and Rademacher perturbations.
-
Evolution of Optimization Methods: Algorithms, Scenarios, and Evaluations
A retrospective survey and empirical evaluation of deep learning optimization algorithms that identifies trends, design trade-offs, and future directions.