arXiv preprint arXiv:2508.13898 (2025)

Lu, Y · 2025 · arXiv 2508.13898

2 Pith papers cite this work. Polarity classification is still indexing.

2 Pith papers citing it

representative citing papers

Runtime-Orchestrated Second-Order Optimization for Scalable LLM Training

cs.DC · 2026-05-15 · unverdicted · novelty 6.0

Asteria is a runtime system that enables second-order optimization for LLMs by dynamically distributing optimizer state across GPU, CPU, and NVMe while using asynchronous inverse-root computations and bounded-staleness synchronization.

Second-Order Multi-Level Variance Correction for Modality Competition in Multimodal Models

cs.CV · 2026-05-15 · unverdicted · novelty 5.0

Introduces ML-FOP-SOAP optimizer using Fisher-Orthogonal Projection and hierarchical folding to mitigate modality competition in multimodal autoregressive training, reporting gains over AdamW on Janus and Emu3.

citing papers explorer

Showing 2 of 2 citing papers.

Runtime-Orchestrated Second-Order Optimization for Scalable LLM Training cs.DC · 2026-05-15 · unverdicted · none · ref 13
Asteria is a runtime system that enables second-order optimization for LLMs by dynamically distributing optimizer state across GPU, CPU, and NVMe while using asynchronous inverse-root computations and bounded-staleness synchronization.
Second-Order Multi-Level Variance Correction for Modality Competition in Multimodal Models cs.CV · 2026-05-15 · unverdicted · none · ref 14
Introduces ML-FOP-SOAP optimizer using Fisher-Orthogonal Projection and hierarchical folding to mitigate modality competition in multimodal autoregressive training, reporting gains over AdamW on Janus and Emu3.

arXiv preprint arXiv:2508.13898 (2025)

fields

years

verdicts

representative citing papers

citing papers explorer