{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:CQSGBR246WCNN27EZ3WZSY6YPB","short_pith_number":"pith:CQSGBR24","schema_version":"1.0","canonical_sha256":"142460c75cf584d6ebe4ceed9963d878657ec2610db937228ceffeffb05cb7f5","source":{"kind":"arxiv","id":"2411.10438","version":4},"attestation_state":"computed","paper":{"title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["math.OC","stat.ML"],"primary_cat":"cs.LG","authors_text":"Huizhuo Yuan, Quanquan Gu, Shuang Wu, Xun Zhou, Yifeng Liu","submitted_at":"2024-11-15T18:57:39Z","abstract_excerpt":"Training deep neural networks--and more recently, large models demands efficient and scalable optimizers. Adaptive gradient algorithms like Adam, AdamW, and their variants have been central to this task. Despite the development of numerous variance reduction algorithms in the past decade aimed at accelerating stochastic optimization in both convex and nonconvex settings, variance reduction has not found widespread success in training deep neural networks or large language models. Consequently, it has remained a less favored approach in modern AI. In this paper, to unleash the power of variance"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2411.10438","kind":"arxiv","version":4},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-11-15T18:57:39Z","cross_cats_sorted":["math.OC","stat.ML"],"title_canon_sha256":"83dfcc9dc8ddabdc7a013d934ab010c83fe166dc4c5efff322132cfc31170b10","abstract_canon_sha256":"8f323bb9c5b71c1c99670f9e64ba8b33b4ed36fdd37413fc15f0ceed50b74ffd"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T12:04:29.208643Z","signature_b64":"3gmSvq+07e/0MQ4jUXNmt94Vxbj4+lrHwiiQungkKUkXwh7HDi+HGXo+V00at22M9DYzc/1dDgfxMVSVzKqjCw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"142460c75cf584d6ebe4ceed9963d878657ec2610db937228ceffeffb05cb7f5","last_reissued_at":"2026-07-05T12:04:29.208004Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T12:04:29.208004Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"MARS: Unleashing the Power of Variance Reduction for Training Large Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["math.OC","stat.ML"],"primary_cat":"cs.LG","authors_text":"Huizhuo Yuan, Quanquan Gu, Shuang Wu, Xun Zhou, Yifeng Liu","submitted_at":"2024-11-15T18:57:39Z","abstract_excerpt":"Training deep neural networks--and more recently, large models demands efficient and scalable optimizers. Adaptive gradient algorithms like Adam, AdamW, and their variants have been central to this task. Despite the development of numerous variance reduction algorithms in the past decade aimed at accelerating stochastic optimization in both convex and nonconvex settings, variance reduction has not found widespread success in training deep neural networks or large language models. Consequently, it has remained a less favored approach in modern AI. In this paper, to unleash the power of variance"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2411.10438","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2411.10438/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2411.10438","created_at":"2026-07-05T12:04:29.208093+00:00"},{"alias_kind":"arxiv_version","alias_value":"2411.10438v4","created_at":"2026-07-05T12:04:29.208093+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2411.10438","created_at":"2026-07-05T12:04:29.208093+00:00"},{"alias_kind":"pith_short_12","alias_value":"CQSGBR246WCN","created_at":"2026-07-05T12:04:29.208093+00:00"},{"alias_kind":"pith_short_16","alias_value":"CQSGBR246WCNN27E","created_at":"2026-07-05T12:04:29.208093+00:00"},{"alias_kind":"pith_short_8","alias_value":"CQSGBR24","created_at":"2026-07-05T12:04:29.208093+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":13,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.17526","citing_title":"MGUP: A Momentum-Gradient Alignment Update Policy for Stochastic Optimization","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18106","citing_title":"Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers","ref_index":168,"is_internal_anchor":false},{"citing_arxiv_id":"2606.30634","citing_title":"One-Step Gradient Delay is Not a Barrier for Large-Scale Asynchronous Pipeline Parallel LLM Pretraining","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2603.10067","citing_title":"HTMuon: Improving Muon via Heavy-Tailed Spectral Correction","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2605.22644","citing_title":"Why SGD is not Brownian Motion: A New Perspective on Stochastic Dynamics","ref_index":158,"is_internal_anchor":false},{"citing_arxiv_id":"2502.07529","citing_title":"Training Deep Learning Models with Norm-Constrained LMOs","ref_index":218,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18106","citing_title":"Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers","ref_index":165,"is_internal_anchor":false},{"citing_arxiv_id":"2509.15816","citing_title":"On the Convergence of Muon and Beyond","ref_index":52,"is_internal_anchor":false},{"citing_arxiv_id":"2510.04988","citing_title":"Adaptive Memory Momentum via a Model-Based Framework for Deep Learning Optimization","ref_index":71,"is_internal_anchor":false},{"citing_arxiv_id":"2602.01505","citing_title":"Optimal Sample Complexity for Single Time-Scale Actor-Critic with Momentum","ref_index":62,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06654","citing_title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2604.14587","citing_title":"CLion: Efficient Cautious Lion Optimizer with Enhanced Generalization","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02143","citing_title":"Personalized Federated Learning for Gradient Alignment","ref_index":12,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/CQSGBR246WCNN27EZ3WZSY6YPB","json":"https://pith.science/pith/CQSGBR246WCNN27EZ3WZSY6YPB.json","graph_json":"https://pith.science/api/pith-number/CQSGBR246WCNN27EZ3WZSY6YPB/graph.json","events_json":"https://pith.science/api/pith-number/CQSGBR246WCNN27EZ3WZSY6YPB/events.json","paper":"https://pith.science/paper/CQSGBR24"},"agent_actions":{"view_html":"https://pith.science/pith/CQSGBR246WCNN27EZ3WZSY6YPB","download_json":"https://pith.science/pith/CQSGBR246WCNN27EZ3WZSY6YPB.json","view_paper":"https://pith.science/paper/CQSGBR24","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2411.10438&json=true","fetch_graph":"https://pith.science/api/pith-number/CQSGBR246WCNN27EZ3WZSY6YPB/graph.json","fetch_events":"https://pith.science/api/pith-number/CQSGBR246WCNN27EZ3WZSY6YPB/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/CQSGBR246WCNN27EZ3WZSY6YPB/action/timestamp_anchor","attest_storage":"https://pith.science/pith/CQSGBR246WCNN27EZ3WZSY6YPB/action/storage_attestation","attest_author":"https://pith.science/pith/CQSGBR246WCNN27EZ3WZSY6YPB/action/author_attestation","sign_citation":"https://pith.science/pith/CQSGBR246WCNN27EZ3WZSY6YPB/action/citation_signature","submit_replication":"https://pith.science/pith/CQSGBR246WCNN27EZ3WZSY6YPB/action/replication_record"}},"created_at":"2026-07-05T12:04:29.208093+00:00","updated_at":"2026-07-05T12:04:29.208093+00:00"}