{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:ONWCAFRN7CFGCRHY6VAJHC6M33","short_pith_number":"pith:ONWCAFRN","schema_version":"1.0","canonical_sha256":"736c20162df88a6144f8f540938bccdedb7f6c50988b256860fd29530d647fb2","source":{"kind":"arxiv","id":"2509.01440","version":1},"attestation_state":"computed","paper":{"title":"Benchmarking Optimizers for Large Language Model Pretraining","license":"http://creativecommons.org/licenses/by-sa/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Andrei Semenov, Martin Jaggi, Matteo Pagliardini","submitted_at":"2025-09-01T12:50:30Z","abstract_excerpt":"The recent development of Large Language Models (LLMs) has been accompanied by an effervescence of novel ideas and methods to better optimize the loss of deep learning models. Claims from those methods are myriad: from faster convergence to removing reliance on certain hyperparameters. However, the diverse experimental protocols used to validate these claims make direct comparisons between methods challenging. This study presents a comprehensive evaluation of recent optimization techniques across standardized LLM pretraining scenarios, systematically varying model size, batch size, and trainin"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2509.01440","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-sa/4.0/","primary_cat":"cs.LG","submitted_at":"2025-09-01T12:50:30Z","cross_cats_sorted":[],"title_canon_sha256":"cd164ff75f2a673340dc50b0bc7ef6816a57e970d3f25db4f87f3b9c22ac2bfe","abstract_canon_sha256":"c8d48fc228084b766b0465ab21ae4916d03abb5c1e5d802a19c6047eacc45ab1"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T12:03:00.982825Z","signature_b64":"1D5S9W38HMEgNDs/NwpwqAhqGHVb3FhcEPVfUYGsEV5xLhlyCzxGz41QHjwNMlH/yIz8BQZyMm3ad2EcVL+fAg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"736c20162df88a6144f8f540938bccdedb7f6c50988b256860fd29530d647fb2","last_reissued_at":"2026-07-05T12:03:00.982307Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T12:03:00.982307Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Benchmarking Optimizers for Large Language Model Pretraining","license":"http://creativecommons.org/licenses/by-sa/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Andrei Semenov, Martin Jaggi, Matteo Pagliardini","submitted_at":"2025-09-01T12:50:30Z","abstract_excerpt":"The recent development of Large Language Models (LLMs) has been accompanied by an effervescence of novel ideas and methods to better optimize the loss of deep learning models. Claims from those methods are myriad: from faster convergence to removing reliance on certain hyperparameters. However, the diverse experimental protocols used to validate these claims make direct comparisons between methods challenging. This study presents a comprehensive evaluation of recent optimization techniques across standardized LLM pretraining scenarios, systematically varying model size, batch size, and trainin"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2509.01440","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2509.01440/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2509.01440","created_at":"2026-07-05T12:03:00.982389+00:00"},{"alias_kind":"arxiv_version","alias_value":"2509.01440v1","created_at":"2026-07-05T12:03:00.982389+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2509.01440","created_at":"2026-07-05T12:03:00.982389+00:00"},{"alias_kind":"pith_short_12","alias_value":"ONWCAFRN7CFG","created_at":"2026-07-05T12:03:00.982389+00:00"},{"alias_kind":"pith_short_16","alias_value":"ONWCAFRN7CFGCRHY","created_at":"2026-07-05T12:03:00.982389+00:00"},{"alias_kind":"pith_short_8","alias_value":"ONWCAFRN","created_at":"2026-07-05T12:03:00.982389+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":21,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.23676","citing_title":"Open Problem: Is AdamW Effective Under Heavy-Tailed Noise?","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2606.03899","citing_title":"Denoise First, Orthogonalize Later: Understanding Momentum in Muon via Spectral Filtering","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18106","citing_title":"Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers","ref_index":136,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19811","citing_title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2605.26327","citing_title":"Reparametrizing Shampoo and SOAP for Subspace Basis Updates and BFloat16 Storage","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2605.31371","citing_title":"Softsign: Smooth Sign in Your Optimizer For Better Parameter Heterogeneity Handling","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2603.10067","citing_title":"HTMuon: Improving Muon via Heavy-Tailed Spectral Correction","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2605.22644","citing_title":"Why SGD is not Brownian Motion: A New Perspective on Stochastic Dynamics","ref_index":192,"is_internal_anchor":false},{"citing_arxiv_id":"2510.10777","citing_title":"Preconditioned Norms: A Unified Framework for Steepest Descent, Quasi-Newton and Adaptive Methods","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18106","citing_title":"Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers","ref_index":134,"is_internal_anchor":false},{"citing_arxiv_id":"2605.19811","citing_title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2602.01505","citing_title":"Optimal Sample Complexity for Single Time-Scale Actor-Critic with Momentum","ref_index":50,"is_internal_anchor":false},{"citing_arxiv_id":"2603.26554","citing_title":"Sharp Capacity Scaling of Spectral Optimizers in Learning Associative Memory","ref_index":48,"is_internal_anchor":false},{"citing_arxiv_id":"2605.13434","citing_title":"Rescaled Asynchronous SGD: Optimal Distributed Optimization under Data and System Heterogeneity","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09176","citing_title":"Navigating LLM Valley: From AdamW to Memory-Efficient and Matrix-Based Optimizers","ref_index":37,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06654","citing_title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06615","citing_title":"When and Why SignSGD Outperforms SGD: A Theoretical Study Based on $\\ell_1$-norm Lower Bounds","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2604.12968","citing_title":"Evolution of Optimization Methods: Algorithms, Scenarios, and Evaluations","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2604.09258","citing_title":"Nexus: Same Pretraining Loss, Better Downstream Generalization via Common Minima","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2604.15416","citing_title":"StoSignSGD: Unbiased Structural Stochasticity Fixes SignSGD for Training Large Language Models","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2604.15297","citing_title":"Benchmarking Optimizers for MLPs in Tabular Deep Learning","ref_index":11,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/ONWCAFRN7CFGCRHY6VAJHC6M33","json":"https://pith.science/pith/ONWCAFRN7CFGCRHY6VAJHC6M33.json","graph_json":"https://pith.science/api/pith-number/ONWCAFRN7CFGCRHY6VAJHC6M33/graph.json","events_json":"https://pith.science/api/pith-number/ONWCAFRN7CFGCRHY6VAJHC6M33/events.json","paper":"https://pith.science/paper/ONWCAFRN"},"agent_actions":{"view_html":"https://pith.science/pith/ONWCAFRN7CFGCRHY6VAJHC6M33","download_json":"https://pith.science/pith/ONWCAFRN7CFGCRHY6VAJHC6M33.json","view_paper":"https://pith.science/paper/ONWCAFRN","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2509.01440&json=true","fetch_graph":"https://pith.science/api/pith-number/ONWCAFRN7CFGCRHY6VAJHC6M33/graph.json","fetch_events":"https://pith.science/api/pith-number/ONWCAFRN7CFGCRHY6VAJHC6M33/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/ONWCAFRN7CFGCRHY6VAJHC6M33/action/timestamp_anchor","attest_storage":"https://pith.science/pith/ONWCAFRN7CFGCRHY6VAJHC6M33/action/storage_attestation","attest_author":"https://pith.science/pith/ONWCAFRN7CFGCRHY6VAJHC6M33/action/author_attestation","sign_citation":"https://pith.science/pith/ONWCAFRN7CFGCRHY6VAJHC6M33/action/citation_signature","submit_replication":"https://pith.science/pith/ONWCAFRN7CFGCRHY6VAJHC6M33/action/replication_record"}},"created_at":"2026-07-05T12:03:00.982389+00:00","updated_at":"2026-07-05T12:03:00.982389+00:00"}