Pith. sign in

Paper Citation Record · LEDGER

Benchmarking Optimizers for Large Language Model Pretraining

As of 10 August 2026, this Paper Citation Record lists 100 of 176 outbound references and 28 inbound Pith citation observations for arXiv:2509.01440.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2509.01440 v1

Coverage vector

measured 100 of 176 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-05T12:35:51.957442Z

measured 128 of 128 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-10T06:31:04.303077+00:00

measured 28 of 28 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-05T11:59:49.778357Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Reference resolution

100 of 176 outbound references displayed

  • verified exact0
  • verified fuzzy3
  • unresolved97
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

0
arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Outbound references

Observation f1e3d2e4-6b08-434e-ad32-7d90ef11da41 · outbound

This paper cites Dion: A communication-efficient optimizer for large models, 2025.

Benchmarking Optimizers for Large Language Model Pretraining Dion: A communication-efficient optimizer for large models, 2025

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.343838Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.343838Z digest=sha256:097df306d98c8867f1369039795dc73c0bc5f0646bc7980d22c79ff644ba9dbc

Observation 63753a59-3c59-475d-be3d-de886728aeb2 · outbound

This paper cites an unresolved cited work.

Benchmarking Optimizers for Large Language Model Pretraining Unresolved cited work

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.353802Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.353802Z digest=sha256:f44c9fc19aaa818a0c53cf480b956ecc006e3a3a679ae864466f2cab1d4b4f23

Observation 2d976c51-744f-4ac0-8423-f981979703e6 · outbound

This paper cites an unresolved cited work.

Benchmarking Optimizers for Large Language Model Pretraining Unresolved cited work

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.376510Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.376510Z digest=sha256:124a4849f503beae24e39621ee7642cb55160da91fe10854cb8f9a9d770ec656

Observation 3500af33-a6ce-4821-8c65-c2c3dc857f52 · outbound

This paper cites ASGO: Adaptive structured gradient optimization, 2025.

Benchmarking Optimizers for Large Language Model Pretraining ASGO: Adaptive structured gradient optimization, 2025

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.385438Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.385438Z digest=sha256:5f621de09afcfa6497b59aeb03b295ebb84a4d55451e18b9929e6e86fe601014

Observation 8ad23d38-276b-4fa0-b950-4e69775ba4f7 · outbound

This paper cites Dissecting adam: The sign, magnitude and variance of stochastic gradients, 2020.

Benchmarking Optimizers for Large Language Model Pretraining Dissecting adam: The sign, magnitude and variance of stochastic gradients, 2020

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.396648Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.396648Z digest=sha256:8944c926dd82ca2068dc8a99e2a68f920eb71982a43d7edfa7b286aa8d6f16e6

Observation d65bb383-339a-4cbf-9f54-5dfddbcd63ef · outbound

This paper cites Bekas, E.

Benchmarking Optimizers for Large Language Model Pretraining Bekas, E

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.411974Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.411974Z digest=sha256:f68ec170e495ae8b0b81bf70d3dd3ab9cf55bcf01b956535790f44a03ea00f0c

Observation 99653034-b5f6-463c-8be3-ad2118a1de4c · outbound

This paper cites Straight to zero: Why linearly decaying the learning rate to zero works best for llms, 2025.

Benchmarking Optimizers for Large Language Model Pretraining Straight to zero: Why linearly decaying the learning rate to zero works best for llms, 2025

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.430977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.430977Z digest=sha256:10b32a149deac5cd14f0436aa2cdc1b9ac5d1d7da71a10897519d716259c5d66

Observation 6cb39b0b-ccc6-4f97-8da4-694e1ceb2c73 · outbound

This paper cites Old optimizer, new norm: An anthology, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Old optimizer, new norm: An anthology, 2024

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.443584Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.443584Z digest=sha256:e79427dbe2d29ab22a205fa5c24ca87108cddf7dc121cbd62db61ed22be8e1d4

Observation b232b8d0-7608-44ad-bd59-65bcca0fa84b · outbound

This paper cites signsgd: Compressed optimisation for non-convex problems, 2018.

Benchmarking Optimizers for Large Language Model Pretraining signsgd: Compressed optimisation for non-convex problems, 2018

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.461957Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.461957Z digest=sha256:8a192f0112f9586bbd242f183607ae50bbbdc8c66580cda4f9beb3e7f004dc9c

Observation 9da88b8d-b881-4c84-ab66-b87e03d91e37 · outbound

This paper cites Pythia: A suite for analyzing large language models across training and scaling, 2023.

Benchmarking Optimizers for Large Language Model Pretraining Pythia: A suite for analyzing large language models across training and scaling, 2023

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.470832Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.470832Z digest=sha256:1096a193e42331a805b466ba7275471ef4af21581d1fd074c654d2730d4d30a9

Observation ca24bbd4-073f-45d3-8332-faf66c88c7b5 · outbound

This paper cites Prince, Björn Deiseroth, Andres Felipe Cruz-Salinas, Carlo Luschi, Samuel Weinbach, and Douglas Orr.

Benchmarking Optimizers for Large Language Model Pretraining Prince, Björn Deiseroth, Andres Felipe Cruz-Salinas, Carlo Luschi, Samuel Weinbach, and Douglas Orr

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.480601Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.480601Z digest=sha256:3c7f8972f985c2df9cdd8a1c5cd5c1724f885285e8cee54630e209b29d7d0d7d

Observation e8acd836-9d96-4b0f-b589-3a95b51d7fe0 · outbound

This paper cites Loss-to- loss prediction: Scaling laws for all datasets, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Loss-to- loss prediction: Scaling laws for all datasets, 2024

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.488446Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.488446Z digest=sha256:fdda96f2acef04afaffac919ae2fbc74d7dff292942e3934284e2e9233ad6ecb

Observation 48f85189-d84d-4b0b-8315-30ee869344d0 · outbound

This paper cites an unresolved cited work.

Benchmarking Optimizers for Large Language Model Pretraining Unresolved cited work

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.496417Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.496417Z digest=sha256:e5e6dfc27facf5de9df4adbadb2b728f5c060bc0bd99904916ebed60ecda5b5f

Observation e99a0e4f-801e-4090-8542-f186ea656dfa · outbound

This paper cites How to scale your ema, 2023.

Benchmarking Optimizers for Large Language Model Pretraining How to scale your ema, 2023

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.503429Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.503429Z digest=sha256:e5796e98b120ce13c5da0ac983bc0752bd9984ea59b3b285bbab3ed1481e6d0d

Observation edcf4437-997a-4819-8877-53086dc35559 · outbound

This paper cites Preconditioned spectral descent for deep learning.

Benchmarking Optimizers for Large Language Model Pretraining Preconditioned spectral descent for deep learning

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.517235Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.517235Z digest=sha256:cf1e99e63919b7ece609f6e17763d84ad33ec9d7217e58e7be88df1aceeb3515

Observation bfc187f7-6eb5-4361-bf37-c31eec335328 · outbound

This paper cites Communication-efficient language model training scales reliably and robustly: Scaling laws for diloco, 2025.

Benchmarking Optimizers for Large Language Model Pretraining Communication-efficient language model training scales reliably and robustly: Scaling laws for diloco, 2025

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.525690Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.525690Z digest=sha256:c89399be1f89b84db274444ce164e7325400c832fd1a7ae112aa4fd2c9f89754

Observation b635442a-42eb-4898-9d20-ebca781a4a6d · outbound

This paper cites an unresolved cited work.

Benchmarking Optimizers for Large Language Model Pretraining Unresolved cited work

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.536046Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.536046Z digest=sha256:4dc93e2ce2647478288df0ebf876e8b7e28fb8d8ef1bb4d5e68330be2dae0313

Observation 0218fbe8-da25-4d79-9dd4-28bcb6e12e43 · outbound

This paper cites Gradient clipping improves adagrad when the noise is heavy-tailed, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Gradient clipping improves adagrad when the noise is heavy-tailed, 2024

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.545978Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.545978Z digest=sha256:489a7e8fbaf9055c4584f30441635089888cc043c9546f664c6e4d47aa770859

Observation d15f6470-9b39-4ca2-8dd7-05ff919ba841 · outbound

This paper cites Palm: Scaling language modeling with pathways, 2022.

Benchmarking Optimizers for Large Language Model Pretraining Palm: Scaling language modeling with pathways, 2022

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.555425Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.555425Z digest=sha256:e4a3f4f5d3dd85e7cc05f8562d38fea6aae703cf01937db58e234370febd1830

Observation f8d737d2-f2e1-4aa1-b0dd-5c0eaa05a356 · outbound

This paper cites an unresolved cited work.

Benchmarking Optimizers for Large Language Model Pretraining Unresolved cited work

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.580817Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.580817Z digest=sha256:cc2a31a18067b200ec0569b2743941bcdc7030f96777c67d2aa751644ad2c718

Observation 692e9966-eb88-4cf5-be99-1027a0932bb4 · outbound

This paper cites Why do we need weight decay in modern deep learning?, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Why do we need weight decay in modern deep learning?, 2024

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.590632Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.590632Z digest=sha256:e2d245d6c9429710f252b59347a257cca105483686e9a5f651308ac722477c3e

Observation aa651e1c-ed7c-4aa4-9046-acbf225be9e2 · outbound

This paper cites Fu, Stefano Ermon, Atri Rudra, and Christopher Ré.

Benchmarking Optimizers for Large Language Model Pretraining Fu, Stefano Ermon, Atri Rudra, and Christopher Ré

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.599608Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.599608Z digest=sha256:bc27d0e4236f2a41e6a42b1367d0b8dc93e4fe472a06d85e449df655b23ed03d

Observation 3084708e-ad23-42b8-9fc3-7920679b9b97 · outbound

This paper cites Deepseek llm: Scaling open-source language models with longtermism, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Deepseek llm: Scaling open-source language models with longtermism, 2024

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.606542Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.606542Z digest=sha256:a7b2f56d1084ebd2695ec1bd81f8d4b2d77a5e741abfef3faf2323329d7fd6db

Observation 2d7c4d5d-fbb7-417a-b303-b8b142ed5d9b · outbound

This paper cites Deepseek-v3 technical report, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Deepseek-v3 technical report, 2024

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.618917Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.618917Z digest=sha256:d5bdc490e8b4062339dd0c7ddc427885fd99191c3ef2eda67c4fe31a56fec769

Observation 7fe2fc43-b927-4b77-8a4a-7c57bd258c9f · outbound

This paper cites Why gradients rapidly increase near the end of training, 2025.

Benchmarking Optimizers for Large Language Model Pretraining Why gradients rapidly increase near the end of training, 2025

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.625839Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.625839Z digest=sha256:312a93b426b2e55c48c0fa9df657440a874af26faacdc4c00af330db903cf0cb

Observation e0a9cbd7-3d3d-43b0-ab96-743e009cb0ed · outbound

This paper cites Optimal linear decay learning rate schedules and further refinements, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Optimal linear decay learning rate schedules and further refinements, 2024

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.637129Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.637129Z digest=sha256:5a6c4c59647383cded6777b1c91a2c0f84e606f40ebf0c6bfc0148f6824d8b41

Observation 0bd0961f-59d0-4736-8b53-fa3953b2643a · outbound

This paper cites The road less scheduled, 2024.

Benchmarking Optimizers for Large Language Model Pretraining The road less scheduled, 2024

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.646543Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.646543Z digest=sha256:5d596bde7645a560952f43752582e96b7839f16c18a92b5ae06c447b63939597

Observation 0e9511fb-9e28-475e-acbb-6f7b128a5800 · outbound

This paper cites Bert: Pre-training of deep bidirectional transformers for language understanding, 2019.

Benchmarking Optimizers for Large Language Model Pretraining Bert: Pre-training of deep bidirectional transformers for language understanding, 2019

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.653793Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.653793Z digest=sha256:125d61f4a3586ce43bef02eed12c0f10d37b84d1ff16800e4ca0792f44af2cb3

Observation c586caa8-8625-4451-9055-b8918360c51c · outbound

This paper cites The practitioner’s guide to the maximal update parameterization.

Benchmarking Optimizers for Large Language Model Pretraining The practitioner’s guide to the maximal update parameterization

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.660661Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.660661Z digest=sha256:56d8b175d061223f320d16498cd3989a30c7603a16b2ccf18d05d9eda0aedd25

Observation b33a0093-52e9-41f7-aefe-ae400211107a · outbound

This paper cites Incorporating Nesterov Momentum into Adam, 2016.

Benchmarking Optimizers for Large Language Model Pretraining Incorporating Nesterov Momentum into Adam, 2016

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.667043Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.667043Z digest=sha256:e13e36626b5983702a9961624a69de28b3e4b06aeda957ac81365cf43f7f0a8f

Observation 3268a32e-81bb-4e54-a09f-a83543bb1881 · outbound

This paper cites Understanding emergent abilities of language models from the loss perspective, 2025.

Benchmarking Optimizers for Large Language Model Pretraining Understanding emergent abilities of language models from the loss perspective, 2025

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.675765Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.675765Z digest=sha256:bea45ce4d806144de7363efa7326349387ad4669c089cd73ad5baeb9288af4c8

Observation 796c91ff-7051-4894-9d7e-a330a9565ede · outbound

This paper cites Adaptive subgradient methods for online learning and stochastic optimization.

Benchmarking Optimizers for Large Language Model Pretraining Adaptive subgradient methods for online learning and stochastic optimization

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.684220Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.684220Z digest=sha256:dfb8558d2a596c3cd1d69582394764af0657708b9ba53d612332d0aacb7338b5

Observation a236d56d-8584-43e9-8502-d6f3fba362c5 · outbound

This paper cites A simple convergence proof of adam and adagrad, 2022.

Benchmarking Optimizers for Large Language Model Pretraining A simple convergence proof of adam and adagrad, 2022

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.692572Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.692572Z digest=sha256:fa043788caa0c873dfd82278576d92c5eaae83baed31b2ea4597704bbde0442c

Observation 78e07626-7a34-4416-924a-e3bf94d4a431 · outbound

This paper cites Data movement bottlenecks to large-scale model training: Scaling past 1e28 flop,.

Benchmarking Optimizers for Large Language Model Pretraining Data movement bottlenecks to large-scale model training: Scaling past 1e28 flop,

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.699221Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.699221Z digest=sha256:894297825ad645da20959a7a3d812d2b26834427c45ddbd1e3df4d687d2b3898

Observation 59524814-5713-4ec8-b181-b2e0eabbc3b5 · outbound

This paper cites Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity, 2022.

Benchmarking Optimizers for Large Language Model Pretraining Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity, 2022

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.716164Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.716164Z digest=sha256:070d850ade2ecc0ac9f4465caf2c5e58374692bba0b68ad80ae4daab2181501b

Observation 2772b691-3c1e-4765-86fb-a844a891ac4e · outbound

This paper cites A stable whitening optimizer for efficient neural network training, 2025.

Benchmarking Optimizers for Large Language Model Pretraining A stable whitening optimizer for efficient neural network training, 2025

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.728738Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.728738Z digest=sha256:dc46ae33d1de1bc06d4af271d663ce99c453072995bee86191f74f7b7b496dd1

Observation 1b9f62ea-dde8-4235-878b-87c7d31b8cbb · outbound

This paper cites Dimakis, Gabriel Ilharco, Pang Wei Koh, Shuran Song, Thomas Kollar, Yair Carmon, Achal Dave, Reinhard Heckel, Niklas Muennighoff, and Ludwig Schmidt.

Benchmarking Optimizers for Large Language Model Pretraining Dimakis, Gabriel Ilharco, Pang Wei Koh, Shuran Song, Thomas Kollar, Yair Carmon, Achal Dave, Reinhard Heckel, Niklas Muennighoff, and Ludwig Schmidt

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.740367Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.740367Z digest=sha256:3982609f0278a655156b8fdfaaa23797669a0d5e0872f495bbc8a5e8cfd36821

Observation 835f6f7a-b65f-4488-bf9a-02c82ab72dad · outbound

This paper cites The Pile: An 800GB Dataset of Diverse Text for Language Modeling.

Benchmarking Optimizers for Large Language Model Pretraining The Pile: An 800GB Dataset of Diverse Text for Language Modeling

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.748594Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.748594Z digest=sha256:db8d5e3302789c226a871b344e5c7c9ab1a2765c0eccfc5620f4863a59f03122

Observation 80ad567a-7f6b-4aff-99e4-4ac75f04e1de · outbound

This paper cites The pile: An 800gb dataset of diverse text for language modeling, 2020.

Benchmarking Optimizers for Large Language Model Pretraining The pile: An 800gb dataset of diverse text for language modeling, 2020

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.766003Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.766003Z digest=sha256:b66c03b968fb06f52d78d07c9ba1046f69250bf1b1d4dd456e3ffd2d3d8e0b7f

Observation 8b0d714c-c4f9-47a8-b0b7-36258def0546 · outbound

This paper cites Gemini: A family of highly capable multimodal models, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Gemini: A family of highly capable multimodal models, 2024

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.776544Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.776544Z digest=sha256:692b35e77b55113027660c65b51621f7f17c8f2ce2f72e05430bdf0e7428a622

Observation 2081e7d5-38c0-4050-b7a7-cfbe7b09e64b · outbound

This paper cites A loss curvature perspective on training instability in deep learning, 2021.

Benchmarking Optimizers for Large Language Model Pretraining A loss curvature perspective on training instability in deep learning, 2021

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.786424Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.786424Z digest=sha256:9bc58afaa4b0450c88d71136f913dd0300af928980a899d64d56f1b82ff517ef

Observation 4af57d0a-2b59-4138-96a3-72aaddd8365a · outbound

This paper cites A minimalist optimizer design for llm pretraining, 2025.

Benchmarking Optimizers for Large Language Model Pretraining A minimalist optimizer design for llm pretraining, 2025

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.793612Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.793612Z digest=sha256:eb8d2cc77643f8c7fd78e116c99ff646ce0dcbbb19a016104c3a90cbb063051c

Observation 0d192b09-2fc4-408a-b2fe-3a1ab03dd7f5 · outbound

This paper cites Generating sequences with recurrent neural networks, 2014.

Benchmarking Optimizers for Large Language Model Pretraining Generating sequences with recurrent neural networks, 2014

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.802389Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.802389Z digest=sha256:1dbc3172837715cc25157447d455fc91a75038f1c08ae87413e306adb4d22271

Observation 9d8e5927-11b3-4eec-b73c-53b342eb21fe · outbound

This paper cites Accelerating newton-schulz iteration for orthogonalization via chebyshev-type polynomials, 2025.

Benchmarking Optimizers for Large Language Model Pretraining Accelerating newton-schulz iteration for orthogonalization via chebyshev-type polynomials, 2025

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.816714Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.816714Z digest=sha256:20cb7f6638daa227c79793eb499cbbb8eb19c9cc7052158d304d8969d674f012

Observation 353c38e4-9f8c-496c-83b4-0664eed62531 · outbound

This paper cites AdaPlus: Integrating nesterov momentum and precise stepsize adjustment on adamw basis, 2023.

Benchmarking Optimizers for Large Language Model Pretraining AdaPlus: Integrating nesterov momentum and precise stepsize adjustment on adamw basis, 2023

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.825415Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.825415Z digest=sha256:a5e14976a0d99db16c764dde77e6f5158f5d4c2dbb1ec63812cd406a99648f25

Observation abceb8a5-5972-4481-b633-7da75869a1a4 · outbound

This paper cites Shampoo: Preconditioned stochastic tensor optimization, 2018.

Benchmarking Optimizers for Large Language Model Pretraining Shampoo: Preconditioned stochastic tensor optimization, 2018

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.838173Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.838173Z digest=sha256:417473155899566efc9005fa5ee7feed4cb563850dc3733689ebac91eab797bb

Observation 9a5d9988-1f52-4382-b27a-8af80cf7ebc2 · outbound

This paper cites Under- standing and minimising outlier features in neural network training, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Under- standing and minimising outlier features in neural network training, 2024

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.847579Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.847579Z digest=sha256:c6aab3579cffb582aa2ea2c3441ec8f52a2838382a1df1ac05574e27d1432139

Observation 4e150506-03f9-42ca-a4f1-16b9938798fe · outbound

This paper cites Deep residual learning for image recognition, 2015.

Benchmarking Optimizers for Large Language Model Pretraining Deep residual learning for image recognition, 2015

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.856289Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.856289Z digest=sha256:0864a108803700cbe71752a398574109f10236d943c95fe75e55368c41f054f9

Observation fa584f48-d9d3-408a-8ea6-1ac6408545d8 · outbound

This paper cites an unresolved cited work.

Benchmarking Optimizers for Large Language Model Pretraining Unresolved cited work

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.866960Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.866960Z digest=sha256:81a7a84880a4c3f0bcced4083aec6e75ba2ac2ee0d4fa0922db1a85d93e31609

Observation e80a794b-b7a4-48cf-a3e8-04fe3aeb54f1 · outbound

This paper cites Neural networks for machine learning, lecture 6e rmsprop: Divide the gradient by a running average of its recent magnitude, 2012.

Benchmarking Optimizers for Large Language Model Pretraining Neural networks for machine learning, lecture 6e rmsprop: Divide the gradient by a running average of its recent magnitude, 2012

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.875428Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.875428Z digest=sha256:75ad8b3c4774ef0ea0d3b764fa646952554680f47d273fec73312ca8d33adb27

Observation b225316f-3228-4134-873c-f2faf6e4d95b · outbound

This paper cites Rae, Oriol Vinyals, and Laurent Sifre.

Benchmarking Optimizers for Large Language Model Pretraining Rae, Oriol Vinyals, and Laurent Sifre

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.882146Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.882146Z digest=sha256:3f55546b9d2cf97cf7e6f605c65033acc5aff53e4a2e5af72168108a7bdd8884

Observation 73adb6cd-73a3-40a1-9be7-78c6242c9fff · outbound

This paper cites Minicpm: Unveiling the potential of small language models with scalable training strategies, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Minicpm: Unveiling the potential of small language models with scalable training strategies, 2024

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.892741Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.892741Z digest=sha256:c3532085b53bf81106cf0da49467eef63d78070c1f82342ef014ad75fb4dc96b

Observation 80d4d8db-1738-4952-96b9-346906feed94 · outbound

This paper cites Improving transformer opti- mization through better initialization.

Benchmarking Optimizers for Large Language Model Pretraining Improving transformer opti- mization through better initialization

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.905305Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.905305Z digest=sha256:ddd84b8280ff02b52c7e2aeaacc390db94158c382c3c25c0fe594543bf402f41

Observation a99c433d-c413-4835-b1ba-2d4a94238b8f · outbound

This paper cites Scaling laws and compute-optimal training beyond fixed training durations, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Scaling laws and compute-optimal training beyond fixed training durations, 2024

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.919282Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.919282Z digest=sha256:a2c25c3024b30ca790162a189e25c65cc4d00ea94b83adb26b6e51bd84d2b00b

Observation f50c55e8-f38c-4482-9a71-0bc3784b1f17 · outbound

This paper cites Averaging weights leads to wider optima and better generalization, 2019.

Benchmarking Optimizers for Large Language Model Pretraining Averaging weights leads to wider optima and better generalization, 2019

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.926941Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.926941Z digest=sha256:3743d4fa6f0186a83f0ff195cd8cee907d97fc31a4bb78f024a5f3b30d693918

Observation 13415e75-749f-4321-949c-d87048939e02 · outbound

This paper cites Intellect-1 technical report, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Intellect-1 technical report, 2024

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.938288Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.938288Z digest=sha256:56d5174b25d58d8f7c0dadb80a885bf51ca0ad77d73f67c400dee6db8409f960

Observation f9d73ab2-3f1d-43a7-b8df-4e343381632d · outbound

This paper cites an unresolved cited work.

Benchmarking Optimizers for Large Language Model Pretraining Unresolved cited work

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.946890Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.946890Z digest=sha256:fc4125cb2c08780a160801379e12256bfe48e4109b40f3101d8fca2752491f7e

Observation d820ecaa-a9fa-4067-a3dc-f4840cd3c4de · outbound

This paper cites modded-nanogpt: Speedrunning the nanogpt baseline, 2024.

Benchmarking Optimizers for Large Language Model Pretraining modded-nanogpt: Speedrunning the nanogpt baseline, 2024

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.956877Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.956877Z digest=sha256:fe4281907e111b36c2a42d278893d72ac9a4a979fe26fb1ee35f5083763e7ea7

Observation 38974e3d-c682-4d85-a70a-786b757ad391 · outbound

This paper cites Muon: An optimizer for hidden layers in neural networks, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Muon: An optimizer for hidden layers in neural networks, 2024

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.965261Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.965261Z digest=sha256:aab3b649a8490e654c433cf028c2615995eba075c155ff6174fcfeec789c6b18

Observation c16bd359-1f7d-46b2-be05-164a43f14643 · outbound

This paper cites an unresolved cited work.

Benchmarking Optimizers for Large Language Model Pretraining Unresolved cited work

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.981425Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.981425Z digest=sha256:e7e32464a597173971cdd7381489f424a586fa4b1ffd3fa21d1b1f7475b38e49

Observation 92f7ebe0-b223-439b-9169-aecb5f374815 · outbound

This paper cites Why warmup the learning rate? underlying mechanisms and improvements, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Why warmup the learning rate? underlying mechanisms and improvements, 2024

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.990386Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.990386Z digest=sha256:9209141b4259f6aa5ea87df53582e54182065ef94ddd7cab74fa59e0e5797b4e

Observation e13ef9ac-1d10-4655-becb-8e4788c544a7 · outbound

This paper cites Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei.

Benchmarking Optimizers for Large Language Model Pretraining Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:50.998917Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:50.998917Z digest=sha256:b92fcccc009f2f4cb0ee0f05d48d439312eca00a64810271456b2596c618306f

Observation 8a7e8f82-4584-47c5-a4db-6e4e0a4007a0 · outbound

This paper cites Error feedback fixes signSGD and other gradient compression schemes.

Benchmarking Optimizers for Large Language Model Pretraining Error feedback fixes signSGD and other gradient compression schemes

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.007417Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.007417Z digest=sha256:efa78241c9cceed4eae47107ef65992ccb67642b38edeb8640d115580dfdc0de

Observation 337c6213-9588-41a8-a388-309d8927b8cc · outbound

This paper cites an unresolved cited work.

Benchmarking Optimizers for Large Language Model Pretraining Unresolved cited work

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.016356Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.016356Z digest=sha256:9348b519bca7b22c6eee000ff7ab1c055c90d7b3bee26f291d8351572bf60b3f

Observation b2aa18dd-7536-4971-b794-82731facaa9d · outbound

This paper cites an unresolved cited work.

Benchmarking Optimizers for Large Language Model Pretraining Unresolved cited work

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.023163Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.023163Z digest=sha256:70e777144c2d18cd31fa36ab06842d45a03b334accb849f2f84b1546dbbb5c44

Observation 8b0ea370-d994-49a5-8950-e8350bee3995 · outbound

This paper cites Kingma and Jimmy Ba.

Benchmarking Optimizers for Large Language Model Pretraining Kingma and Jimmy Ba

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.029750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.029750Z digest=sha256:c5be24849384d710fd82bf3fa458208352ad542be49d3094b433c2ac57a6201d

Observation a3881c39-deb2-4d95-8888-0b1319dfe729 · outbound

This paper cites Sign operator for coping with heavy-tailed noise in non-convex optimization: High probability bounds under (l0,l 1)-smoothness, 2025.

Benchmarking Optimizers for Large Language Model Pretraining Sign operator for coping with heavy-tailed noise in non-convex optimization: High probability bounds under (l0,l 1)-smoothness, 2025

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.041783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.041783Z digest=sha256:e4d4698b321a3c37466b719ec121e3619925308751d7941d16f8912f340c0427

Observation cc26a4d6-5197-4e15-b87b-02d26576d30b · outbound

This paper cites Analyzing & reducing the need for learning rate warmup in gpt training, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Analyzing & reducing the need for learning rate warmup in gpt training, 2024

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.048805Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.048805Z digest=sha256:d2d2c85b95a80e213836f432f3c13418f69baf4772faae182695aa263db24b64

Observation 9bdf0811-3ca2-4b48-9288-c3cd48b5710d · outbound

This paper cites Rotational equilibrium: How weight decay balances learning across neural networks, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Rotational equilibrium: How weight decay balances learning across neural networks, 2024

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.055398Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.055398Z digest=sha256:6ef21cee1fd474292e8aa2c8b8fdd0fbad7a544586e4052c5e719e752623cdc8

Observation 8398ef5d-ff5e-4bcd-8e36-29e4c59cceaf · outbound

This paper cites Understanding gradient orthogonalization for deep learning via non-euclidean trust-region optimization, 2025.

Benchmarking Optimizers for Large Language Model Pretraining Understanding gradient orthogonalization for deep learning via non-euclidean trust-region optimization, 2025

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.060600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.060600Z digest=sha256:1ac15e675e50d39e5ebea6925a8aa63565aa0615d0e0be0c9a705b725e094c1b

Observation a4b82c0a-b051-4229-ba82-4f198e4c51e0 · outbound

This paper cites Spector, Blake Bordelon, Niklas Muennighoff, Mansheej Paul, Cengiz Pehlevan, Christopher Ré, and Aditi Raghunathan.

Benchmarking Optimizers for Large Language Model Pretraining Spector, Blake Bordelon, Niklas Muennighoff, Mansheej Paul, Cengiz Pehlevan, Christopher Ré, and Aditi Raghunathan

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.074620Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.074620Z digest=sha256:169242d47759a277b4b7e0aaa02c45cf2c154191b1fac7befdc58e1c7c3c4f82

Observation 0910f1f0-0f14-4d1d-aba3-0f1bdc01d2a5 · outbound

This paper cites Why do machine learning optimizers that work, work? PhD thesis, University of British Columbia, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Why do machine learning optimizers that work, work? PhD thesis, University of British Columbia, 2024

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.085256Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.085256Z digest=sha256:8f140157fbdf936cd0c4436f3b7afd4277646038456cc279a08f85ae841a31b5

Observation 6fa78a03-397b-4db9-bdb9-d6eac5e83b0a · outbound

This paper cites Noise is not the main factor behind the gap between sgd and adam on transformers, but sign descent might be, 2023.

Benchmarking Optimizers for Large Language Model Pretraining Noise is not the main factor behind the gap between sgd and adam on transformers, but sign descent might be, 2023

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.098766Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.098766Z digest=sha256:b269e74fb14ab1ea9ffc802c8dc41ac607b6145fde34cae9b228416bc0ff0f76

Observation 20c8f9dd-e67f-48dd-a6b4-ece308824be8 · outbound

This paper cites Heavy- tailed class imbalance and why adam outperforms gradient descent on language models, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Heavy- tailed class imbalance and why adam outperforms gradient descent on language models, 2024

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.112981Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.112981Z digest=sha256:fc0a9d1bb5269164a4ef83d6f1d0f033615036d68ff088310dd9739217912572

Observation b0fd45ae-a0e1-46aa-b445-6e6e38e53444 · outbound

This paper cites Farseer: A refined scaling law in large language models, 2025.

Benchmarking Optimizers for Large Language Model Pretraining Farseer: A refined scaling law in large language models, 2025

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.120086Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.120086Z digest=sha256:9fdac0a1145500958ec348cd6cd7ecede490fc82950fd0b96a77221c187b0f2a

Observation 9d666264-eeb7-4454-822e-29c3b35cf984 · outbound

This paper cites Predictable scale: Part i – optimal hyperparameter scaling law in large language model pretraining, 2025.

Benchmarking Optimizers for Large Language Model Pretraining Predictable scale: Part i – optimal hyperparameter scaling law in large language model pretraining, 2025

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.139881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.139881Z digest=sha256:35f5475c5a3766e1c0ab750b37fb569fc169ba46ab87e54bce43c0fd0188e456

Observation 7299b8a9-a840-4b50-b3df-edbd8a503584 · outbound

This paper cites Datacomp-lm: In search of the next generation of training sets for language models.

Benchmarking Optimizers for Large Language Model Pretraining Datacomp-lm: In search of the next generation of training sets for language models

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.152542Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.152542Z digest=sha256:0d217f214e2a95cdd0e7ef2280b5125694c8a3eee06517a57e7424b2192f703a

Observation 5da4ae20-002b-4624-b747-5b594098b239 · outbound

This paper cites Pytorch distributed: Experiences on accelerating data parallel training, 2020.

Benchmarking Optimizers for Large Language Model Pretraining Pytorch distributed: Experiences on accelerating data parallel training, 2020

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.163892Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.163892Z digest=sha256:4984cc22ea1497e2a483db393ec14068aaa82f8677cdf987097ecf1be4a99972

Observation 1c2cf729-c7d3-43ec-8d55-bf9798f8b90f · outbound

This paper cites Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Sophia: A scalable stochastic second-order optimizer for language model pre-training, 2024

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.172192Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.172192Z digest=sha256:63a8dc22ee50aa6ebb6b861c924078c2dc8b6705d0f847be3c420cd83a6f32ce

Observation 4061f7f4-ef2f-4a11-80c1-fc94bb050377 · outbound

This paper cites Same pre-training loss, better downstream: Implicit bias matters for language models, 2022.

Benchmarking Optimizers for Large Language Model Pretraining Same pre-training loss, better downstream: Implicit bias matters for language models, 2022

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.180465Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.180465Z digest=sha256:aa785ba9a77836aa9330a4f929b22f5b6c53b946ea177ac581d466c3308290a2

Observation bc4135a7-2505-4875-900b-84de062d0af9 · outbound

This paper cites Muon is scalable for llm training, 2025.

Benchmarking Optimizers for Large Language Model Pretraining Muon is scalable for llm training, 2025

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.191462Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.191462Z digest=sha256:36d8161528489d68d26219f200d7e25e64e44a05e9a739c1fa8e24e227ed9126

Observation daaa7974-2a32-4a0b-8a88-d7b69a33f651 · outbound

This paper cites The llama 3 herd of models, 2024.

Benchmarking Optimizers for Large Language Model Pretraining The llama 3 herd of models, 2024

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.201700Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.201700Z digest=sha256:2127533bc958890248193d45c0faf62abf8a469aa42db17a058f5f0bae2b84be

Observation a16d0fcb-fc91-4260-9bda-8d80a8687569 · outbound

This paper cites Sgdr: Stochastic gradient descent with warm restarts, 2017.

Benchmarking Optimizers for Large Language Model Pretraining Sgdr: Stochastic gradient descent with warm restarts, 2017

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.211642Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.211642Z digest=sha256:ff53b9f1463ce73f63ee1a567da386c8a70b108f2758314c9be6455bf28464a5

Observation 22c52868-f616-4c9e-ab23-bd15809fe719 · outbound

This paper cites Decoupled weight decay regularization, 2019.

Benchmarking Optimizers for Large Language Model Pretraining Decoupled weight decay regularization, 2019

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.224611Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.224611Z digest=sha256:77c625ad7f33c87e7fbbdb9e0fcbba0c53b80262dd80e7b4ac455e31a5477a75

Observation e5d8e998-92e5-4744-aa5a-a4c761ed6385 · outbound

This paper cites SW AN: SGD with normalization and whitening enables stateless llm training, 2025.

Benchmarking Optimizers for Large Language Model Pretraining SW AN: SGD with normalization and whitening enables stateless llm training, 2025

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.235207Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.235207Z digest=sha256:a49308a17438d8bbef8cf1ee1f16e9da4f8302bd89a11a734c71ef35982f7291

Observation 5dcd21a0-44d1-42aa-bd47-0b5060f0111c · outbound

This paper cites Small batch size training for language models: When vanilla sgd works, and why gradient accumulation is wasteful, 2025.

Benchmarking Optimizers for Large Language Model Pretraining Small batch size training for language models: When vanilla sgd works, and why gradient accumulation is wasteful, 2025

Reference 86

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.242809Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.242809Z digest=sha256:d87e793a1a16e8eccfafb6a59f0cd5ba7c74ea60c2e77157f453db57d6ebc104

Observation b3c415c9-f333-43d9-862f-75f9d37f68fb · outbound

This paper cites New insights and perspectives on the natural gradient method, 2020.

Benchmarking Optimizers for Large Language Model Pretraining New insights and perspectives on the natural gradient method, 2020

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.248543Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.248543Z digest=sha256:640fd07a03df24e7f928f12cfc6fe85c8d381406d37ab69e17bda1e0907240d7

Observation c9e0dec5-84c7-4103-aa90-4253ea486bb8 · outbound

This paper cites Effects of parameter norm growth during transformer training: Inductive bias from gradient descent, 2023.

Benchmarking Optimizers for Large Language Model Pretraining Effects of parameter norm growth during transformer training: Inductive bias from gradient descent, 2023

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.255443Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.255443Z digest=sha256:be4e44a208d6a46e320f9e389320de07f170575a80d4f8da9163311d5c1a64bc

Observation 0c7b8a1c-08c2-4457-8bb3-486055d882cc · outbound

This paper cites Mixed precision training, 2018.

Benchmarking Optimizers for Large Language Model Pretraining Mixed precision training, 2018

Reference 89

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.261498Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.261498Z digest=sha256:654498919f61473b0676c872768c38fcf4958ce252fc1d2ac2a7052bdb58f436

Observation 8f1263d3-4151-4df4-bfb7-35b3d19913d9 · outbound

This paper cites Prodigy: An expeditiously adaptive parameter-free learner, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Prodigy: An expeditiously adaptive parameter-free learner, 2024

Reference 90

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.275664Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.275664Z digest=sha256:30cff1f7009d59f5f767404b10a47f5107047eaf5a9195f8d6b70f2176e105f3

Observation a421d4d2-fa90-4870-84d4-980d0a231179 · outbound

This paper cites Connections between schedule-free optimizers, ademamix, and accelerated sgd variants, 2025.

Benchmarking Optimizers for Large Language Model Pretraining Connections between schedule-free optimizers, ademamix, and accelerated sgd variants, 2025

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.358568Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.358568Z digest=sha256:ab16b8a92694735620da83dcc445f73f3576d8195b2a76d927204da151a00f96

Observation 404f1cf9-6ae6-4461-87eb-25729cb3cdb2 · outbound

This paper cites Nemirovskii and Yu.E.

Benchmarking Optimizers for Large Language Model Pretraining Nemirovskii and Yu.E

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.419005Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.419005Z digest=sha256:bfffb096b064115353545c9eade568b60a78f223dc7a2a4962a4a7eddecbec29

Observation c51e241d-6516-4e23-b331-d3ca9c0a86d0 · outbound

This paper cites Nesterov and V.

Benchmarking Optimizers for Large Language Model Pretraining Nesterov and V

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.472058Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.472058Z digest=sha256:f6839aa966d7f768fd20bf9c37e1ec7db047eecc765a8eb6e5f424968c9a4102

Observation 3137ecfe-fb7e-417d-b06a-36dc41aae6f9 · outbound

This paper cites A method for unconstrained convex minimization problem with the rate of convergenceo(1/k2), 1983.

Benchmarking Optimizers for Large Language Model Pretraining A method for unconstrained convex minimization problem with the rate of convergenceo(1/k2), 1983

Reference 94

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.531481Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.531481Z digest=sha256:f1deb78094e46ab760d150f182da8c50e11b3fa35d1db63219def4cf6209d855

Observation fa5b3773-9138-402e-ada3-c120a8190b59 · outbound

This paper cites Gpt-4 technical report, 2024.

Benchmarking Optimizers for Large Language Model Pretraining Gpt-4 technical report, 2024

Reference 95

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.607895Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.607895Z digest=sha256:59d7af01a687d8782b87bb10503b983de6f0107394a48cd99f75ff66783884e0

Observation b5dec2b1-a411-4fd3-8b95-6396e8d915f3 · outbound

This paper cites Neural networks (maybe) evolved to make adam the best optimizer, 2020.

Benchmarking Optimizers for Large Language Model Pretraining Neural networks (maybe) evolved to make adam the best optimizer, 2020

Reference 96

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.676668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.676668Z digest=sha256:39c8ee9f3953819577351194fb0a201d4eda3192ee1ec86e35b89eab238c305d

Observation a68501d0-3c31-42a5-a91b-d30c574888f2 · outbound

This paper cites Open problem: Parameter-free and scale-free online algorithms.

Benchmarking Optimizers for Large Language Model Pretraining Open problem: Parameter-free and scale-free online algorithms

Reference 97

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T12:36:02.794621Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-05T12:35:51.744176Z digest=sha256:955e3ea9c33178b55ffbd1c2185b0f4300e95b7b97c47407a4557603ecf74926

Observation 568a1e7d-7e71-4a89-88cc-4b6afea2f98d · outbound

This paper cites In search of adam’s secret sauce, 2025.

Benchmarking Optimizers for Large Language Model Pretraining In search of adam’s secret sauce, 2025

Reference 98

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T12:36:02.768138Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-05T12:35:51.807783Z digest=sha256:2ef3b859cdf81c0e5a896f5b2ddedba7c5bada9ee80c194d3c659f452e2197ab

Observation a8f6afa5-eb57-45d5-bda7-46bd96386e7a · outbound

This paper cites The ademamix optimizer: Better, faster, older, 2024.

Benchmarking Optimizers for Large Language Model Pretraining The ademamix optimizer: Better, faster, older, 2024

Reference 99

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T12:36:02.733539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-05T12:35:51.891549Z digest=sha256:98d1d507af12db676c20be07076bf689ccd56cc3abae05dd392cdc5b00264820

Observation f12878bb-536d-4b0f-960d-a3a7eb347cb3 · outbound

This paper cites Pytorch: An imperative style, high-performance deep learning library, 2019.

Benchmarking Optimizers for Large Language Model Pretraining Pytorch: An imperative style, high-performance deep learning library, 2019

Reference 100

Resolution
unresolved
no resolver link, observed 2026-08-05T12:35:51.957442Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:35:51.957442Z digest=sha256:7e8a5c6a50cafad42be5c8ee14113494d97cb32b781233a71c1544deb2c00a34

Pith citing papers

Observation fb443bfe-da23-4701-8a9a-d8ec61521e0f · inbound

Fantastic Pretraining Optimizers and Where to Find Them cites this paper.

Fantastic Pretraining Optimizers and Where to Find Them Benchmarking Optimizers for Large Language Model Pretraining

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-05T11:59:49.778357Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T11:59:49.778357Z digest=sha256:d27753bf993e518f34b8313a454e695783cc88f4f525057364a5854aa3476765

Observation 949e6136-8c02-4f11-92d0-9bccef329228 · inbound

Preconditioned Norms: A Unified Framework for Steepest Descent, Quasi-Newton and Adaptive Methods cites this paper.

Preconditioned Norms: A Unified Framework for Steepest Descent, Quasi-Newton and Adaptive Methods Benchmarking Optimizers for Large Language Model Pretraining

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-05-21T21:10:38.756135Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-21T21:05:49.844436Z digest=sha256:6bf4353f33650738fc44da551dd41b30c18c10909d3df808ae409a1256bac6a3

Observation c30db491-0a24-427c-8803-312436a37102 · inbound

Optimal Sample Complexity for Single Time-Scale Actor-Critic with Momentum cites this paper.

Optimal Sample Complexity for Single Time-Scale Actor-Critic with Momentum Benchmarking Optimizers for Large Language Model Pretraining

Reference 50

Resolution
verified exact
arxiv_id, observed 2026-05-16T08:17:36.487221Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-16T08:12:57.430291Z digest=sha256:4db8e1155c60419ac6822b90c4c6baf5ba9a5e45bb2fb832c5dc12e5708e744b

Observation cb893229-810e-4b4b-a8fb-5b78c166f127 · inbound

LoRDO: Distributed Low-Rank Optimization with Infrequent Communication cites this paper.

LoRDO: Distributed Low-Rank Optimization with Infrequent Communication Benchmarking Optimizers for Large Language Model Pretraining

Reference 2014

Resolution
unresolved
no resolver link, observed 2026-08-03T04:44:56.066179Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T04:44:56.066179Z digest=sha256:ca6ec2111cfc7beff7e2014610f8582cf3d982f00550ac96435c8d2a89adf37d

Observation bd78ae6a-878b-48cd-961f-806021dbee74 · inbound

HTMuon: Improving Muon via Heavy-Tailed Spectral Correction cites this paper.

HTMuon: Improving Muon via Heavy-Tailed Spectral Correction Benchmarking Optimizers for Large Language Model Pretraining

Reference 21

Resolution
verified exact
arxiv_id, observed 2026-05-25T06:55:26.265757Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-25T06:50:29.893126Z digest=sha256:25e74d3f6d2bcaf993e7898d2d6cb3d28eda0a796ab3193e459a515876a173d3

Observation c9deeb18-9d70-42b9-8189-95b541cf1845 · inbound

Sharp Capacity Scaling of Spectral Optimizers in Learning Associative Memory cites this paper.

Sharp Capacity Scaling of Spectral Optimizers in Learning Associative Memory Benchmarking Optimizers for Large Language Model Pretraining

Reference 48

Resolution
verified exact
arxiv_id, observed 2026-05-14T23:38:16.407545Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-14T23:37:33.106390Z digest=sha256:7ea41fdd7a350baa04c16609338f5957f0c2b059dbc68c10384a1c2fb3a67c89

Observation 2a8e356d-9410-4f35-93ef-67484520e0cb · inbound

Nexus: Same Pretraining Loss, Better Downstream Generalization via Common Minima cites this paper.

Nexus: Same Pretraining Loss, Better Downstream Generalization via Common Minima Benchmarking Optimizers for Large Language Model Pretraining

Reference 35

Resolution
verified exact
arxiv_id, observed 2026-05-11T05:55:57.177884Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-10T17:53:39.356675Z digest=sha256:0e514570441e32da78c843c4a65bc8322a747c514bce8c907fbbc3c6dc12b631

Observation e4f7eebb-04aa-417e-872d-8d2b80194fb9 · inbound

Evolution of Optimization Methods: Algorithms, Scenarios, and Evaluations cites this paper.

Evolution of Optimization Methods: Algorithms, Scenarios, and Evaluations Benchmarking Optimizers for Large Language Model Pretraining

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-05-11T10:51:20.489496Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-10T15:16:58.221358Z digest=sha256:2f2bc1aed003d7c12133ca8e1200ca13a654de7b023bd06f6b5f23adc3e2b911

Observation 32b87b17-45dd-41fe-b844-5e8b4f504424 · inbound

Benchmarking Optimizers for MLPs in Tabular Deep Learning cites this paper.

Benchmarking Optimizers for MLPs in Tabular Deep Learning Benchmarking Optimizers for Large Language Model Pretraining

Reference 11

Resolution
metadata mismatch
arxiv_id, observed 2026-05-10T12:10:22.021599Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-10T12:06:08.798712Z digest=sha256:0c82c62621bc778a287f944c1efc157c432f10bf928856b28800ca349c2157af

Observation 47e8c762-ed4f-428b-87fc-c65a0ce4027a · inbound

StoSignSGD: Unbiased Structural Stochasticity Fixes SignSGD for Training Large Language Models cites this paper.

StoSignSGD: Unbiased Structural Stochasticity Fixes SignSGD for Training Large Language Models Benchmarking Optimizers for Large Language Model Pretraining

Reference 36

Resolution
verified exact
arxiv_id, observed 2026-05-10T12:15:22.218722Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-10T12:10:44.802059Z digest=sha256:d7cb69e63a8f5b12fbfcd83cbb0b35e43a2a98f491912f9e1ab985c8b9f094aa

Observation ab73c9d0-656a-4a0d-a2d1-9c563db4178b · inbound

When and Why SignSGD Outperforms SGD: A Theoretical Study Based on $\ell_1$-norm Lower Bounds cites this paper.

When and Why SignSGD Outperforms SGD: A Theoretical Study Based on $\ell_1$-norm Lower Bounds Benchmarking Optimizers for Large Language Model Pretraining

Reference 29

Resolution
verified exact
arxiv_id, observed 2026-05-11T19:21:07.675545Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-08T12:14:28.866499Z digest=sha256:9d39aed47f3db638b0f4c187263d907507759c63efad5eb9604cd0ac822787d6

Observation c241f457-713a-41f8-9d3e-7a495da4d34b · inbound

Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less cites this paper.

Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less Benchmarking Optimizers for Large Language Model Pretraining

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-05-11T19:26:08.543311Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-08T12:00:49.127471Z digest=sha256:86c5e2042f715d285e3f29307c3084c537ecba4dedc206f7ecdeb32da83c58d5

Observation 49fb2eb5-b6a4-4d35-a8c8-2845f077e2c9 · inbound

Navigating LLM Valley: From AdamW to Memory-Efficient and Matrix-Based Optimizers cites this paper.

Navigating LLM Valley: From AdamW to Memory-Efficient and Matrix-Based Optimizers Benchmarking Optimizers for Large Language Model Pretraining

Reference 37

Resolution
verified exact
arxiv_id, observed 2026-05-12T06:41:45.519353Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-12T04:01:32.057022Z digest=sha256:03ad58165608af8eea0cf3ef4c64a9664899edb85c8a00964694214b00b0f484

Observation 5883819f-1012-4d65-a32d-7cdeca1deba4 · inbound

Rescaled Asynchronous SGD: Optimal Distributed Optimization under Data and System Heterogeneity cites this paper.

Rescaled Asynchronous SGD: Optimal Distributed Optimization under Data and System Heterogeneity Benchmarking Optimizers for Large Language Model Pretraining

Reference 32

Resolution
verified exact
arxiv_id, observed 2026-05-14T19:32:50.855805Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-05-14T19:31:12.149482Z digest=sha256:0aef98f2af05e93362508872f3573285e5b53da12309a730a0e6d1eb69a22e3e

Observation 68c55c15-3ee8-495a-88c3-3a8999dc5df4 · inbound

Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers cites this paper.

Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers Benchmarking Optimizers for Large Language Model Pretraining

Reference 134

Resolution
verified exact
arxiv_id, observed 2026-05-20T09:38:11.217214Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-20T09:34:45.186929Z digest=sha256:55038efb3457252b2a01807e6871fe5d440b217cb3ac9fa1a4e9bdd72bc8e850

Observation 1750ef5d-27b2-4566-848b-b9b4cd74497a · inbound

Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers cites this paper.

Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers Benchmarking Optimizers for Large Language Model Pretraining

Reference 136

Resolution
verified exact
arxiv_id, observed 2026-06-30T18:45:00.393205Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-06-30T18:42:01.854481Z digest=sha256:b64fc38522e4544ca7795129687d8a4ee99e57f378132ea99e7c8fb2ee63e00c

Observation 56fd8440-a43e-42df-ad27-029d1533ea45 · inbound

LionMuon: Alternating Spectral and Sign Descent for Efficient Training cites this paper.

LionMuon: Alternating Spectral and Sign Descent for Efficient Training Benchmarking Optimizers for Large Language Model Pretraining

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-05-20T07:28:06.765568Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-20T07:24:55.516803Z digest=sha256:d38040603f339cf13023d92fd89a9f91786ade18d1773fdd41da8e5cb1f76cc9

Observation 8fd65943-b119-450d-a15c-bc72839058d5 · inbound

LionMuon: Alternating Spectral and Sign Descent for Efficient Training cites this paper.

LionMuon: Alternating Spectral and Sign Descent for Efficient Training Benchmarking Optimizers for Large Language Model Pretraining

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-06-30T18:35:00.435900Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-06-30T18:30:51.719396Z digest=sha256:892c168e6e5ff745b8a03bf65799e15bcfb06a6ca8af4b94f280f42c9bc49cbf

Observation cef63c76-0d48-4a8f-ab54-be36c37a7463 · inbound

Why SGD is not Brownian Motion: A New Perspective on Stochastic Dynamics cites this paper.

Why SGD is not Brownian Motion: A New Perspective on Stochastic Dynamics Benchmarking Optimizers for Large Language Model Pretraining

Reference 192

Resolution
verified exact
arxiv_id, observed 2026-05-22T08:11:17.313797Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-05-22T08:06:52.309619Z digest=sha256:dcd845840673f098226ad514ba1412410ec51500f0d854f80fb8b3e80fdb34de

Observation 36e17f08-5a44-462f-b932-356011a2b584 · inbound

Reparametrizing Shampoo and SOAP for Subspace Basis Updates and BFloat16 Storage cites this paper.

Reparametrizing Shampoo and SOAP for Subspace Basis Updates and BFloat16 Storage Benchmarking Optimizers for Large Language Model Pretraining

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-06-29T22:24:00.706903Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-06-29T22:16:53.946499Z digest=sha256:9a234b8a6874ebd4a139ac97f0190594a0951a747a23faa2d523b8ab75d4d93d

Observation b9670b42-1ecb-444c-bd9d-520367ce8fa4 · inbound

Softsign: Smooth Sign in Your Optimizer For Better Parameter Heterogeneity Handling cites this paper.

Softsign: Smooth Sign in Your Optimizer For Better Parameter Heterogeneity Handling Benchmarking Optimizers for Large Language Model Pretraining

Reference 44

Resolution
verified exact
arxiv_id, observed 2026-06-28T22:52:44.860967Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-06-28T22:51:38.488754Z digest=sha256:f0d5e033908ee03bf7e8f519bfa9b15c5b5c7920fb09c584e3c62ffec9531a54

Observation 670a7054-6c7e-4b71-b263-8d575561617c · inbound

Denoise First, Orthogonalize Later: Understanding Momentum in Muon via Spectral Filtering cites this paper.

Denoise First, Orthogonalize Later: Understanding Momentum in Muon via Spectral Filtering Benchmarking Optimizers for Large Language Model Pretraining

Reference 46

Resolution
verified exact
arxiv_id, observed 2026-07-02T01:56:27.815268Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-06-28T11:24:38.292078Z digest=sha256:8b77989f55537cc96a4bab9ccb20f80518756d45ad4bbaf403e31eb9458af8ff

Observation 68a78f89-2c6a-40fe-b4de-9242b71381ca · inbound

Open Problem: Is AdamW Effective Under Heavy-Tailed Noise? cites this paper.

Open Problem: Is AdamW Effective Under Heavy-Tailed Noise? Benchmarking Optimizers for Large Language Model Pretraining

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-07-04T10:09:44.602263Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-06-26T09:08:41.993925Z digest=sha256:3fe35343d995531f4adce1c884b2835d014d64bf042b38b67318358ad5cdcbe4

Observation 9c5e31cf-cfa2-4bc6-ac80-97675cc31922 · inbound

OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers cites this paper.

OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers Benchmarking Optimizers for Large Language Model Pretraining

Reference 97

Resolution
unresolved
no resolver link, observed 2026-07-11T22:10:49.683444Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T22:10:49.683444Z digest=sha256:6f750bcb936b86cf62e602b8cc1dfcbeb7fcf292da21d2c105a120a1c704c693

Observation d3b04c17-064f-4229-9c1d-ccc1dcc9f23c · inbound

(A)iSpy: Parasitic Trojans for Machine Learning Infrastructure cites this paper.

(A)iSpy: Parasitic Trojans for Machine Learning Infrastructure Benchmarking Optimizers for Large Language Model Pretraining

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-01T17:47:03.790519Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T17:47:03.790519Z digest=sha256:455110f93f6769a63eb228da8cb0edcbdaedf6c5d2c784e6cba85bbebfe37ffd

Observation d3922175-6ba6-404b-b07c-115aab2d1ab1 · inbound

PoLoRA: A Preconditioned Orthogonalized LoRA Optimizer cites this paper.

PoLoRA: A Preconditioned Orthogonalized LoRA Optimizer Benchmarking Optimizers for Large Language Model Pretraining

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-01T17:32:35.613381Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T17:32:35.613381Z digest=sha256:14388c9b14079543c7a02371878ab2ee4d343ed93a11a30028ac59eddcf4d9cf

Observation 970c7596-d80c-40ac-8060-6449687b52f1 · inbound

Scale Weight Decay and Train Better cites this paper.

Scale Weight Decay and Train Better Benchmarking Optimizers for Large Language Model Pretraining

Reference 67

Resolution
unresolved
no resolver link, observed 2026-07-30T12:53:41.174828Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T12:53:41.174828Z digest=sha256:ff4ef32b5358b8cd8e4d46d28b027308857c3372180450cfd551a4fda48607f7

Observation 76c7a6db-6cbd-4f13-a74e-2226997896a9 · inbound

CMuon: Accelerating and Stabilizing Diffusion Transformer Training via Chunked Momentum Orthogonalization cites this paper.

CMuon: Accelerating and Stabilizing Diffusion Transformer Training via Chunked Momentum Orthogonalization Benchmarking Optimizers for Large Language Model Pretraining

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-04T06:04:04.927838Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T06:04:04.927838Z digest=sha256:d0cc20b9884d274d8ed4c1c23c97797d5f84dfbf4495fd2fce9c6feec31bf4fc