{"as_of":"2026-08-05T21:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dc2ec976d8c07ffa0f12c9556d4913767df176fa427d5ddbc57124f7253a7c98","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T06:45:18.400599Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T04:19:37.877565Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.20548","snapshot_observed_at":"2026-08-01T21:13:38.825691Z","title":"Kimi Team","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16169","last_updated":"2026-08-02T14:51:38Z","snapshot_observed_at":"2026-08-05T20:52:11.035159Z","submitted_at":"2026-07-17T17:49:05Z","title":"When Does Muon Help Agentic Reinforcement Learning?","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T21:13:38.825691Z"},"links":{"cited_paper":"/paper/2607.20548","citing_paper":"/paper/2607.16169"},"observation_digest":"sha256:151311e44efce0310c1ed159d70aa8e201970e32a6ab53e745cc4585263ff587","observation_id":"d2249c7c-3bcb-425f-b743-688c4ff23520","resolution":{"observed_at":"2026-08-01T21:13:38.825691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.20548","snapshot_observed_at":"2026-08-04T04:19:37.877565Z","title":"Kimi Team","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16169","last_updated":"2026-08-02T14:51:38Z","snapshot_observed_at":"2026-08-05T20:52:11.035159Z","submitted_at":"2026-07-17T17:49:05Z","title":"When Does Muon Help Agentic Reinforcement Learning?","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T04:19:37.877565Z"},"links":{"cited_paper":"/paper/2607.20548","citing_paper":"/paper/2607.16169"},"observation_digest":"sha256:593c147ada7adfec15a808ca13a1a1faab6d3b39a203a5c573122d8bb770d55f","observation_id":"f0a3e926-f1ad-4016-8abd-f1b2aeac5ec5","resolution":{"observed_at":"2026-08-04T04:19:37.877565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.20548/citation-record","integrity":"/paper/2607.20548/integrity","json":"/paper/2607.20548/citation-record.json","paper":"/paper/2607.20548"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-02T06:45:09.667912Z","title":"Adam: A method for stochastic optimization.arXiv preprint arXiv:1412.6980, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:09.667912Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:3c1349c77c738fa7ae664fb328cd66d6241afe7f8aa3094cd56802c3c1dad092","observation_id":"24b3c119-0f44-45f3-b04d-4950669c0edd","resolution":{"observed_at":"2026-08-02T06:45:09.667912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-02T06:45:09.783704Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:09.783704Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:d23158fcb3b71142410c7149ad07a8d32e223257e135f4b8042274f0b917e0af","observation_id":"04c785ae-fa76-4867-a04f-12418d339f05","resolution":{"observed_at":"2026-08-02T06:45:09.783704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:09.875431Z","title":"Neural networks for machine learning lecture 6a overview of mini-batch gradient descent.Cited on, 14(8):2, 2012","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:09.875431Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:2f0895870d751f24ac0dc4d40029d85dac00acecfa9dbbe8979ca89116d51d36","observation_id":"1b5f3881-521d-4e8a-adc2-e3e225d3ac3d","resolution":{"observed_at":"2026-08-02T06:45:09.875431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.04839","last_updated":"2021-06-13T21:13:02Z","snapshot_observed_at":"2026-07-06T08:56:41.948023Z","submitted_at":"2020-02-12T08:28:19Z","title":"LaProp: Separating Momentum and Adaptivity in Adam","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.04839","snapshot_observed_at":"2026-08-02T06:45:09.935650Z","title":"Laprop: Separating momentum and adaptivity in adam.arXiv preprint arXiv:2002.04839, 2020","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:09.935650Z"},"links":{"cited_paper":"/paper/2002.04839","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:658f793cd7d1cd0f93213d04f5185e5571f1a6ca0113081d9ca0d0c7e36443ec","observation_id":"583768f7-0d65-4b9d-8ab3-6787c2ab6141","resolution":{"observed_at":"2026-08-02T06:45:09.935650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:10.034846Z","title":"Fast approximate natural gradient descent in a kronecker factored eigenbasis.Advances in neural information processing systems, 31, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:10.034846Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:14bc2ce5938c47bd9c9b02b6a663cd1584ade1f01a1624bb71ff21ddd8466614","observation_id":"f6fa9006-bd39-4a99-92b5-100a5156d058","resolution":{"observed_at":"2026-08-02T06:45:10.034846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:10.085591Z","title":"Optimizing neural networks with kronecker-factored approxi- mate curvature","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:10.085591Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:51e1e70c34e7d941f5cafeb9ed2d8feb67fc520ef4799913917c4fe797e31847","observation_id":"960149df-9156-47f5-a4a5-d4dbc1eb8b57","resolution":{"observed_at":"2026-08-02T06:45:10.085591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:10.245738Z","title":"A progressive batching l-bfgs method for machine learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:10.245738Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:1c86e4d7548ec762c15ba00a1b8552fc0a1aef8ea0bbcce3c496aa6a5b768e21","observation_id":"dbe0683b-1f7c-4898-ad95-351fa82d782a","resolution":{"observed_at":"2026-08-02T06:45:10.245738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11321","last_updated":"2025-01-31T18:52:42Z","snapshot_observed_at":"2026-07-06T19:16:51.512681Z","submitted_at":"2024-09-17T16:18:05Z","title":"SOAP: Improving and Stabilizing Shampoo using Adam","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11321","snapshot_observed_at":"2026-08-02T06:45:10.411447Z","title":"Soap: Improving and stabilizing shampoo using adam.arXiv preprint arXiv:2409.11321, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:10.411447Z"},"links":{"cited_paper":"/paper/2409.11321","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:8e95c0a9bf5d8b6aaba24320f349cfdf0a4d8b55cf823883d2e0aa0e46141491","observation_id":"6471271c-25a1-4623-bd6d-4e239ae7ec23","resolution":{"observed_at":"2026-08-02T06:45:10.411447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:10.561041Z","title":"Purifying shampoo: Investigating shampoo’s heuristics by decomposing its preconditioner","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:10.561041Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:081d3af09ce282a5a28b4a403947df2dd49fc893c603d7fe20ca9cdb4f6cc08a","observation_id":"c4a5c059-ffe8-43a6-9b96-6a3883b0f0a0","resolution":{"observed_at":"2026-08-02T06:45:10.561041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:10.707170Z","title":"Understanding and improving the shampoo optimizer via kullback-leibler minimization.arXiv e-prints, pages arXiv–2509, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:10.707170Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:3894680c716f687371860ffddc986e33f645f4b1611c891cbeaf20ff57b3aa18","observation_id":"6b60bb62-a945-4e99-9272-47654e70fdfe","resolution":{"observed_at":"2026-08-02T06:45:10.707170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07529","last_updated":"2025-06-06T13:42:19Z","snapshot_observed_at":"2026-08-03T03:50:14.086851Z","submitted_at":"2025-02-11T13:10:34Z","title":"Training Deep Learning Models with Norm-Constrained LMOs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07529","snapshot_observed_at":"2026-08-02T06:45:10.812240Z","title":"Training deep learning models with norm-constrained lmos.arXiv preprint arXiv:2502.07529, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:10.812240Z"},"links":{"cited_paper":"/paper/2502.07529","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:22c634a50209496c5342939e0eba0fafdab77b5b21283f8a4680361eb0548bd1","observation_id":"36bb432b-31dc-4628-9626-3b30782906b5","resolution":{"observed_at":"2026-08-02T06:45:10.812240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:10.907906Z","title":"Shampoo: Preconditioned stochastic tensor optimization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:10.907906Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:2c9a4d360338888cf1c117af9d86bc2ae1665d25ebd2fc3a8e8ba32224f4a678","observation_id":"e615af54-4239-4f12-a5f5-0e2681fa0570","resolution":{"observed_at":"2026-08-02T06:45:10.907906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-02T06:45:11.096240Z","title":"Muon is scalable for llm training.arXiv preprint arXiv:2502.16982, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:11.096240Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:a0f4592e67985de1ea6217f33fc29e877d5d983fe80ae4e8f267447730731c5c","observation_id":"9a69c054-a9b9-485f-b4ce-e7bc2b0c8908","resolution":{"observed_at":"2026-08-02T06:45:11.096240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-08-02T06:45:11.255675Z","title":"Practical efficiency of muon for pretraining.arXiv preprint arXiv:2505.02222, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:11.255675Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:d9b9f76b516c24423ed603cb6be0bef53e826bbdf25d7edca580d667335e3216","observation_id":"7910fb49-bf75-4774-be98-e01007f6edad","resolution":{"observed_at":"2026-08-02T06:45:11.255675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16932","last_updated":"2026-05-04T23:23:45Z","snapshot_observed_at":"2026-07-06T21:28:43.610849Z","submitted_at":"2025-05-22T17:23:14Z","title":"The Polar Express: Optimal Matrix Sign Methods and Their Application to the Muon Algorithm","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16932","snapshot_observed_at":"2026-08-02T06:45:11.360068Z","title":"The polar express: Optimal matrix sign methods and their application to the muon algorithm.arXiv preprint arXiv:2505.16932, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:11.360068Z"},"links":{"cited_paper":"/paper/2505.16932","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:19b7ce3c665b5863bb73161b635f1c96750e8bf452326efe23390d24802da476","observation_id":"1b3c3efd-595e-4bda-9410-8e66ec6475e9","resolution":{"observed_at":"2026-08-02T06:45:11.360068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:11.491221Z","title":"Muon: An optimizer for hidden layers in neural networks, 2024b.URL https://kellerjordan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:11.491221Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:de6f4ede1a40824efc875d77fcd0653456480f7cbf6881ab4eafe6fd6f2636dc","observation_id":"8d6bc1ba-0e54-491d-8fae-534617199d7d","resolution":{"observed_at":"2026-08-02T06:45:11.491221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-02T06:45:11.623090Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:11.623090Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:5fe97cb7dda2515e8887520a5f181e82e42c53f8e5b4af7db8b640851618b2c2","observation_id":"f6ed0731-c1ab-403f-ab7f-6be77ca1c507","resolution":{"observed_at":"2026-08-02T06:45:11.623090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02265","last_updated":"2024-11-06T09:15:27Z","snapshot_observed_at":"2026-08-04T12:39:25.666793Z","submitted_at":"2024-11-04T16:56:26Z","title":"Hunyuan-Large: An Open-Source MoE Model with 52 Billion Activated Parameters by Tencent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02265","snapshot_observed_at":"2026-08-02T06:45:11.904635Z","title":"Hunyuan-large: An open-source moe model with 52 billion activated parameters by tencent.arXiv preprint arXiv:2411.02265, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:11.904635Z"},"links":{"cited_paper":"/paper/2411.02265","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:cff1d6fb17e275e173a08123ac48f52d25f1303b6bef6495d788c9f1e00789fb","observation_id":"7cb5d772-0a91-4b0e-a2a1-11c3498113fa","resolution":{"observed_at":"2026-08-02T06:45:11.904635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-07-06T05:46:07.424788Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-02T06:45:12.033235Z","title":"Accurate, large minibatch sgd: Training imagenet in 1 hour.arXiv preprint arXiv:1706.02677, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:12.033235Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:13ebed757836e1b4aa406fdf3e215cf874ced868b039088d82691a3839a82ae3","observation_id":"ae0008f2-8e98-464f-b4ca-30bcf5ad6dec","resolution":{"observed_at":"2026-08-02T06:45:12.033235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:12.193929Z","title":"On the sdes and scaling rules for adaptive gradient algorithms.Advances in Neural Information Processing Systems, 35:7697–7711, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:12.193929Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:b0f696db9d2579ee2ca11a9c840e2b206d303019699e1a75148b848f29fbcad3","observation_id":"e33c0488-b8fd-4afe-bbc3-ae038b6a67ba","resolution":{"observed_at":"2026-08-02T06:45:12.193929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-02T06:45:12.318217Z","title":"Pytorch fsdp: experiences on scaling fully sharded data parallel.arXiv preprint arXiv:2304.11277, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:12.318217Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:5dd7037825cea6000ba87cdd1d9ba50ceb8e675edd1411c18dcb89e4af040201","observation_id":"7d6cd56e-b842-46b8-9f51-76f9f692011d","resolution":{"observed_at":"2026-08-02T06:45:12.318217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:12.447125Z","title":"Zero: Memory optimiza- tions toward training trillion parameter models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:12.447125Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:046daa8a3fbd61f97310b618d27b18b58f8ac36f1b36abfadcc8a4d5c3af249c","observation_id":"1c8cb48c-1b66-414f-9d7e-629157238217","resolution":{"observed_at":"2026-08-02T06:45:12.447125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.09018","last_updated":"2021-03-05T06:29:48Z","snapshot_observed_at":"2026-08-03T21:55:15.856477Z","submitted_at":"2020-02-20T20:51:33Z","title":"Scalable Second Order Optimization for Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.09018","snapshot_observed_at":"2026-08-02T06:45:12.628217Z","title":"Scalable second order optimization for deep learning.arXiv preprint arXiv:2002.09018, 2020","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:12.628217Z"},"links":{"cited_paper":"/paper/2002.09018","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:19b4a7cf850bf016ef1e37058f360fd83ecbc9cc4f9d4adb543970086624a919","observation_id":"8a20dc7e-1b59-41eb-9a72-b22682ab6864","resolution":{"observed_at":"2026-08-02T06:45:12.628217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02016","last_updated":"2026-06-25T10:32:29Z","snapshot_observed_at":"2026-08-03T05:35:15.924541Z","submitted_at":"2026-02-02T12:14:45Z","title":"DASH: Faster Shampoo via Batched Block Preconditioning and Efficient Inverse-Root Solvers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02016","snapshot_observed_at":"2026-08-02T06:45:12.772594Z","title":"Dash: Faster shampoo via batched block preconditioning and efficient inverse-root solvers.arXiv preprint arXiv:2602.02016, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:12.772594Z"},"links":{"cited_paper":"/paper/2602.02016","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:e00094023dd0a7e3eaa3ddaf0d793b8768e056837363f2d3275cec862dacd3f3","observation_id":"143f7807-a46c-4659-a567-62ad324b12cd","resolution":{"observed_at":"2026-08-02T06:45:12.772594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:12.853115Z","title":"Precondi- tioned spectral descent for deep learning.Advances in neural information processing systems, 28, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:12.853115Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:15f544b51cd524dd35965315746ae456b2f55cf48617fc19fa21789224dc985d","observation_id":"5d724d58-fcc3-450b-bf1c-691b1d8f3b2a","resolution":{"observed_at":"2026-08-02T06:45:12.853115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:12.936009Z","title":"Stochastic spectral descent for restricted boltzmann machines","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:12.936009Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:6f50d9a5486513c9917ac4730d21d29cba4602296602477b3116b63a7fab7242","observation_id":"196eabd2-3d09-436e-8ffa-c5989a880cfa","resolution":{"observed_at":"2026-08-02T06:45:12.936009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:13.072219Z","title":"Stochastic spectral descent for discrete graphical models.IEEE Journal of Selected Topics in Signal Processing, 10(2):296–311, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:13.072219Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:29ff6c53434acfacc80f63b84621bcd450f2ea9c5b410926b7aaae56c3f9e66f","observation_id":"4ddaba03-2b0d-494e-8568-8e5adb2e9b38","resolution":{"observed_at":"2026-08-02T06:45:13.072219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.00523","last_updated":"2024-06-14T23:01:38Z","snapshot_observed_at":"2026-07-06T05:53:39.440274Z","submitted_at":"2017-08-01T21:24:38Z","title":"The duality structure gradient descent algorithm: analysis and applications to neural networks","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.00523","snapshot_observed_at":"2026-08-02T06:45:13.215435Z","title":"The duality structure gradient descent algorithm: analysis and applications to neural networks.arXiv preprint arXiv:1708.00523, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:13.215435Z"},"links":{"cited_paper":"/paper/1708.00523","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:5176d5037142dbe609022f29fa88010ca74fda51432205d5f1ecca2fadf4f9ca","observation_id":"7f0d3422-b192-46fb-8d8d-e6784f27a2cc","resolution":{"observed_at":"2026-08-02T06:45:13.215435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-03T01:16:50.130450Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-08-02T06:45:13.333343Z","title":"Modular duality in deep learning.arXiv preprint arXiv:2410.21265, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:13.333343Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:4abf7a87676df12fb8501e65c6c625858199fbcddc7e79ba5721e8a3344ceaf4","observation_id":"9344d4b5-482f-4669-bde0-23ea357f164f","resolution":{"observed_at":"2026-08-02T06:45:13.333343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20325","last_updated":"2024-12-06T14:09:22Z","snapshot_observed_at":"2026-08-03T03:18:47.425243Z","submitted_at":"2024-09-30T14:26:12Z","title":"Old Optimizer, New Norm: An Anthology","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20325","snapshot_observed_at":"2026-08-02T06:45:13.459657Z","title":"Old optimizer, new norm: An anthology.arXiv preprint arXiv:2409.20325, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:13.459657Z"},"links":{"cited_paper":"/paper/2409.20325","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:858db6700197c097fc82780494c32eec0a08920712467b4881435ffdac04974f","observation_id":"fe6db98e-2778-4a76-817f-3e3b684d676b","resolution":{"observed_at":"2026-08-02T06:45:13.459657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14813","last_updated":"2024-05-23T17:23:30Z","snapshot_observed_at":"2026-07-06T18:18:47.640933Z","submitted_at":"2024-05-23T17:23:30Z","title":"Scalable Optimization in the Modular Norm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14813","snapshot_observed_at":"2026-08-02T06:45:13.650206Z","title":"Scalable optimization in the modular norm.arXiv preprint arXiv:2405.14813, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:13.650206Z"},"links":{"cited_paper":"/paper/2405.14813","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:f6eab9e1bf857e0dccdb7b976b5f5f37473a5d276c134da14b808f9282fd363d","observation_id":"c5dd4445-3ab7-4f60-abd2-b1ec2f7ce1bf","resolution":{"observed_at":"2026-08-02T06:45:13.650206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.21545","last_updated":"2026-05-14T00:38:30Z","snapshot_observed_at":"2026-08-04T04:29:45.131716Z","submitted_at":"2026-02-25T04:04:00Z","title":"MUON+: Towards More Effective Muon via One Additional Normalization Step for LLM Pre-training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.21545","snapshot_observed_at":"2026-08-02T06:45:13.858281Z","title":"Muon+: Towards better muon via one additional normalization step.arXiv preprint arXiv:2602.21545, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:13.858281Z"},"links":{"cited_paper":"/paper/2602.21545","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:e4e68735a9aa29bae0ff541708d678e7219e52a9a0c4188c3c86cb74b77b3d57","observation_id":"8f0c4daa-6a9b-42a1-b7c7-9a0712126ce9","resolution":{"observed_at":"2026-08-02T06:45:13.858281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:14.041176Z","title":"Towards a principled muon under𝜇p: Ensuring spectral conditions throughout training.arXiv preprint arXiv:2601.01306, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:14.041176Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:20cddbc1b94527e0f5be1b36653b6c5afd3b13b0076c8bbd92d9521147f6173d","observation_id":"cb74dc77-c2f2-4d48-8721-054ed188f737","resolution":{"observed_at":"2026-08-02T06:45:14.041176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:14.198277Z","title":"Adamuon: Adaptive muon optimizer.arXiv preprint arXiv:2507.11005, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:14.198277Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:f2ffc757b125d4fd3d58d869b289777859f36872f771fd448b41bba0749f4fa8","observation_id":"12fc0053-0d22-46f7-a0d1-55c94af31181","resolution":{"observed_at":"2026-08-02T06:45:14.198277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:14.357745Z","title":"Normuon: Making muon more efficient and scalable.arXiv preprint arXiv:2510.05491, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:14.357745Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:957a9942be72241bfc1e537c20d429ec10d8a2379c3c59bb017ef386cba7f41c","observation_id":"cb874508-99c0-40b3-902f-5457386e0d67","resolution":{"observed_at":"2026-08-02T06:45:14.357745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:14.446539Z","title":"Fantastic pretraining optimizers and where to find them ii: From weight decay to hyperball optimization, 12 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:14.446539Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:d47d08989a5aabadca8786cf8227fb8aea8b66cc8d1bfdaccd1c858cf3ef8ed4","observation_id":"0355528b-3d71-4247-b20c-0a44613f9d01","resolution":{"observed_at":"2026-08-02T06:45:14.446539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:14.558228Z","title":"Controlled llm training on spectral sphere.arXiv preprint arXiv:2601.08393, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:14.558228Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:54211684d4b23552e6cfc13bbec1eae10dde435a09c0f09b17483969c825af54","observation_id":"0f139f67-6d74-4086-8116-65a3081c0abb","resolution":{"observed_at":"2026-08-02T06:45:14.558228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:14.680021Z","title":"Adam improves muon: Adaptive moment estimation with orthogonalized momentum.arXiv preprint arXiv:2602.17080, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:14.680021Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:5f429b24be9f88011408ee34244808b713a87a431e49c8695322f480faf0195c","observation_id":"6ff5efe9-4b21-46db-afbb-c0a149f7f567","resolution":{"observed_at":"2026-08-02T06:45:14.680021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:14.814783Z","title":"Manifold constrained steepest descent.arXiv preprint arXiv:2601.21487, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:14.814783Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:2c3ce1b53b0ca642f32302be2c3d0d9e68111da0600ae9e28c40266c8b15e326","observation_id":"90fbaf49-3678-4346-a1d8-701290c5a6de","resolution":{"observed_at":"2026-08-02T06:45:14.814783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:14.970929Z","title":"The newton-muon optimizer.arXiv preprint arXiv:2604.01472, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:14.970929Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:208f9dedac7935f6d3062eba90bd16c62d6d2020e7304d17cc8cf480f08c681f","observation_id":"d5abe931-8959-4242-a595-eb7d7302b4bb","resolution":{"observed_at":"2026-08-02T06:45:14.970929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:15.138354Z","title":"Mousse: Rectifying the geometry of muon with curvature-aware preconditioning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:15.138354Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:0b33300e73db6314f24cac414ed0edb3b4b7ce790f3c72fb01d499c7ab8d1b1d","observation_id":"e2e59c56-13ea-4b79-9f26-ca532089e751","resolution":{"observed_at":"2026-08-02T06:45:15.138354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.22437","last_updated":"2026-04-21T21:24:42Z","snapshot_observed_at":"2026-07-06T22:47:06.893212Z","submitted_at":"2026-02-25T21:55:43Z","title":"veScale-FSDP: Flexible and High-Performance FSDP at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.22437","snapshot_observed_at":"2026-08-02T06:45:15.274057Z","title":"vescale-fsdp: Flexible and high-performance fsdp at scale.arXiv preprint arXiv:2602.22437, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:15.274057Z"},"links":{"cited_paper":"/paper/2602.22437","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:9cd5048fab2bf0ed6c46fd04d41bc6a549e4a3ae9f5a2c45e0a595abc3202ec2","observation_id":"afdba9c2-f340-4d9f-8127-a4445be7afed","resolution":{"observed_at":"2026-08-02T06:45:15.274057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:15.365593Z","title":"Canzona: A unified, asynchronous, and load-balanced framework for distributed matrix-based optimizers.arXiv preprint arXiv:2602.06079, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:15.365593Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:0530732a34de7f1f1b918d46c53cb8056238b139e3c5b467a1e40e2e10e9fee7","observation_id":"3a78d3df-ded1-4a62-8f36-e0e22de95125","resolution":{"observed_at":"2026-08-02T06:45:15.365593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:15.479625Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901, 2020","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:15.479625Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:21b5fb30ba8b48b3dcd6d1fd58e809f7490e19901048d4a7c4610bba71b9fc35","observation_id":"f4aeb0c7-eeb3-4584-9e46-caac917c807e","resolution":{"observed_at":"2026-08-02T06:45:15.479625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-02T06:45:15.554716Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:15.554716Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:37548b6b7f7fadf45c5abb4857a7355dc465717364be545547d0997715e42397","observation_id":"79c929b9-1e0b-4fe6-8127-e129ef6366e9","resolution":{"observed_at":"2026-08-02T06:45:15.554716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03624","last_updated":"2025-09-05T17:58:38Z","snapshot_observed_at":"2026-08-04T18:37:12.098336Z","submitted_at":"2025-04-04T17:41:58Z","title":"Nemotron-H: A Family of Accurate and Efficient Hybrid Mamba-Transformer Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03624","snapshot_observed_at":"2026-08-02T06:45:15.647299Z","title":"Nemotron-h: A family of accurate and efficient hybrid mamba- transformer models.arXiv preprint arXiv:2504.03624, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:15.647299Z"},"links":{"cited_paper":"/paper/2504.03624","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:529bb4f36dc2142a3edb5f303a9de55bfef35036e350f4c62acabc98f50af919","observation_id":"b852a0db-a10b-4374-b161-84fe4122c301","resolution":{"observed_at":"2026-08-02T06:45:15.647299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:15.766177Z","title":"Scaling laws and compute-optimal training beyond fixed training durations.Advances in Neural Information Processing Systems, 37:76232–76264, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:15.766177Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:32947cc5842f21c247a3a2f39be9b241c24c98f52d054c03dde9b26312d358d6","observation_id":"6afbda3e-b356-4586-b040-b4bc1235ad81","resolution":{"observed_at":"2026-08-02T06:45:15.766177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:15.860483Z","title":"AdamW Weight RMS.https: // kexue","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:15.860483Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:b85bb9efd20a0108ff0cf5505671a9677001573380fc82fc52d0008bef11f8d0","observation_id":"e8a9c316-bb80-4cc9-8888-88f47dfbb6ec","resolution":{"observed_at":"2026-08-02T06:45:15.860483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:15.968785Z","title":"Stochastic hessian fittings with lie groups.arXiv preprint arXiv:2402.11858, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:15.968785Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:15d196a3d1d502ee374f5b60c41354812eccb08bb2ac37ecf83cf615fecb56f2","observation_id":"2d5699f8-5d94-44e8-91a1-0395eb3fe87f","resolution":{"observed_at":"2026-08-02T06:45:15.968785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17212","last_updated":"2024-06-03T15:57:47Z","snapshot_observed_at":"2026-07-06T15:34:09.163519Z","submitted_at":"2023-05-26T19:14:01Z","title":"Rotational Equilibrium: How Weight Decay Balances Learning Across Neural Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17212","snapshot_observed_at":"2026-08-02T06:45:16.141224Z","title":"Rotational equilibrium: How weight decay balances learning across neural networks.arXiv preprint arXiv:2305.17212, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:16.141224Z"},"links":{"cited_paper":"/paper/2305.17212","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:6b38c59e15aacdc20988a3020a65e87dcbe2dd0be401f9557b8a366f529daaca","observation_id":"878d8978-c3a8-4f8b-9b0a-410cf6543df5","resolution":{"observed_at":"2026-08-02T06:45:16.141224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:16.231667Z","title":"On the importance of initialization and momentum in deep learning","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:16.231667Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:1c3a003151e240f56d2160e1eaa40685711ec5286d50be2b486fc628a3c02bb0","observation_id":"9a1e34b9-f4ff-46f4-ae65-0ee446bb34cf","resolution":{"observed_at":"2026-08-02T06:45:16.231667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:16.328886Z","title":"Incorporating nesterov momentum into adam","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:16.328886Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:a8798139fd53972d2759aeaf64a959cf23821a1c39ad3d5964ed60a2317e6e61","observation_id":"091b542e-1483-4e6a-8cf8-956074cec15d","resolution":{"observed_at":"2026-08-02T06:45:16.328886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06162","last_updated":"2018-12-14T20:49:09Z","snapshot_observed_at":"2026-07-06T07:21:19.842962Z","submitted_at":"2018-12-14T20:49:09Z","title":"An Empirical Model of Large-Batch Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.06162","snapshot_observed_at":"2026-08-02T06:45:16.428609Z","title":"An empirical model of large-batch training.arXiv preprint arXiv:1812.06162, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:16.428609Z"},"links":{"cited_paper":"/paper/1812.06162","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:ae7b2d372631a0dba53b7be076450ea60b8d62b118f49661ff6fd7786de6a95e","observation_id":"03a165c4-03da-46cf-bcfc-fbc1d85880fa","resolution":{"observed_at":"2026-08-02T06:45:16.428609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-02T06:45:16.519251Z","title":"Minimax-01: Scaling foundation models with lightning attention.arXiv preprint arXiv:2501.08313, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:16.519251Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:a01ef556149550919c8301ce1e3e96cbb83d764038bb09789037d2d5a0bea862","observation_id":"3c457dcc-ced8-4f86-8e6d-43d37c92b5be","resolution":{"observed_at":"2026-08-02T06:45:16.519251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:16.597763Z","title":"Large batch optimization for deep learning: Training bert in 76 minutes","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:16.597763Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:8d27f41172a682efc9fe2557be8215ce3684fa1537f94d80ba804f8ecc108be2","observation_id":"7afbe3e8-33bc-483f-ab41-728fb29e6a88","resolution":{"observed_at":"2026-08-02T06:45:16.597763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:16.690586Z","title":"Train longer, generalize better: closing the generalization gap in large batch training of neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:16.690586Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:2ccf9d1cb6b59b5c943bf59e60ef531d424d6dee62e0fb4e0ef7e3fae9227938","observation_id":"d3a4cf97-6a11-4c93-a5f7-4ba4d6371442","resolution":{"observed_at":"2026-08-02T06:45:16.690586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-02T06:45:16.783035Z","title":"Large batch training of convolutional networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:16.783035Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:899fad370800344421ace6dba01f2f341ce735fe4f4f0da5c16f3c7673165114","observation_id":"f33cc214-6673-4722-a1a7-a122be0ab08c","resolution":{"observed_at":"2026-08-02T06:45:16.783035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1404.5997","last_updated":"2014-04-26T23:10:51Z","snapshot_observed_at":"2026-08-03T21:57:53.090760Z","submitted_at":"2014-04-23T22:37:56Z","title":"One weird trick for parallelizing convolutional neural networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1404.5997","snapshot_observed_at":"2026-08-02T06:45:16.934273Z","title":"One weird trick for parallelizing convolutional neural networks.arXiv preprint arXiv:1404.5997, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:16.934273Z"},"links":{"cited_paper":"/paper/1404.5997","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:976cb31851af2121d5e019eafd3b3f9dea4d0f572ac47182eb33117a0db865f4","observation_id":"ba1434f9-71b8-4ebd-93fc-f5b258b7ca97","resolution":{"observed_at":"2026-08-02T06:45:16.934273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:17.032023Z","title":"Better & faster large language models via multi-token prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:17.032023Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:009e0481e5c7b838cec007ffec9e7850cf3eb50a1f318a043ddb1b4ec2357dad","observation_id":"b94154f1-d860-4bd8-a50c-b1197948a0dd","resolution":{"observed_at":"2026-08-02T06:45:17.032023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-02T06:45:17.122273Z","title":"Transformers are ssms: Generalized models and efficient algorithms through structured state space duality.arXiv preprint arXiv:2405.21060, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:17.122273Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:55ad4cb714714b2774c0b0cf792bcab344352480cfac2ccec18a768ec4c47507","observation_id":"9ca1e866-9879-44e1-8c69-1d70f4252a2c","resolution":{"observed_at":"2026-08-02T06:45:17.122273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05872","last_updated":"2024-07-16T17:40:09Z","snapshot_observed_at":"2026-07-06T18:42:56.281402Z","submitted_at":"2024-07-08T12:32:51Z","title":"Scaling Exponents Across Parameterizations and Optimizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05872","snapshot_observed_at":"2026-08-02T06:45:17.238514Z","title":"Scaling exponents across parameterizations and optimizers.arXiv preprint arXiv:2407.05872, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:17.238514Z"},"links":{"cited_paper":"/paper/2407.05872","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:a3bd38f942539c28a6e76f23d019bd728c51f06c0300df4db695abc97f78cc1b","observation_id":"0ca474ff-08db-4668-8d38-4b65e51d4f23","resolution":{"observed_at":"2026-08-02T06:45:17.238514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14322","last_updated":"2023-10-16T18:43:25Z","snapshot_observed_at":"2026-07-06T16:23:26.584450Z","submitted_at":"2023-09-25T17:48:51Z","title":"Small-scale proxies for large-scale Transformer training instabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14322","snapshot_observed_at":"2026-08-02T06:45:17.325825Z","title":"Small-scale proxies for large-scale transformer training instabilities.arXiv preprint arXiv:2309.14322, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:17.325825Z"},"links":{"cited_paper":"/paper/2309.14322","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:77d33c377157a26d4327b40e7d2c54ce1834d53847406ea19b5e51c396914a17","observation_id":"7736d6ae-3bda-448a-8cda-86d9d4c88fce","resolution":{"observed_at":"2026-08-02T06:45:17.325825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01814","last_updated":"2023-08-07T04:47:32Z","snapshot_observed_at":"2026-07-06T16:02:10.990236Z","submitted_at":"2023-08-03T15:22:51Z","title":"Tensor Programs IVb: Adaptive Optimization in the Infinite-Width Limit","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01814","snapshot_observed_at":"2026-08-02T06:45:17.441355Z","title":"Tensor programs ivb: Adaptive optimization in the infinite-width limit.arXiv preprint arXiv:2308.01814, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:17.441355Z"},"links":{"cited_paper":"/paper/2308.01814","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:638eb6ebb561ddc61256f6ca30a1e8ad18e30d029fe168fb621f1e11016ebb26","observation_id":"cb5521bc-be78-4a00-bd29-7497c9c6c2de","resolution":{"observed_at":"2026-08-02T06:45:17.441355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:17.502177Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:17.502177Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:d32f9a6fdf80060c6b09f2e324d5c2b0d88e67ab21f2eef5715badeccc2ad960","observation_id":"a0cd8fc0-c97a-492d-b98b-10299d4474ff","resolution":{"observed_at":"2026-08-02T06:45:17.502177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-02T06:45:17.620629Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism.arXiv preprint arXiv:1909.08053, 2019","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:17.620629Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:0412f0a8fc5a1a461cf41bfdbd69c33b012b2f6d296b55cca378993bf960e2f4","observation_id":"f0f33c12-0406-4afd-9e1d-95246b8dcd82","resolution":{"observed_at":"2026-08-02T06:45:17.620629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12429","last_updated":"2026-07-15T18:40:30Z","snapshot_observed_at":"2026-08-04T03:38:48.910746Z","submitted_at":"2026-02-12T21:33:14Z","title":"Stabilizing Native Low-Rank LLM Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12429","snapshot_observed_at":"2026-08-02T06:45:17.674394Z","title":"Stabilizing native low-rank llm pretrain- ing.arXiv preprint arXiv:2602.12429, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:17.674394Z"},"links":{"cited_paper":"/paper/2602.12429","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:89d292c1386ee5a7c51a2ccfa372eafbee0ca85101bd040a3f10ada4d6a615dc","observation_id":"a247749e-4341-4344-9723-5365be0dad2a","resolution":{"observed_at":"2026-08-02T06:45:17.674394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-02T06:45:17.759660Z","title":"Deepseek llm: Scaling open-source language models with longtermism.arXiv preprint arXiv:2401.02954, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:17.759660Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:66a029eab0048ac4700acf4732bf039401ca187ad730cd3500fc9a0f01f7b234","observation_id":"82daf934-0776-4118-a6b7-f616e56bda32","resolution":{"observed_at":"2026-08-02T06:45:17.759660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04715","last_updated":"2025-08-19T09:45:25Z","snapshot_observed_at":"2026-07-06T20:48:05.131265Z","submitted_at":"2025-03-06T18:58:29Z","title":"Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04715","snapshot_observed_at":"2026-08-02T06:45:17.820219Z","title":"Predictable scale: Part i, step law– optimal hyperparameter scaling law in large language model pretraining.arXiv preprint arXiv:2503.04715, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:17.820219Z"},"links":{"cited_paper":"/paper/2503.04715","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:5d5c45426afe41e732549ed4519e244d927e41339fd8e55f7154eb6d6f126d0d","observation_id":"92ff9c0d-a7ff-4c5c-9f4c-26e6bab97084","resolution":{"observed_at":"2026-08-02T06:45:17.820219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:17.872461Z","title":"On the role of batch size in stochastic conditional gradient methods.arXiv preprint arXiv:2603.21191, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:17.872461Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:e7f7f5c7efde5c6545dab4ea1f4578ef73d890de813f92635f2d8d5322132f9f","observation_id":"30005dc9-09e8-4498-b90e-1a5701d11666","resolution":{"observed_at":"2026-08-02T06:45:17.872461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.04058","last_updated":"2026-06-05T12:50:11Z","snapshot_observed_at":"2026-08-05T17:25:00.210597Z","submitted_at":"2026-06-02T11:31:21Z","title":"Spectral Scaling Laws of Muon","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.04058","snapshot_observed_at":"2026-08-02T06:45:17.932930Z","title":"Spectral scaling laws of muon.arXiv preprint arXiv:2606.04058, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:17.932930Z"},"links":{"cited_paper":"/paper/2606.04058","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:18f674f1d662212b012548694bc92b9ae9e7d49676e6ae878b5fed620c366ef4","observation_id":"806beb69-1116-4fc1-936b-d60b22816623","resolution":{"observed_at":"2026-08-02T06:45:17.932930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:18.077028Z","title":"Dissecting adam: The sign, magnitude and variance of stochastic gradients","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:18.077028Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:302c1a31325c7616e360e2d0ee6222eff37ee75ab6b1bf31cf514f4f1cc56ba7","observation_id":"de41cb6e-f64a-4414-beba-cdea8e55294d","resolution":{"observed_at":"2026-08-02T06:45:18.077028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17748","last_updated":"2024-06-25T17:34:51Z","snapshot_observed_at":"2026-08-04T06:25:41.174652Z","submitted_at":"2024-06-25T17:34:51Z","title":"A New Perspective on Shampoo's Preconditioner","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17748","snapshot_observed_at":"2026-08-02T06:45:18.187657Z","title":"A new perspective on shampoo’s preconditioner.arXiv preprint arXiv:2406.17748, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:18.187657Z"},"links":{"cited_paper":"/paper/2406.17748","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:b63bcb0cce8fb2064538ad5d88dea76f2beb3e50eefcfef77c516d6ac308da4b","observation_id":"e96956c5-1e58-4b1b-9a58-788abb95e819","resolution":{"observed_at":"2026-08-02T06:45:18.187657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08027","last_updated":"2025-08-18T19:51:06Z","snapshot_observed_at":"2026-07-06T21:39:13.304260Z","submitted_at":"2025-05-30T21:08:15Z","title":"Recipes for Pre-training LLMs with MXFP8","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08027","snapshot_observed_at":"2026-08-02T06:45:18.277482Z","title":"Recipes for pre-training llms with mxfp8.arXiv preprint arXiv:2506.08027, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:18.277482Z"},"links":{"cited_paper":"/paper/2506.08027","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:5f588384f609810757ce1fa0fc32b125f3c5ac77de71380a91d7bcf866ad3c10","observation_id":"cc3f4a9d-f5f0-4d3c-9c6d-a1906fda7d6a","resolution":{"observed_at":"2026-08-02T06:45:18.277482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:45:18.400599Z","title":"Symbolic discovery of optimization algorithms.Advances in neural information processing systems, 36:49205–49233, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:18.400599Z"},"links":{"citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:ed65bbccd7391cc83ac2123afc47472100fc3d2ff2fb0c703e5c65e5bd7a0fa5","observation_id":"a77b5641-96a2-4418-9b83-a5f60b0352f6","resolution":{"observed_at":"2026-08-02T06:45:18.400599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":74,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 2 inbound Pith citation observations for arXiv:2607.20548."}