{"as_of":"2026-08-08T22:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c565d08a9324e126898ae0a591fad895929b995283e906acfa8e89249a2c1501","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:37:23.819526Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:35:40.221296Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T05:52:21.848754Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06742","snapshot_observed_at":"2026-08-06T18:35:40.221296Z","title":"Gradient multi-normalization for stateless and scalable llm training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.221296Z"},"links":{"cited_paper":"/paper/2502.06742","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:d13b1f2a22bb42b1f647274676132d2963d49de8be7110f7875c9d7ae142408a","observation_id":"b23d3601-7f59-4904-8d2e-0039c1fa3197","resolution":{"observed_at":"2026-08-06T18:35:40.221296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"cited_work":{"arxiv_id":"2502.06742","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06742","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gradient multi-normalization for stateless and scalable LLM training.arXiv preprint arXiv:2502.06742","venue":null,"work_id":"09b4549a-f5c8-443c-9f1e-8b81edc247fa","year":2025},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/2502.06742","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:e489a787de5f90960f616933291128cd56894d7c6366eb2254a69891cde8b47a","observation_id":"903bcba7-1617-42cb-b2b1-21f27dad111d","resolution":{"observed_at":"2026-05-11T17:16:08.860137Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"cited_work":{"arxiv_id":"2502.06742","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06742","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gradient multi-normalization for stateless and scalable LLM training.arXiv preprint arXiv:2502.06742","venue":null,"work_id":"09b4549a-f5c8-443c-9f1e-8b81edc247fa","year":2025},"citing_paper":{"arxiv_id":"2605.11172","last_updated":"2026-05-11T19:30:47Z","snapshot_observed_at":"2026-07-06T23:23:02.025664Z","submitted_at":"2026-05-11T19:30:47Z","title":"Optimistic Dual Averaging Unifies Modern Optimizers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T05:52:16.805180Z"},"links":{"cited_paper":"/paper/2502.06742","citing_paper":"/paper/2605.11172"},"observation_digest":"sha256:92daf7864cad59342fe7de97be6fc77b529b95ccd0f26653d96d458f124345ee","observation_id":"e25f7357-df6e-4089-bfd0-46d14d6b6413","resolution":{"observed_at":"2026-05-13T05:52:21.850767Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06742/citation-record","integrity":"/paper/2502.06742/integrity","json":"/paper/2502.06742/citation-record.json","paper":"/paper/2502.06742"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-08T14:37:23.413471Z","title":"R., and Hinton, G","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.413471Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:8d98ff0814c3fed3ac6859d71fc54d7a469e38967c69e860b4c39e24cf73945b","observation_id":"b08ad4a5-16fe-4a52-8ad6-c06e6506952c","resolution":{"observed_at":"2026-08-08T14:37:23.413471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.902675Z","title":"Iterative bregman projections for regularized transportation problems","venue":null,"work_id":"4ebc2f72-b052-4542-aa5f-dd327b3a0b16","year":2015},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.451252Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:1ab4ac3ec7dd4b7969be50a34a6308b65dc4b36f7888b4971fe3f1ac4ea72163","observation_id":"f122e6d1-83f1-4c54-b2a7-b5a8d3177886","resolution":{"observed_at":"2026-08-08T14:37:24.906346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20325","last_updated":"2024-12-06T14:09:22Z","snapshot_observed_at":"2026-08-03T03:18:47.425243Z","submitted_at":"2024-09-30T14:26:12Z","title":"Old Optimizer, New Norm: An Anthology","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20325","snapshot_observed_at":"2026-08-08T14:37:23.455661Z","title":"and Newhouse, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.455661Z"},"links":{"cited_paper":"/paper/2409.20325","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:808993fb9e8360561cfeef5f8af1443144a9e056362e388c70091c0e61b84c26","observation_id":"4b0d4c41-37f0-483c-943c-122dde9a1987","resolution":{"observed_at":"2026-08-08T14:37:23.455661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:23.459883Z","title":"signsgd: Compressed optimisation for non-convex problems","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.459883Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:6ad18ff0605dccbf17cbca1ea85fbca4745e4f6b4cc14c026760b1e8820fdbe0","observation_id":"4a520790-e2ea-4bb8-8431-e9247760aaaa","resolution":{"observed_at":"2026-08-08T14:37:23.459883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.884200Z","title":"Proximal alternating linearized minimization for nonconvex and nonsmooth problems","venue":null,"work_id":"571305e0-817c-4c58-9e72-b4013ef8cace","year":2014},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.463975Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:052c64e009383ca4626f49e0cb0e837563c162dd413b278c3c6d2ea671ab49fe","observation_id":"2c1c0c26-fcb7-4c9e-abc0-a04d482caf08","resolution":{"observed_at":"2026-08-08T14:37:24.888347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.872646Z","title":"Distributed optimization and statistical learning via the alternating direction method of multipliers","venue":null,"work_id":"4ddd4deb-f9a2-4e69-b1b5-8fcafbb857c6","year":2011},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.468048Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:5809ebce7a0b332181a0502d1d91e7165f508370d475a565343dba6b2c764d96","observation_id":"8c2f0518-867a-4c4a-9849-f4602c19c6fa","resolution":{"observed_at":"2026-08-08T14:37:24.876277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.861887Z","title":"Stochastic spectral descent for restricted boltzmann machines","venue":null,"work_id":"94068938-05a2-4301-9bc1-0038eef9347e","year":2015},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.472410Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:aef6dd01294b4725079629258898b1a0fde1ed69980cd5787ae618ba1103fffb","observation_id":"6cf160a8-e1af-4778-b2c9-83d0377eb545","resolution":{"observed_at":"2026-08-08T14:37:24.865195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.850752Z","title":"and Pock, T","venue":null,"work_id":"ea4ff029-5d64-41d2-a0f8-42c0855649e2","year":2011},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.475776Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:63f6a1453fbd3e0ff45495cbaf4e3e0b3b382bbf560e07b4485f347f19b34958","observation_id":"bbf7d13b-7496-4394-bab7-87a183480732","resolution":{"observed_at":"2026-08-08T14:37:24.854101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:23.482602Z","title":"Fira: Can we achieve full-rank training of llms under low-rank constraint?, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.482602Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:22339719e01b4d28407042c50b8be9ae5916a88fa6c9fc7865f617440202094b","observation_id":"4299bd35-014a-4e46-b469-d40de0536ef7","resolution":{"observed_at":"2026-08-08T14:37:23.482602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.840029Z","title":"Symbolic discovery of optimization algorithms","venue":null,"work_id":"71137320-3bbf-469c-9c9e-da8322e3f40f","year":2024},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.486131Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:e90c2616fedae12d1906ba3c653fa63a793ef1211fb736fa88ba92ec61673a38","observation_id":"daea1544-84d4-4f64-b7fd-68adce40a54d","resolution":{"observed_at":"2026-08-08T14:37:24.843957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.828969Z","title":"and Mehta, H","venue":null,"work_id":"a7b7b295-6eeb-4786-807b-9c47b3e90ba6","year":2020},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.489575Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:b980ea372423945d2cd3f0546b4f1311251bd104b7737fd3faf6e5ad3518ee63","observation_id":"f3125a71-49a0-4a47-af5e-3d31edbf12e4","resolution":{"observed_at":"2026-08-08T14:37:24.832640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.817550Z","title":"On hilbert’s metric for simplices","venue":null,"work_id":"c8bc9910-11d2-4258-90cd-57d991e86f01","year":1993},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.492994Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:f28014c698356656e6b2125cccce8e7b6f5f6d5714b375897fb239fef168a190","observation_id":"bed42d3e-476b-4ee1-bf47-18a02c229b59","resolution":{"observed_at":"2026-08-08T14:37:24.821392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T14:37:23.496672Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.496672Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:7f1680b310e8ff5497a4bd19e8aa6b547f1203074e1c38a170703918b1eede9f","observation_id":"7bf6bb02-4816-494e-a22a-7d422156ceb6","resolution":{"observed_at":"2026-08-08T14:37:23.496672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.806556Z","title":null,"venue":null,"work_id":"1d184ca5-a27f-4ed9-a8fb-6516a0a5270d","year":1983},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.500426Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:6c5750a7ab1e728ea2e855710af395160a81d51d1fd56edd62442dd5c541e492","observation_id":"5a1036d1-bd39-485a-bbb4-42a88518df53","resolution":{"observed_at":"2026-08-08T14:37:24.810400Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.795649Z","title":"and Lorenz, J","venue":null,"work_id":"d901b2bf-a8d8-4b40-9476-18e1c0bb5c7b","year":1989},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.504111Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:09569b754779992a756da1a5eb664186465a706531141b0b1d2a2f07b952b446","observation_id":"807a43a5-376f-44f6-a5ff-ff3e66350ff1","resolution":{"observed_at":"2026-08-08T14:37:24.799506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.771748Z","title":"Eigenvalue-corrected natural gradient based on a new approximation","venue":null,"work_id":"8323f584-f478-45da-a1b6-47ec54a9e8e1","year":2023},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.507644Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:347570300ebaed5f98b741aac6bf252ad4ff9227ab655e2525754124a8e33add","observation_id":"0a3d308f-309a-4bda-8ce9-3dee363a3b86","resolution":{"observed_at":"2026-08-08T14:37:24.787737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.09568","last_updated":"2018-03-02T00:12:58Z","snapshot_observed_at":"2026-08-08T05:45:32.956312Z","submitted_at":"2018-02-26T19:36:41Z","title":"Shampoo: Preconditioned Stochastic Tensor Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.09568","snapshot_observed_at":"2026-08-08T14:37:23.510817Z","title":"Shampoo: Preconditioned stochastic tensor optimization, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.510817Z"},"links":{"cited_paper":"/paper/1802.09568","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:638dd3c58f2dc0c4c09297a78f6d6431e0dc84817efaa8961645614f563480e9","observation_id":"f3a89ebb-4335-405f-ac92-2ae195999eb1","resolution":{"observed_at":"2026-08-08T14:37:23.510817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03293","last_updated":"2024-06-12T22:17:37Z","snapshot_observed_at":"2026-08-05T09:55:40.815776Z","submitted_at":"2024-02-05T18:50:39Z","title":"Flora: Low-Rank Adapters Are Secretly Gradient Compressors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03293","snapshot_observed_at":"2026-08-08T14:37:23.514931Z","title":"Flora: Low-rank adapters are secretly gradient compressors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.514931Z"},"links":{"cited_paper":"/paper/2402.03293","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:0f4a6bbee3367b88250840d4d83fdaf57e2504307fc9b707fedda6a97ff05d44","observation_id":"bbb83fe5-3150-4ccf-81ac-2e61517b0bdc","resolution":{"observed_at":"2026-08-08T14:37:23.514931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:23.518833Z","title":"Beyond convexity: Stochastic quasi-convex optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.518833Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:be74c56819ca72ec9d10ee0c5f71b01ba4525f7d9b4f44369f7e959efc88530b","observation_id":"6d529124-8416-4357-8a69-f4d6d4058af4","resolution":{"observed_at":"2026-08-08T14:37:23.518833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-08T14:37:23.522219Z","title":"J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.522219Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:d4f1b3fddc09f497a395f24efa4c111f3a0215d7bb01263e6bad59f2fced3e24","observation_id":"820b1f11-b874-4e60-a1fb-a7959e808908","resolution":{"observed_at":"2026-08-08T14:37:23.522219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.710538Z","title":"Iterative normalization: Beyond standardization towards efficient whitening","venue":null,"work_id":"1c10ed95-ebf9-48e6-a4e3-b1ab8467bd64","year":2019},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.525891Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:7e1c0027bd41817e0c4261db048b5e2573df51997cbd6438714a51a46c847b71","observation_id":"f6927afa-6bcc-4b13-ba94-53b1afe52fe4","resolution":{"observed_at":"2026-08-08T14:37:24.735222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.655644Z","title":"Muon: An optimizer for hidden layers in neural networks, 2024","venue":null,"work_id":"e8f4e8f0-901c-4ff9-bcff-fe723376661e","year":2024},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.529508Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:39df40cb5be02589bd9d9d7ad562aaa402bdacf0b855c2c641bc6a698f70c10e","observation_id":"b3245607-4341-4ef3-8480-8707711b816a","resolution":{"observed_at":"2026-08-08T14:37:24.681640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.595432Z","title":null,"venue":null,"work_id":"fe479fd4-519d-42ee-895d-6213671edbff","year":2015},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.532971Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:441e28eb872e5d47c1b37a48258193b4cc4e8c7c9972f9bb15482a089716db53","observation_id":"add29701-088d-434a-b17a-76bad058594f","resolution":{"observed_at":"2026-08-08T14:37:24.623494Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:23.536830Z","title":"A., Casper, J., Lym, S., McAfee, L., Andersch, M., Shoeybi, M., and Catanzaro, B","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.536830Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:2d208cb77f999865541fe6098a34cc25f429dd09097feb80f8b03cdcec6c67e5","observation_id":"6080fe88-34be-44b1-8865-08a9657870ae","resolution":{"observed_at":"2026-08-08T14:37:23.536830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13960","last_updated":"2023-04-27T05:41:13Z","snapshot_observed_at":"2026-08-02T07:55:35.655526Z","submitted_at":"2023-04-27T05:41:13Z","title":"Noise Is Not the Main Factor Behind the Gap Between SGD and Adam on Transformers, but Sign Descent Might Be","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13960","snapshot_observed_at":"2026-08-08T14:37:23.540265Z","title":"W., and Schmidt, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.540265Z"},"links":{"cited_paper":"/paper/2304.13960","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:c814c66546fd64334e5893339b9f0751785258c538592b10e37dc466a6423a02","observation_id":"f8d51ea9-6283-4132-a32b-95ef53b7d28e","resolution":{"observed_at":"2026-08-08T14:37:23.540265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19449","last_updated":"2024-07-12T05:10:32Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:47:52Z","title":"Heavy-Tailed Class Imbalance and Why Adam Outperforms Gradient Descent on Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19449","snapshot_observed_at":"2026-08-08T14:37:23.544235Z","title":"Heavy-tailed class imbalance and why adam outperforms gradient descent on language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.544235Z"},"links":{"cited_paper":"/paper/2402.19449","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:e77c212aa2f046389b1e9a60673988dd13332fb468de4ca9fa26e688bb9b7607","observation_id":"34a40cd0-c212-4fd7-ab57-f29d81426256","resolution":{"observed_at":"2026-08-08T14:37:23.544235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.547226Z","title":null,"venue":null,"work_id":"f56946c9-c203-44c6-a9fc-702f227657c9","year":2008},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.561000Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:7de85a3adda3a003f2962551f921ea5b5c7429fc808c3d5034f6eaedb90eb669","observation_id":"56561ed3-f3da-4622-bb5c-cde77f1bfe3b","resolution":{"observed_at":"2026-08-08T14:37:24.558644Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.536145Z","title":"Towards faster training of global covariance pooling networks by iterative matrix square root normalization","venue":null,"work_id":"fa187ece-2266-42d6-a513-2a6fe900ac39","year":2018},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.586474Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:32666b23f0c23241f423520c32d48d8fcdf22270f5bdeb20697b7fff8ab3754d","observation_id":"02956aa1-6bba-4a64-b1e0-378a505245c6","resolution":{"observed_at":"2026-08-08T14:37:24.540119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.525620Z","title":"Relora: High-rank training through low-rank updates","venue":null,"work_id":"572bd047-46be-4866-89f3-4ee345a6924e","year":2023},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.613591Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:3ed1f969165e41bd809333aa3bbcc9088d2b125b36048e6ae7270de1eb63ffd2","observation_id":"91f59945-4410-454e-9dd0-6fce281b283b","resolution":{"observed_at":"2026-08-08T14:37:24.529355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-07-06T20:08:43.596697Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13148","snapshot_observed_at":"2026-08-08T14:37:23.643471Z","title":"Swan: Sgd with normalization and whitening enables stateless llm training, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.643471Z"},"links":{"cited_paper":"/paper/2412.13148","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:8a092370ef889930ab209e23ec631e360f5d45d885c29dc5d309584bb4116bea","observation_id":"5897e39f-a8d8-44e2-863d-cbf31763c4dc","resolution":{"observed_at":"2026-08-08T14:37:23.643471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.515166Z","title":"Decomposition through formalization in a product space","venue":null,"work_id":"90f61d14-f345-45b2-8e99-dd64c7b4cd18","year":1984},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.669813Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:05b63fae2d9e0ded9f34f0edb0a2c62fafe250000c84b3a1df2012f224929b43","observation_id":"226a59d9-2e4a-4ced-a9f0-f4b43badc942","resolution":{"observed_at":"2026-08-08T14:37:24.518803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.504811Z","title":null,"venue":null,"work_id":"a3035ab1-b9ec-45d5-85d5-425188e0566b","year":2020},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.685068Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:7b84ec24f2ae5e9a35d3ee83c2dbe5e24275393914f5489334a25622c4dfa063","observation_id":"c6aa30c5-ec4d-443b-9791-a2c525b24b47","resolution":{"observed_at":"2026-08-08T14:37:24.508248Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:23.713139Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.713139Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:85df0c0fce5db0d1240d7c4f5319a73725c972cd697dc9b0a468c3a8bb4dc84c","observation_id":"39ffadbf-194d-4c97-8e4e-3b406d8b9716","resolution":{"observed_at":"2026-08-08T14:37:23.713139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.487380Z","title":null,"venue":null,"work_id":"38e4e695-58de-45ad-8255-d59dce70b3f9","year":1974},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.744517Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:efff36d76adc75c0c42c878ec3a6e1e424dfe3866c703b3bdc0826475819f020","observation_id":"945ca777-367e-43f9-8627-88b80a777228","resolution":{"observed_at":"2026-08-08T14:37:24.492141Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:23.757416Z","title":"A relationship between arbitrary positive matrices and doubly stochastic matrices","venue":null,"work_id":null,"year":1964},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.757416Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:5c0b1132daa291e5e1731945c75c97822d1a35586c6321b302c76efc1b57db55","observation_id":"5dd8a654-35d7-4b34-9180-f3bfd7b25fe4","resolution":{"observed_at":"2026-08-08T14:37:23.757416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:23.761340Z","title":"and Knopp, P","venue":null,"work_id":null,"year":1967},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.761340Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:361488bbe0d26cdb08c015d893d20a46bbe12933d4635f3e76ea54a263ae8d6e","observation_id":"8bbad764-6fb7-4ec2-8bdd-239f32ec1b26","resolution":{"observed_at":"2026-08-08T14:37:23.761340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.463787Z","title":"Fast differentiable matrix square root and inverse square root","venue":null,"work_id":"f21ceee7-51ec-4904-91c9-30b77c1354b2","year":2022},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.765130Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:9a73a7fb94f26e83b04a1e64099664c88421058d5999785786dd1e2c9446bab5","observation_id":"b6e29277-8a95-484d-b646-8346a7ffa4bf","resolution":{"observed_at":"2026-08-08T14:37:24.467626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.453317Z","title":null,"venue":null,"work_id":"45c92aaa-f60d-4471-b315-690b9fd0ad97","year":2017},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.768652Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:1255154cfa1aa4198172693e61488552367f495ac2fc19c93e717db73ecb6523","observation_id":"1907b5da-4d76-4ef1-87d2-df117dc1f8e6","resolution":{"observed_at":"2026-08-08T14:37:24.456973Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-08T14:37:23.772296Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.772296Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:eadec856f4515858f1e8ba44818ef8d90ab00862fe93109e335679d000f868da","observation_id":"5217120b-dfbe-4c6c-bb3c-8a46fd1c51cd","resolution":{"observed_at":"2026-08-08T14:37:23.772296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.441708Z","title":"Functional operators: Measures and integrals, volume 1","venue":null,"work_id":"6f87592c-bbbc-4050-9d70-57cd644dd82a","year":1950},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.776322Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:d07a8ab6aa5ac939ac1857f98a2c0f8727a11abac18ebb1be0298b71480bcc96","observation_id":"555089af-2e8b-4842-91c8-0301ec813625","resolution":{"observed_at":"2026-08-08T14:37:24.446304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.431019Z","title":null,"venue":null,"work_id":"8476c8df-11c2-4dd8-90a4-1ec9cead4549","year":1992},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.779538Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:9484cd2bb2b3825b9c6093c9855f644815a47daf0f98c6d6b3074df573e01f63","observation_id":"0943772a-8700-42f1-93ce-bd84ff49c3bc","resolution":{"observed_at":"2026-08-08T14:37:24.434492Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11768","last_updated":"2024-12-17T09:30:44Z","snapshot_observed_at":"2026-07-06T20:07:45.865569Z","submitted_at":"2024-12-16T13:41:37Z","title":"No More Adam: Learning Rate Scaling at Initialization is All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11768","snapshot_observed_at":"2026-08-08T14:37:23.786570Z","title":"No more adam: Learning rate scaling at initialization is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.786570Z"},"links":{"cited_paper":"/paper/2412.11768","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:e25239ee24db6e8ae9e0b02c3e90b2dad9dcf71d973e346393735b39a979584e","observation_id":"f4028448-fec2-4f51-9294-9d575a3c015a","resolution":{"observed_at":"2026-08-08T14:37:23.786570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-08T14:37:23.789854Z","title":"Large batch training of convolutional networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.789854Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:559c29929f18e32f877b9dcfb53165513173ab843ae7547ea7d95fe4277562a5","observation_id":"c3dcb6c0-fd3a-4990-ae1b-f914be422b5b","resolution":{"observed_at":"2026-08-08T14:37:23.789854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.00962","last_updated":"2020-01-03T06:53:00Z","snapshot_observed_at":"2026-07-06T07:43:06.427641Z","submitted_at":"2019-04-01T16:53:35Z","title":"Large Batch Optimization for Deep Learning: Training BERT in 76 minutes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.00962","snapshot_observed_at":"2026-08-08T14:37:23.793583Z","title":"Large batch optimization for deep learning: Training bert in 76 minutes","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.793583Z"},"links":{"cited_paper":"/paper/1904.00962","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:0c8181368e13a7ce23d86d66b7381f1f78d9a49eeeb57756a7dd77a7f717964b","observation_id":"e8841d1e-9bc4-4414-bfe0-5f8a69154ff8","resolution":{"observed_at":"2026-08-08T14:37:23.793583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:23.797421Z","title":"and Sennrich, R","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.797421Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:37ee239ec4a2547f2aba31dadf32f76b3c61596b0027daf126dd5507fa197f7c","observation_id":"8a9cfafa-3b90-4834-9d6b-fdada3dad04f","resolution":{"observed_at":"2026-08-08T14:37:23.797421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:24.412569Z","title":"P., Veit, A., Kim, S., Reddi, S., Kumar, S., and Sra, S","venue":null,"work_id":"3e3f5d3b-630d-4084-8dc6-3eafdca47bd5","year":2020},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.801164Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:2c9d5ddd19d29d05e6e2f4d5bb3d74696254925eb34aab553160b83ddb929d12","observation_id":"47a10613-9aab-45f7-a17a-6476b27fdf96","resolution":{"observed_at":"2026-08-08T14:37:24.417347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16793","last_updated":"2025-02-24T11:29:08Z","snapshot_observed_at":"2026-08-03T23:43:24.359346Z","submitted_at":"2024-06-24T16:56:41Z","title":"Adam-mini: Use Fewer Learning Rates To Gain More","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16793","snapshot_observed_at":"2026-08-08T14:37:23.804426Z","title":"Adam-mini: Use fewer learning rates to gain more","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.804426Z"},"links":{"cited_paper":"/paper/2406.16793","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:e1e6f377c4593d4dc433e418cc0a92adb5251ce989de5308c185074b71535974","observation_id":"6d77efdc-e81c-4111-b116-cb3594c20dbf","resolution":{"observed_at":"2026-08-08T14:37:23.804426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03507","last_updated":"2024-06-02T21:24:12Z","snapshot_observed_at":"2026-07-06T17:40:15.746482Z","submitted_at":"2024-03-06T07:29:57Z","title":"GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03507","snapshot_observed_at":"2026-08-08T14:37:23.808168Z","title":"A., Chen, B., Wang, Z., Anandkumar, A., and Tian, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.808168Z"},"links":{"cited_paper":"/paper/2403.03507","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:3aa49254ebcdbedd075fb5cc444afd31de86d66338ab091e1714a7812ce4b48c","observation_id":"14e30325-302c-4d31-b315-0b89b822b86b","resolution":{"observed_at":"2026-08-08T14:37:23.808168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-07-06T18:44:28.967181Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-08-08T14:37:23.812206Z","title":"Deconstructing what makes a good optimizer for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.812206Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:bc845a75aefec73d587a3001316be85fbd2fcb4a7388c783f9d69c74e2dcecaa","observation_id":"552f658d-4508-401a-9dea-25d0d0515d53","resolution":{"observed_at":"2026-08-08T14:37:23.812206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05270","last_updated":"2025-02-17T08:27:58Z","snapshot_observed_at":"2026-08-06T09:09:00.082930Z","submitted_at":"2024-12-06T18:55:34Z","title":"APOLLO: SGD-like Memory, AdamW-level Performance","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05270","snapshot_observed_at":"2026-08-08T14:37:23.815685Z","title":"Z., Wang, Z., and Lee, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.815685Z"},"links":{"cited_paper":"/paper/2412.05270","citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:caa02f787c23c8a33fb588ea9202830b25dd5ee40516a02b2010377e08a5a351","observation_id":"a6b8083a-4cd7-47bb-ad53-6e19cd7f3df8","resolution":{"observed_at":"2026-08-08T14:37:23.815685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:37:23.819526Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T14:37:23.819526Z"},"links":{"citing_paper":"/paper/2502.06742"},"observation_digest":"sha256:b308c6d21a049ea1e361fd869b6fd6bca60d0ad71115b42cd39931307466410c","observation_id":"69ac2474-aae8-426b-a383-655c9cc14123","resolution":{"observed_at":"2026-08-08T14:37:23.819526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T14:25:35.005087Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 3 inbound Pith citation observations for arXiv:2502.06742."}