{"as_of":"2026-08-09T07:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d61a991c4987d7f80d63e1d35cdb593ca48a9677d87d8b853e426ea64dc7e895","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T11:25:45.073914Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T22:20:05.658343Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T23:47:28.482161Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02981","snapshot_observed_at":"2026-08-03T22:20:05.658343Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.11466","last_updated":"2026-06-22T13:35:19Z","snapshot_observed_at":"2026-08-07T16:29:00.257881Z","submitted_at":"2025-11-14T16:38:15Z","title":"Non-Euclidean SGD for Structured Optimization: Unified Analysis and Improved Rates","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-03T22:20:05.658343Z"},"links":{"cited_paper":"/paper/2509.02981","citing_paper":"/paper/2511.11466"},"observation_digest":"sha256:bd2bb3fcb1b354b0f4a7b52b89b5767295590ed8a47c527831601ac8a760a875","observation_id":"32ae49ab-8f42-473f-9fe0-449c888be26f","resolution":{"observed_at":"2026-08-03T22:20:05.658343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02981","snapshot_observed_at":"2026-08-03T03:56:43.342273Z","title":"Adagrad meets muon: Adaptive stepsizes for orthogonal updates","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:43.342273Z"},"links":{"cited_paper":"/paper/2509.02981","citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:1f496a5c0d426fd1373c3e8659ed74b32e4a626e8a76b1ca4a6d949af80548ce","observation_id":"e544531f-c17e-4347-9f5e-ca0051463067","resolution":{"observed_at":"2026-08-03T03:56:43.342273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"cited_work":{"arxiv_id":"2509.02981","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02981","snapshot_observed_at":"2026-07-02T23:47:28.482161Z","title":"Zhang, Y","venue":null,"work_id":"9995c05a-6c9b-4ecb-bcc4-80d76fb6a360","year":2025},"citing_paper":{"arxiv_id":"2604.04726","last_updated":"2026-04-06T14:47:46Z","snapshot_observed_at":"2026-07-06T22:53:37.357996Z","submitted_at":"2026-04-06T14:47:46Z","title":"A Muon-Accelerated Algorithm for Low Separation Rank Tensor Generalized Linear Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T19:16:35.992399Z"},"links":{"cited_paper":"/paper/2509.02981","citing_paper":"/paper/2604.04726"},"observation_digest":"sha256:cd0c15b2089011f60c10f6c1469279f584c6789f4bb3feb7c0dc62b588c327b2","observation_id":"fd6f0977-1c6f-4093-a8ea-5d90d224067d","resolution":{"observed_at":"2026-05-10T23:15:48.166522Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"cited_work":{"arxiv_id":"2509.02981","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02981","snapshot_observed_at":"2026-07-02T23:47:28.482161Z","title":"Zhang, Y","venue":null,"work_id":"9995c05a-6c9b-4ecb-bcc4-80d76fb6a360","year":2025},"citing_paper":{"arxiv_id":"2604.17423","last_updated":"2026-05-01T14:46:49Z","snapshot_observed_at":"2026-08-02T20:20:49.115675Z","submitted_at":"2026-04-19T13:07:51Z","title":"A unified convergence theory for adaptive first-order methods in the nonconvex case, including AdaNorm, full and diagonal AdaGrad, Shampoo and Muo","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T07:19:59.335184Z"},"links":{"cited_paper":"/paper/2509.02981","citing_paper":"/paper/2604.17423"},"observation_digest":"sha256:feeee9f8b9a3814c35aca67d36cfb7f6bcc66f7836e742c2564b2a005183e623","observation_id":"b0b29b19-5f65-409e-971f-16aa5d966827","resolution":{"observed_at":"2026-05-10T07:26:59.872983Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"cited_work":{"arxiv_id":"2509.02981","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02981","snapshot_observed_at":"2026-07-02T23:47:28.482161Z","title":"Zhang, Y","venue":null,"work_id":"9995c05a-6c9b-4ecb-bcc4-80d76fb6a360","year":2025},"citing_paper":{"arxiv_id":"2605.06615","last_updated":"2026-05-07T17:32:09Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:32:09Z","title":"When and Why SignSGD Outperforms SGD: A Theoretical Study Based on $\\ell_1$-norm Lower Bounds","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-08T12:14:28.866499Z"},"links":{"cited_paper":"/paper/2509.02981","citing_paper":"/paper/2605.06615"},"observation_digest":"sha256:ca860ddb86befd7a3b215e26707af1afd5d449e23c31c2eb93ad8298deeca459","observation_id":"6f50d3b1-3977-4a91-a665-4f8b875caea9","resolution":{"observed_at":"2026-05-11T19:21:07.613631Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"cited_work":{"arxiv_id":"2509.02981","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02981","snapshot_observed_at":"2026-07-02T23:47:28.482161Z","title":"Zhang, Y","venue":null,"work_id":"9995c05a-6c9b-4ecb-bcc4-80d76fb6a360","year":2025},"citing_paper":{"arxiv_id":"2605.11850","last_updated":"2026-05-12T09:36:13Z","snapshot_observed_at":"2026-08-02T13:15:16.257288Z","submitted_at":"2026-05-12T09:36:13Z","title":"Constrained Stochastic Spectral Preconditioning Converges for Nonconvex Objectives","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-13T05:34:48.195468Z"},"links":{"cited_paper":"/paper/2509.02981","citing_paper":"/paper/2605.11850"},"observation_digest":"sha256:4648d5ca4ad281a1e78d2dc550e7a794b092850936d4ab557bfc6a01088c46e3","observation_id":"ed0728bf-7b80-471f-9ac7-d8e870a6c70f","resolution":{"observed_at":"2026-05-13T05:37:19.206102Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"cited_work":{"arxiv_id":"2509.02981","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02981","snapshot_observed_at":"2026-07-02T23:47:28.482161Z","title":"Zhang, Y","venue":null,"work_id":"9995c05a-6c9b-4ecb-bcc4-80d76fb6a360","year":2025},"citing_paper":{"arxiv_id":"2605.18106","last_updated":"2026-06-22T06:06:33Z","snapshot_observed_at":"2026-07-06T23:28:59.503300Z","submitted_at":"2026-05-18T09:17:26Z","title":"Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers","version":1},"reference_index":169,"source":"pdf_text","source_observed_at":"2026-05-20T09:34:45.186929Z"},"links":{"cited_paper":"/paper/2509.02981","citing_paper":"/paper/2605.18106"},"observation_digest":"sha256:21b37ef46e43874f6d9aeceafe352d29cc80de3a9cdfe93f8d9ab9d203ccce73","observation_id":"e98ccdb7-2b2f-4223-8cfa-623898a476a7","resolution":{"observed_at":"2026-05-20T09:38:11.104524Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"cited_work":{"arxiv_id":"2509.02981","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02981","snapshot_observed_at":"2026-07-02T23:47:28.482161Z","title":"Zhang, Y","venue":null,"work_id":"9995c05a-6c9b-4ecb-bcc4-80d76fb6a360","year":2025},"citing_paper":{"arxiv_id":"2605.18106","last_updated":"2026-06-22T06:06:33Z","snapshot_observed_at":"2026-07-06T23:28:59.503300Z","submitted_at":"2026-05-18T09:17:26Z","title":"Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers","version":4},"reference_index":173,"source":"pdf_text","source_observed_at":"2026-06-30T18:42:01.854481Z"},"links":{"cited_paper":"/paper/2509.02981","citing_paper":"/paper/2605.18106"},"observation_digest":"sha256:a36d28a79c9d2312cfd73aa9bc926e680c19c6c9e38c5caae6796a8b92fb1e77","observation_id":"bc1d7d9b-c1e4-4e90-9bef-dd9f040e430a","resolution":{"observed_at":"2026-06-30T18:45:00.286419Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"cited_work":{"arxiv_id":"2509.02981","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02981","snapshot_observed_at":"2026-07-02T23:47:28.482161Z","title":"Zhang, Y","venue":null,"work_id":"9995c05a-6c9b-4ecb-bcc4-80d76fb6a360","year":2025},"citing_paper":{"arxiv_id":"2605.26977","last_updated":"2026-05-26T13:02:49Z","snapshot_observed_at":"2026-08-07T15:06:33.100259Z","submitted_at":"2026-05-26T13:02:49Z","title":"Convergence of Spectral Descent for Non-smooth Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T19:30:04.244636Z"},"links":{"cited_paper":"/paper/2509.02981","citing_paper":"/paper/2605.26977"},"observation_digest":"sha256:21195c239458aa8af3ea943a340738b6fd3683b77acb038afeaf09f0fa71589c","observation_id":"4103e5d2-051a-4811-9fb0-0f87cf3b8bca","resolution":{"observed_at":"2026-06-29T19:33:53.992973Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"cited_work":{"arxiv_id":"2509.02981","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02981","snapshot_observed_at":"2026-07-02T23:47:28.482161Z","title":"Zhang, Y","venue":null,"work_id":"9995c05a-6c9b-4ecb-bcc4-80d76fb6a360","year":2025},"citing_paper":{"arxiv_id":"2606.01787","last_updated":"2026-06-01T07:08:32Z","snapshot_observed_at":"2026-08-02T19:16:44.439836Z","submitted_at":"2026-06-01T07:08:32Z","title":"Stochastic convergence of parallel asynchronous adaptive first-order methods","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T14:27:48.433313Z"},"links":{"cited_paper":"/paper/2509.02981","citing_paper":"/paper/2606.01787"},"observation_digest":"sha256:e1c246234b2e23521cd89a7cd15316da8a9d36a9619f29912e9a85924942e56e","observation_id":"d82ffd97-af17-4e69-94f2-0dc282420f62","resolution":{"observed_at":"2026-07-01T23:16:24.936029Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"cited_work":{"arxiv_id":"2509.02981","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02981","snapshot_observed_at":"2026-07-02T23:47:28.482161Z","title":"Zhang, Y","venue":null,"work_id":"9995c05a-6c9b-4ecb-bcc4-80d76fb6a360","year":2025},"citing_paper":{"arxiv_id":"2606.08783","last_updated":"2026-06-26T09:55:08Z","snapshot_observed_at":"2026-07-06T23:48:11.819398Z","submitted_at":"2026-06-07T18:59:24Z","title":"OptMuon: Closed-Loop Orthogonalized Momentum Methods for Stochastic Optimization with Zero-Noise Optimality","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-27T17:47:21.377462Z"},"links":{"cited_paper":"/paper/2509.02981","citing_paper":"/paper/2606.08783"},"observation_digest":"sha256:fcefa320f71043971386fe7039d81f91c01463090286f5e7d1c093876be61422","observation_id":"dab43c79-82ed-4ba4-9a22-fe0bde0473ab","resolution":{"observed_at":"2026-07-02T23:47:28.483723Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"cited_work":{"arxiv_id":"2509.02981","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02981","snapshot_observed_at":"2026-07-02T23:47:28.482161Z","title":"Zhang, Y","venue":null,"work_id":"9995c05a-6c9b-4ecb-bcc4-80d76fb6a360","year":2025},"citing_paper":{"arxiv_id":"2606.08783","last_updated":"2026-06-26T09:55:08Z","snapshot_observed_at":"2026-07-06T23:48:11.819398Z","submitted_at":"2026-06-07T18:59:24Z","title":"OptMuon: Closed-Loop Orthogonalized Momentum Methods for Stochastic Optimization with Zero-Noise Optimality","version":2},"reference_index":195,"source":"arxiv_source","source_observed_at":"2026-06-29T05:33:27.870787Z"},"links":{"cited_paper":"/paper/2509.02981","citing_paper":"/paper/2606.08783"},"observation_digest":"sha256:abcfd760ee2f464acd5afe84d8cb1edb90a889df49fc68abfe3b8e9ce918d9f5","observation_id":"48e55a4b-3dbd-4517-b1b2-e9c40e0f19ea","resolution":{"observed_at":"2026-06-29T05:43:08.867247Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02981","snapshot_observed_at":"2026-07-11T22:10:49.683444Z","title":"Adagrad meets muon: Adaptive stepsizes for orthogonal updates.arXiv preprint arXiv:2509.02981, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04033","last_updated":"2026-07-04T21:27:05Z","snapshot_observed_at":"2026-08-07T05:07:10.107694Z","submitted_at":"2026-07-04T21:27:05Z","title":"OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers","version":1},"reference_index":133,"source":"pdf_text","source_observed_at":"2026-07-11T22:10:49.683444Z"},"links":{"cited_paper":"/paper/2509.02981","citing_paper":"/paper/2607.04033"},"observation_digest":"sha256:a6c0cd7da449d7df50440257b963fcf303b2b8a8273ed15cad97a51af5e807d0","observation_id":"8f607fc3-1577-41df-8aeb-72df68af1289","resolution":{"observed_at":"2026-07-11T22:10:49.683444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02981","snapshot_observed_at":"2026-08-02T01:58:58.812108Z","title":"Adagrad meets muon: Adaptive stepsizes for orthogonal updates.arXiv preprint arXiv:2509.02981,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14536","last_updated":"2026-07-16T03:42:21Z","snapshot_observed_at":"2026-08-05T09:35:42.737107Z","submitted_at":"2026-07-16T03:42:21Z","title":"Muse: Representation Geometry of Muon Beyond Normalized Momentum","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T01:58:58.812108Z"},"links":{"cited_paper":"/paper/2509.02981","citing_paper":"/paper/2607.14536"},"observation_digest":"sha256:3fad75c0105a90dc56d6d60c62785a1f1c7114261790ea0ba48c261e0938cb54","observation_id":"146bd240-389c-4007-9005-e49d4b5bbaec","resolution":{"observed_at":"2026-08-02T01:58:58.812108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.02981/citation-record","integrity":"/paper/2509.02981/integrity","json":"/paper/2509.02981/citation-record.json","paper":"/paper/2509.02981"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:44.958820Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:44.958820Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:b39f30468847cf483d8dbd234b77695c0e2395558e461743c45a86b1240c80e3","observation_id":"55228883-d60d-4b28-99af-e41cc39ba88f","resolution":{"observed_at":"2026-08-05T11:25:44.958820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.821583Z","title":"Arjevani, Y","venue":null,"work_id":"d8043a93-ba20-48c7-8122-8f063e84c9b5","year":2023},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:44.962363Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:761ba93a3804ae27aeae1c3164586095224b3fb6ee4402ed2b9c30a0bd10dafe","observation_id":"932413bd-43a6-4c71-a84e-1d5998d8bea8","resolution":{"observed_at":"2026-08-05T11:25:45.824727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.811607Z","title":"Bernstein","venue":null,"work_id":"c5debae7-b0ea-4b58-96e0-67984dc68a99","year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:44.965832Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:5c68665c57d6822ad45c70bbaee9c3ab4cc4f9df7466c1c6e0e34e0d33395522","observation_id":"3d4cd85a-8500-4f38-b0b2-98ab8d173e44","resolution":{"observed_at":"2026-08-05T11:25:45.814693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20325","last_updated":"2024-12-06T14:09:22Z","snapshot_observed_at":"2026-08-03T03:18:47.425243Z","submitted_at":"2024-09-30T14:26:12Z","title":"Old Optimizer, New Norm: An Anthology","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20325","snapshot_observed_at":"2026-08-05T11:25:44.969093Z","title":"Bernstein and L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:44.969093Z"},"links":{"cited_paper":"/paper/2409.20325","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:71c9b8c3da8d265020cacec00a42d28ce4b8d10c00b9d1fb7e230f0174d50764","observation_id":"98caf305-b7df-43f8-8a63-f5e5000050ed","resolution":{"observed_at":"2026-08-05T11:25:44.969093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.800657Z","title":null,"venue":null,"work_id":"959a1e2d-f41a-4c8a-9f79-e67be51ea0c4","year":2015},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:44.972625Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:55df48c2cdf65778da566f26a68b38def86907b370d12a288bbbd1a6673a4b6e","observation_id":"470cdbe4-31f9-48d5-8580-f9102fd90435","resolution":{"observed_at":"2026-08-05T11:25:45.804282Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.789933Z","title":"Carmon, J","venue":null,"work_id":"6f11f71e-2879-4954-83d8-d727e5ca05ed","year":2020},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:44.975773Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:482d769ab50498b11d231df9030f31018a0a23e2dcf636fcc3b2dae9ee771b31","observation_id":"9cf5a8a6-542c-4a04-9a2d-32b45a59117d","resolution":{"observed_at":"2026-08-05T11:25:45.793077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:44.979371Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:44.979371Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:704fe5d0a281eda75dc12106493b1a4daa0073b955da9aa743c64605be28306b","observation_id":"451cb1a4-bc9f-4670-ac37-b982642a0bd8","resolution":{"observed_at":"2026-08-05T11:25:44.979371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.778847Z","title":"Cutkosky and H","venue":null,"work_id":"1385c416-7503-498d-93a8-a8e9370d05f5","year":2020},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:44.982382Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:bf13031b12016a8d8070ce18c1f5ec234742053fcb43ce7801239fc91167969c","observation_id":"9038939d-eeab-4981-93bf-2bfe9c9c8eda","resolution":{"observed_at":"2026-08-05T11:25:45.782053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.02395","last_updated":"2022-10-17T13:20:40Z","snapshot_observed_at":"2026-08-06T18:53:35.682332Z","submitted_at":"2020-03-05T01:56:17Z","title":"A Simple Convergence Proof of Adam and Adagrad","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.02395","snapshot_observed_at":"2026-08-05T11:25:44.985418Z","title":"D´ efossez, L","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:44.985418Z"},"links":{"cited_paper":"/paper/2003.02395","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:96d7f50fcaaf8d3995a50691659fad997852b5a3a831335a7bc840adf62bf777","observation_id":"7f41d6dc-93ed-43c9-b1b3-f139ef5955cc","resolution":{"observed_at":"2026-08-05T11:25:44.985418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.767782Z","title":"Duchi, E","venue":null,"work_id":"b7e9683b-5d84-42f8-9fbd-10f792adaeea","year":2011},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:44.988720Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:3aa11b9ba7c424b5932d027540f005befea58abc2e610cc4e7ca8063e8005929","observation_id":"317c9c3b-b84a-4b4e-90e2-4630f2af1af6","resolution":{"observed_at":"2026-08-05T11:25:45.771227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:44.991897Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:44.991897Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:3b7289c241be69ee19ce39eb07c627517af83a3becc9e01871970fc2ea4a0a28","observation_id":"3cc3a2c7-db9d-4660-8d21-762ca44dcb30","resolution":{"observed_at":"2026-08-05T11:25:44.991897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.757115Z","title":null,"venue":null,"work_id":"bb1372c5-e462-44a6-ab6a-1922d50674f1","year":2022},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:44.994885Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:9bf31211e339d3e5527ae98e1f9b5fe47ec4dd9356da82d30d9f1204a7923e16","observation_id":"5c186fa8-79f9-4ab8-b0a7-3c48e857bf70","resolution":{"observed_at":"2026-08-05T11:25:45.760388Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.746254Z","title":"Gupta, T","venue":null,"work_id":"56ebb51a-7039-4d6e-86f7-75fd2819f993","year":2018},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:44.997866Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:e45569aa5e8cb9fe7da00da46844433baefda88cce81e414675f3e07d3e72e21","observation_id":"ae365134-7745-4d1d-b093-bd5228c2ee4b","resolution":{"observed_at":"2026-08-05T11:25:45.749838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.000733Z","title":null,"venue":null,"work_id":null,"year":1986},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.000733Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:90248071b68d541ad3b12298c184b390811300ea4215ba5676d3144e4a8f808f","observation_id":"ebb3e4d2-2544-4082-9cba-df92d13ada89","resolution":{"observed_at":"2026-08-05T11:25:45.000733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.727400Z","title":"Jordan, Y","venue":null,"work_id":"032de7a7-81cb-464c-b683-92f2a7305361","year":2024},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.003704Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:d0da4dabdb3202f96a01ee005e44a61ab54a07d67ed17a19abcaa5216dfc6ffc","observation_id":"6b42fc69-1414-4047-8ba9-73c6273a0f74","resolution":{"observed_at":"2026-08-05T11:25:45.730644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.716594Z","title":"Jordan, Y","venue":null,"work_id":"72ab357d-a6c4-4427-8660-8b7285250d96","year":2024},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.006637Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:c77a7d18f8e5048dc11b9be467de7b1b0312f9ebe50cb8bcd8c402afa4887d43","observation_id":"4cf7353b-9d99-4648-8717-f88eaf0387e6","resolution":{"observed_at":"2026-08-05T11:25:45.719994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T11:25:45.009548Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.009548Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:4acef82df65a318a2be7fbceef59ae342faa6676f2b943201f1e0743f633faa4","observation_id":"47772327-da82-4098-b2d0-99eb4f9539a0","resolution":{"observed_at":"2026-08-05T11:25:45.009548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23803","last_updated":"2025-06-30T12:47:10Z","snapshot_observed_at":"2026-08-09T03:45:24.123325Z","submitted_at":"2025-06-30T12:47:10Z","title":"SGD with Adaptive Preconditioning: Unified Analysis and Momentum Acceleration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23803","snapshot_observed_at":"2026-08-05T11:25:45.012797Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.012797Z"},"links":{"cited_paper":"/paper/2506.23803","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:0bf0258c4060789fb86be1790c1c92abc2e7868d9c5c0d446dae18dda3b79e98","observation_id":"9dc0d79f-39bd-4637-bbcc-d4781fe1d75c","resolution":{"observed_at":"2026-08-05T11:25:45.012797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-08T16:16:41.474241Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-08-05T11:25:45.016558Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.016558Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:9c0ce55e358f979ce15c1ae8148de003d471feffdad4791c7635ef078ae701d9","observation_id":"2a56226a-725f-4d22-b5f4-0a573f71370d","resolution":{"observed_at":"2026-08-05T11:25:45.016558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.019816Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.019816Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:cf4faaec329f1db4296ca38b3499c249976aedbf77acd86b2eb68052d863b465","observation_id":"c3f6f2e9-119f-4758-ba8a-b248b01f9266","resolution":{"observed_at":"2026-08-05T11:25:45.019816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02900","last_updated":"2025-06-01T18:46:31Z","snapshot_observed_at":"2026-08-07T05:50:05.552166Z","submitted_at":"2025-02-05T05:44:22Z","title":"A Note on the Convergence of Muon","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02900","snapshot_observed_at":"2026-08-05T11:25:45.022770Z","title":"Li and M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.022770Z"},"links":{"cited_paper":"/paper/2502.02900","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:61edab3f5238619116684af96f57b879e2cb93ce8f47e35ffaffecf844e77c88","observation_id":"99f74c96-b6a2-4132-a03b-32b9a53398a6","resolution":{"observed_at":"2026-08-05T11:25:45.022770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.705883Z","title":"Li and F","venue":null,"work_id":"12360787-1804-46ca-83f2-42d474ee7378","year":2019},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.026395Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:4602c5b5cf72735f0fd093ec2ebb6eb6e6fd864c0c3c7c083d2a94bf906659d7","observation_id":"db938f75-4bbe-4141-bd41-fa720d787685","resolution":{"observed_at":"2026-08-05T11:25:45.709299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T11:25:45.029375Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.029375Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:da9551ae83c83b56e756ef13944c102d0ea53755f218221d8c44c20dbf634575","observation_id":"3fac7c75-f065-4159-a85f-474f3a8b141d","resolution":{"observed_at":"2026-08-05T11:25:45.029375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.032619Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.032619Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:35502f32207bc134015436acdee75d8ee10568b4a7663661db3f6a3b5188811f","observation_id":"358c797a-54e0-40d0-a210-2bf71f49bd99","resolution":{"observed_at":"2026-08-05T11:25:45.032619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05621","last_updated":"2023-08-10T15:10:08Z","snapshot_observed_at":"2026-07-06T16:04:54.766026Z","submitted_at":"2023-08-10T15:10:08Z","title":"Normalized Gradients for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05621","snapshot_observed_at":"2026-08-05T11:25:45.035920Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.035920Z"},"links":{"cited_paper":"/paper/2308.05621","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:2a04dd51d35e427548902101e2f4f393ad94e943ae54898a1f33a7f1395ef386","observation_id":"11e49d20-8ae1-448d-863e-01dd7de3ab65","resolution":{"observed_at":"2026-08-05T11:25:45.035920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07529","last_updated":"2025-06-06T13:42:19Z","snapshot_observed_at":"2026-08-03T03:50:14.086851Z","submitted_at":"2025-02-11T13:10:34Z","title":"Training Deep Learning Models with Norm-Constrained LMOs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07529","snapshot_observed_at":"2026-08-05T11:25:45.039083Z","title":"Pethick, W","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.039083Z"},"links":{"cited_paper":"/paper/2502.07529","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:c47d24117be5fb12f3b045c8989d9dae5812c3ec6a418fb922a33fb9f9aaa89a","observation_id":"2c29e27d-20b5-49b8-8018-aa827ec51cea","resolution":{"observed_at":"2026-08-05T11:25:45.039083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01598","last_updated":"2026-06-08T02:38:54Z","snapshot_observed_at":"2026-08-06T20:45:18.222000Z","submitted_at":"2025-07-02T11:03:13Z","title":"Convergence Bound and Critical Batch Size of Muon Optimizer","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01598","snapshot_observed_at":"2026-08-05T11:25:45.042343Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.042343Z"},"links":{"cited_paper":"/paper/2507.01598","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:13009ac4e19bfd83116a21686ce68e229eda7a8c491bc5dd05bf0767c9c04ffa","observation_id":"d9dc9d94-6ed4-496f-910e-3bc4e89aeacf","resolution":{"observed_at":"2026-08-05T11:25:45.042343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-07T15:56:34.964782Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-08-05T11:25:45.045809Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.045809Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:85451a0d544d3a386c3220a2d7b752e477fad08149e0e2d61612b4631437c5b7","observation_id":"86af1c9f-556c-48ca-943c-896c458b9206","resolution":{"observed_at":"2026-08-05T11:25:45.045809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23737","last_updated":"2026-07-28T01:40:23Z","snapshot_observed_at":"2026-08-07T12:36:23.369583Z","submitted_at":"2025-05-29T17:58:01Z","title":"On the Convergence Analysis of Muon","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23737","snapshot_observed_at":"2026-08-05T11:25:45.048933Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.048933Z"},"links":{"cited_paper":"/paper/2505.23737","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:285556c73333623b8ba8c922528abf973363698210500de8cfc484023dfa88c9","observation_id":"c89b774f-4cf3-4d07-9406-092269749fe2","resolution":{"observed_at":"2026-08-05T11:25:45.048933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.052149Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.052149Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:fcecee836404094c663f4677dc6efeae51be7ecad62817420a3b8cb111344aec","observation_id":"17927f12-7546-4e0d-a082-f57a71bdea97","resolution":{"observed_at":"2026-08-05T11:25:45.052149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1002.4862","last_updated":"2010-02-25T20:31:05Z","snapshot_observed_at":"2026-07-06T02:04:37.023313Z","submitted_at":"2010-02-25T20:31:05Z","title":"Less Regret via Online Conditioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1002.4862","snapshot_observed_at":"2026-08-05T11:25:45.055019Z","title":"Streeter and H","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.055019Z"},"links":{"cited_paper":"/paper/1002.4862","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:c76a977853c16082a08bfa46fb8f20513652fdaf181d6823effd96d7f70097c1","observation_id":"a67ceb89-d8a0-4b31-97a8-52e5742e30c5","resolution":{"observed_at":"2026-08-05T11:25:45.055019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11321","last_updated":"2025-01-31T18:52:42Z","snapshot_observed_at":"2026-07-06T19:16:51.512681Z","submitted_at":"2024-09-17T16:18:05Z","title":"SOAP: Improving and Stabilizing Shampoo using Adam","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11321","snapshot_observed_at":"2026-08-05T11:25:45.058459Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.058459Z"},"links":{"cited_paper":"/paper/2409.11321","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:61e874799f595147bb4a175216e01c2b5296ca6a2648f1264b3481d0d7e21e60","observation_id":"45e08aee-5a25-4200-ae20-e33f4c61d9d4","resolution":{"observed_at":"2026-08-05T11:25:45.058459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.695299Z","title":null,"venue":null,"work_id":"8f799b01-9f5c-4cc3-8289-3127db9e0f1a","year":2023},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.061548Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:852c28ec9e99d1f7dac5a69827c6c2bb399c7b51d048dfc8adfc4dc0e49b1b3b","observation_id":"0d49f263-a9da-4c28-ad90-c16023b6feee","resolution":{"observed_at":"2026-08-05T11:25:45.698483Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:25:45.064464Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.064464Z"},"links":{"citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:6255f25d4850d5c79b45baa5fe1ee34d3d85b88a776bf5b1a027092bed982b31","observation_id":"370eee7e-1f41-471f-9e03-33d73b41d59f","resolution":{"observed_at":"2026-08-05T11:25:45.064464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10537","last_updated":"2025-07-15T06:22:08Z","snapshot_observed_at":"2026-08-07T17:06:29.705076Z","submitted_at":"2025-03-13T16:51:59Z","title":"Structured Preconditioners in Adaptive Optimization: A Unified Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10537","snapshot_observed_at":"2026-08-05T11:25:45.067509Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.067509Z"},"links":{"cited_paper":"/paper/2503.10537","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:cfe93c034ddb09a80d71d8e0190d6a3bd9ad8367a62d7a57e76cb3188c4d44fc","observation_id":"9f74e983-5f39-4106-b7f8-2cc79cf604ba","resolution":{"observed_at":"2026-08-05T11:25:45.067509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14940","last_updated":"2025-07-20T12:29:14Z","snapshot_observed_at":"2026-08-07T10:33:04.410442Z","submitted_at":"2025-07-20T12:29:14Z","title":"Sharp perturbation bounds on the Frobenius norm of subunitary and positive polar factor","version":1},"cited_work":{"arxiv_id":"2507.14940","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.14940","snapshot_observed_at":"2026-08-05T11:25:45.116336Z","title":"Sharp perturbation bounds on the Frobenius norm of subunitary and positive polar factor","venue":"math.FA","work_id":"606d6ffe-1440-44d8-831d-8dfab8b1d951","year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.070762Z"},"links":{"cited_paper":"/paper/2507.14940","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:4fb69081e5ca63c8af45d605e54ba1ffaa1207ac18a7500677ee07456d153a3d","observation_id":"38273555-bdb7-4194-acbf-c247a59ad0b0","resolution":{"observed_at":"2026-08-05T11:25:45.121899Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.05671","last_updated":"2024-06-20T16:13:13Z","snapshot_observed_at":"2026-07-06T06:56:05.603132Z","submitted_at":"2018-08-16T20:25:28Z","title":"On the Convergence of Adaptive Gradient Methods for Nonconvex Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.05671","snapshot_observed_at":"2026-08-05T11:25:45.073914Z","title":"t−1X τ=0 µτ ˜Et+1−τ ∗ # +µL t−1X τ=0 µτ E[max{ϵ, ηαt−τ }] ≤ µtκ√r√ b + (1−µ) √rE","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.073914Z"},"links":{"cited_paper":"/paper/1808.05671","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:dacfb1180d0df7ccb4a0d747ff0ee781a674edf0ecaa95107ada04e106622348","observation_id":"450a164b-d7cd-4752-8a10-00037206b6d5","resolution":{"observed_at":"2026-08-05T11:25:45.073914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T03:06:03.666431Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":9},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 14 inbound Pith citation observations for arXiv:2509.02981."}