{"as_of":"2026-08-18T14:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6c4e57f0f986f2673a170177c41b8fc9c8e816d78012b4eb6cffa59ad8358740","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:56:43.476260Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:39:26.579690Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T05:39:27.740838Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"cited_work":{"arxiv_id":"2602.06880","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.06880","snapshot_observed_at":"2026-08-06T05:39:27.740838Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","venue":"cs.LG","work_id":"7e4966f1-9665-4e1a-aa6c-de1431e4acb9","year":2026},"citing_paper":{"arxiv_id":"2608.05088","last_updated":"2026-08-05T17:26:47Z","snapshot_observed_at":"2026-08-14T10:08:31.742687Z","submitted_at":"2026-08-05T17:26:47Z","title":"MALT: Lightweight Curvature-Aware Muon via Diagonal Preconditioning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T05:39:26.579690Z"},"links":{"cited_paper":"/paper/2602.06880","citing_paper":"/paper/2608.05088"},"observation_digest":"sha256:44e8a37adc4f9272080993b207a76ce4957af6ea20e333526b1b8e3ac455bcf8","observation_id":"7b586bf1-f419-4aee-aad5-e696582c5492","resolution":{"observed_at":"2026-08-06T05:39:27.745528Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.06880/citation-record","integrity":"/paper/2602.06880/integrity","json":"/paper/2602.06880/citation-record.json","paper":"/paper/2602.06880"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:38.842958Z","title":"Natural gradient works efficiently in learning","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:38.842958Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:f8efb5e85eba3b96db9548c826ed1ecbd8337285d806562181026aec25da0e07","observation_id":"e60b2618-8fa3-4135-b29d-a60c51c22f07","resolution":{"observed_at":"2026-08-03T03:56:38.842958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:38.877833Z","title":"Asgo: Adaptive structured gradient optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:38.877833Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:784cbd9564ff51cb41f2d091fd1112d5cbd7bf3bcb448be8d05303af47e3e68a","observation_id":"15e71a83-849d-4cd3-b693-d99f0c563cd3","resolution":{"observed_at":"2026-08-03T03:56:38.877833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-08-16T14:37:33.548231Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-03T03:56:38.912379Z","title":"Kimi k2: Open agentic intelligence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:38.912379Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:47b0e9380afda434a975f36aac6d15072dd07d45b2936a407adf64e24e8d5b20","observation_id":"59eaa3ba-67f1-4605-b287-ac6e3ae6e0f7","resolution":{"observed_at":"2026-08-03T03:56:38.912379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-16T13:05:17.001660Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-08-03T03:56:38.947343Z","title":"and Newhouse, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:38.947343Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:55ff9b09e267fc03580b5b9cfd2a8198bff5684090eb8f0deb935151abdcb35b","observation_id":"930d441e-fe2f-4a3c-987e-6ee6a1291d18","resolution":{"observed_at":"2026-08-03T03:56:38.947343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20325","last_updated":"2024-12-06T14:09:22Z","snapshot_observed_at":"2026-08-12T12:26:45.359430Z","submitted_at":"2024-09-30T14:26:12Z","title":"Old Optimizer, New Norm: An Anthology","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20325","snapshot_observed_at":"2026-08-03T03:56:38.990015Z","title":"and Newhouse, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:38.990015Z"},"links":{"cited_paper":"/paper/2409.20325","citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:825db13bcb591c7e7789158cfc3161d1acfbc1071d755cab093d947b576822a3","observation_id":"7d639092-518d-4a97-a92d-08d962fa7459","resolution":{"observed_at":"2026-08-03T03:56:38.990015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:39.032959Z","title":"signsgd: Compressed optimisation for non-convex problems","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:39.032959Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:b6c1311f486ea247f890f2a1375d7fb2b014dfee293227af89547df7952d39f8","observation_id":"57362dd2-3b8e-4418-8c9d-e0cf9d0039e1","resolution":{"observed_at":"2026-08-03T03:56:39.032959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:39.072423Z","title":"and Vandenberghe, L","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:39.072423Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:f58fd23b7eefff95b2f1140997d9fb28b62473dd7cfc4eb75046d18fa9f9c0d1","observation_id":"681390e5-fc7a-4857-84e6-7aeffc439a7f","resolution":{"observed_at":"2026-08-03T03:56:39.072423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:39.200371Z","title":"H., Hansen, S","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:39.200371Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:d0f8730e3e3d1a9934f0f002d54622abfdaebaac51d5bd95602b97c1671502bc","observation_id":"5e85a5ff-ce20-411d-a791-4aa646114e62","resolution":{"observed_at":"2026-08-03T03:56:39.200371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:39.282731Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:39.282731Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:45b7dd2028ec8f841501bcf991042aa1b5ac8b283c98d7d8caf44c048850ccc7","observation_id":"969b7c93-fab7-48d1-93a4-632c49dc8629","resolution":{"observed_at":"2026-08-03T03:56:39.282731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:39.346468Z","title":"Stochastic spectral descent for restricted boltzmann machines","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:39.346468Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:4bac0650efe3d25c6ab19c71752cd8aaa366502689f473afb0387757f5336531","observation_id":"f17a49b4-f7d1-4c20-ae21-bd913ece4fd3","resolution":{"observed_at":"2026-08-03T03:56:39.346468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:39.397203Z","title":"E., Collins, E., Hsieh, Y.-P., Carin, L., and Cevher, V","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:39.397203Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:6e32f5730accb14ba436fe137d4a0e93a5d280c782d8aefee6d354d391bb3404","observation_id":"18b24959-0c13-43e4-94ab-740d23d73914","resolution":{"observed_at":"2026-08-03T03:56:39.397203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05898","last_updated":"2025-07-01T15:59:19Z","snapshot_observed_at":"2026-08-16T14:53:44.465422Z","submitted_at":"2023-10-09T17:41:29Z","title":"Lion Secretly Solves Constrained Optimization: As Lyapunov Predicts","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05898","snapshot_observed_at":"2026-08-03T03:56:39.454368Z","title":"Lion secretly solves constrained optimization: As lyapunov predicts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:39.454368Z"},"links":{"cited_paper":"/paper/2310.05898","citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:9d2657503e0dbb6ec5e8bf11bbb231dca72b11e2c4389064831df3f12a5d39da","observation_id":"0adb151e-1490-4fcd-a928-f796bd357387","resolution":{"observed_at":"2026-08-03T03:56:39.454368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:39.505927Z","title":"Muon optimizes under spectral norm constraints","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:39.505927Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:59aa76b4b786703b3387129384e84cd722dab50695ab055136117f898532b46f","observation_id":"6bb6d2d2-7b92-40f5-a78b-901e115ea5a8","resolution":{"observed_at":"2026-08-03T03:56:39.505927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:39.535901Z","title":"Symbolic discovery of optimization algorithms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:39.535901Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:e206da6cb1e4551412ebfd350d7a50d9e27a16e6fb2321ccc89565a5534ca342","observation_id":"10ca93b6-07cd-4846-bd88-32d9f3d52b00","resolution":{"observed_at":"2026-08-03T03:56:39.535901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:39.589058Z","title":"and Drusvyatskiy, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:39.589058Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:1c9ba5b223040212b354d11a8699253c853da973585843b91ea624db9fdfd75c","observation_id":"166a226f-a6b2-460e-beb1-6f436b13eec7","resolution":{"observed_at":"2026-08-03T03:56:39.589058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:39.644053Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:39.644053Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:f18998cbd976aabeeb707f6dea3a7149310e7fa00b5ffb2324b48296b059af18","observation_id":"0e064e9b-e3ba-4e6d-894e-6d86976f294d","resolution":{"observed_at":"2026-08-03T03:56:39.644053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-03T03:56:39.677859Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:39.677859Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:182953dd8c6ff5007259e9a620bb8e757cd7a51722cadfee4c70634eb9f5682e","observation_id":"f278a048-a0d5-4b0b-9a88-82083164e003","resolution":{"observed_at":"2026-08-03T03:56:39.677859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-03T03:56:39.750753Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:39.750753Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:880e310ca0f8a7c807eff20e2a8b779a7b03431835d3ffeee724aad4213511a7","observation_id":"fa1349dc-3d82-4636-bec6-a9ffa4df3ba6","resolution":{"observed_at":"2026-08-03T03:56:39.750753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:39.884024Z","title":"Adaptive subgradient methods for online learning and stochastic optimization","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:39.884024Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:14bb9c68706b9c1730bc2d65fe940c93d72975683db4f8b2a31459e571f8ed2e","observation_id":"cd9d6f52-231b-412a-a273-9bf19ec2c486","resolution":{"observed_at":"2026-08-03T03:56:39.884024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:39.991463Z","title":"Promise: Preconditioned stochastic optimization methods by incorporating scalable curvature estimates","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:39.991463Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:a2d4f19075333d60265b3421498411b4ad9d963348a3f6a41a587bdab825b318","observation_id":"e8c4e895-4e08-4867-ae5b-162ae27a5954","resolution":{"observed_at":"2026-08-03T03:56:39.991463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:40.099327Z","title":"Sketchysgd: reliable stochastic optimization via randomized curvature estimates","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:40.099327Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:1a3233558a38932e9c77d96e045c8e80bf58b00be9ef8ab7b574c7cffdc62a7f","observation_id":"05ac5e45-c242-4399-bf24-0e781b763c24","resolution":{"observed_at":"2026-08-03T03:56:40.099327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:40.159394Z","title":"What really matters in matrix-whitening optimizers? arXiv preprint arXiv:2510.25000, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:40.159394Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:8e9e45156f04dfc60a9f5902bc43d11bd577de40de573cb6c4d5205dd72bb6c5","observation_id":"aa0a7051-5f82-4b16-9e3e-5e23d04e1e1d","resolution":{"observed_at":"2026-08-03T03:56:40.159394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:40.243143Z","title":"A stable whitening optimizer for efficient neural network training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:40.243143Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:380e6646b6645cf49db97f11f64d571c559436c14e9e65ef429cd537f7f22780","observation_id":"a28edd17-8a06-41ab-97ea-8746b9a599a7","resolution":{"observed_at":"2026-08-03T03:56:40.243143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:40.353083Z","title":"S., and Valiant, G","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:40.353083Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:f6c08d0088789f8119b02e8126a1f355d60e30b96cf547a791cb36307b2b019a","observation_id":"364a15b5-2194-4017-88a4-eb2854358f08","resolution":{"observed_at":"2026-08-03T03:56:40.353083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:40.412869Z","title":"and Lan, G","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:40.412869Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:571acf0323a0c030dbf221a490a8d11d2728cd75792feba58eb7209b61fdaf4e","observation_id":"f5408dee-bcb1-44ac-83bb-704fad1c8bf3","resolution":{"observed_at":"2026-08-03T03:56:40.412869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:40.505508Z","title":"An investigation into neural net optimization via hessian eigenvalue density","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:40.505508Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:c134dd73246d05f66896197481c737abd8f1a6290c7cc3e8531d68cbbde37fb8","observation_id":"8cdafa92-0890-4914-8272-758b8dd729d2","resolution":{"observed_at":"2026-08-03T03:56:40.505508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:40.710863Z","title":null,"venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:40.710863Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:39b132c2f2c5b7d6937a1f1d08059f9de35e99ba2d2de16603b86f54efa9d0f6","observation_id":"11db8331-7b9e-46ee-8d62-49ab48c957f6","resolution":{"observed_at":"2026-08-03T03:56:40.710863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:41.009278Z","title":"Solving ridge regression using sketched preconditioned svrg","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:41.009278Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:89cbbb2ce90059128ac47cb99d61768cbe19f5711748b21c1a92dc77f32e6bc5","observation_id":"5ddaf37b-f71c-45c0-91ae-8e34da4dc56e","resolution":{"observed_at":"2026-08-03T03:56:41.009278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:41.141383Z","title":"Shampoo: Preconditioned stochastic tensor optimization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:41.141383Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:49aa61b70508b824b0ef0e5ca620df796fa5f5549c4cd4d4f92bfbc6a279f351","observation_id":"311a7f49-8c95-4417-ae56-d3046c983773","resolution":{"observed_at":"2026-08-03T03:56:41.141383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:41.184883Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:41.184883Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:834f9153247806b8d786da5f626296b2157486ab5a485507c9f7b205a518d068","observation_id":"aba82005-80cf-4f4d-bd8e-2d78cc925045","resolution":{"observed_at":"2026-08-03T03:56:41.184883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:41.233234Z","title":"modded-nanogpt: Speedrunning the nanogpt baseline, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:41.233234Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:e473450e715fbdd20904d7f43a05a1f8666c5ffcc370c00ae8994115de99905a","observation_id":"c5abfba9-0cfa-4a16-afa1-f189ee8ae025","resolution":{"observed_at":"2026-08-03T03:56:41.233234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:41.276979Z","title":"Muon: An optimizer for hidden layers in neural networks, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:41.276979Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:132f9aaf53df5270dc5e79bff40ac6107f160a0c58d665f58eec66619be9b4b5","observation_id":"d57f06d7-4e6c-4c75-bd01-887dbf7ea3c8","resolution":{"observed_at":"2026-08-03T03:56:41.276979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-03T03:56:41.328983Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:41.328983Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:578d416d1113a8957e68ddf1bcba271c3aa5c180fa9f163f916bdfe7acf7da67","observation_id":"8d0cadea-d781-44e8-a82a-15787f7d2c4b","resolution":{"observed_at":"2026-08-03T03:56:41.328983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:41.386311Z","title":"C., and Platt, J","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:41.386311Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:2ae45ab52c91d68332113fc2d4a8432621889b5812e4b29d38094aad6b236980","observation_id":"5bf56e8e-20b4-4d55-ab4b-f60f5d603649","resolution":{"observed_at":"2026-08-03T03:56:41.386311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:41.409297Z","title":"Scalable optimization in the modular norm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:41.409297Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:5f7f63ab9e23d7c714e7c3df60a0173e7c9ea9e441a567beb1b284bb84abb3e2","observation_id":"7686a47c-9b46-47d7-870e-b7f13ca7e200","resolution":{"observed_at":"2026-08-03T03:56:41.409297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:41.481912Z","title":"Normuon: Making muon more efficient and scalable","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:41.481912Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:b098711c7a47a6fb02d5ddc701ebda374babe1d0ecd427afbb8b38e18bdba024","observation_id":"eadb2211-2a8d-4a66-a028-07b8e8ae5afd","resolution":{"observed_at":"2026-08-03T03:56:41.481912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-03T03:56:41.538906Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:41.538906Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:032fd65b061dca7b4f6b188bc9df7bd68280f9545df4dcff5e0dd2822be512a9","observation_id":"2bce02ad-1986-4675-8185-d4fc30be0a1e","resolution":{"observed_at":"2026-08-03T03:56:41.538906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-16T22:48:15.725816Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-03T03:56:41.622106Z","title":"Muon is scalable for llm training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:41.622106Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:61a584d21972bae9dc235867354c0a0dfa8c638936e0c32a4d383df9711a2b04","observation_id":"82d1aae8-36a2-4341-9f32-4e429bb9a959","resolution":{"observed_at":"2026-08-03T03:56:41.622106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:41.679058Z","title":"Cosmos: A hybrid adaptive optimizer for memory-efficient training of llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:41.679058Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:c249ae3b7fecfe9bd8270e55d9ac116443f9899fb9f2d939c66a22d7f5430368","observation_id":"8e916ad6-5bfe-43dc-90be-199fc39ca9ce","resolution":{"observed_at":"2026-08-03T03:56:41.679058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:41.731192Z","title":"S., Li, B., Drineas, P., Zhang, R., and Bullins, B","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:41.731192Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:c4ddd7e04cb4438faea9525555037117dae1a52d63d287e1d3c7a6e50dc3c5e6","observation_id":"2c1cf132-1098-45d3-8581-7722cfdbdeb9","resolution":{"observed_at":"2026-08-03T03:56:41.731192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:41.752834Z","title":"Preconditioning benefits of spectral orthogonalization in muon","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:41.752834Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:56a5ffef2ea05deb9352347d53077ca85649d8d7aacf7255b04ab8159c1d8c8d","observation_id":"cf061701-72c4-484e-8461-ce28d0b927e9","resolution":{"observed_at":"2026-08-03T03:56:41.752834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:41.813589Z","title":"New insights and perspectives on the natural gradient method","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:41.813589Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:6a333a1699d0b7051d42cadf2576ee861ea868883b95415cbe87b5191d878a28","observation_id":"8db7907a-67d8-4852-ae1c-221a04f4a9d0","resolution":{"observed_at":"2026-08-03T03:56:41.813589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:41.875522Z","title":"and Grosse, R","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:41.875522Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:8e70ae570a342c3efcfdd9972249f54bfc3ac18b0246e004d4127882cf48e01d","observation_id":"da175134-bdde-4189-ad8d-79ab3be99448","resolution":{"observed_at":"2026-08-03T03:56:41.875522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17748","last_updated":"2024-06-25T17:34:51Z","snapshot_observed_at":"2026-08-16T13:39:40.716171Z","submitted_at":"2024-06-25T17:34:51Z","title":"A New Perspective on Shampoo's Preconditioner","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17748","snapshot_observed_at":"2026-08-03T03:56:41.924586Z","title":"A new perspective on shampoo's preconditioner","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:41.924586Z"},"links":{"cited_paper":"/paper/2406.17748","citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:f7efa073d739b345aa70357e50103c3617cfa659c004d3a4727037614c61009e","observation_id":"a47d27ec-5912-4c15-ae7a-56b36320e736","resolution":{"observed_at":"2026-08-03T03:56:41.924586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:42.001468Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:42.001468Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:c5dc2589a95466bd848840a88380efa0a86c8c91d8ff50398005bd03fd58fe35","observation_id":"423c366a-186e-49ab-9924-a56dd22f65b8","resolution":{"observed_at":"2026-08-03T03:56:42.001468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:42.058798Z","title":"and Mahoney, M","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:42.058798Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:94e153052e70ba24e15c0841534969c2b6a6aa42adff63c83d14899877c1728b","observation_id":"8b71759a-4f27-4774-af72-27635d5641b4","resolution":{"observed_at":"2026-08-03T03:56:42.058798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:42.116454Z","title":"and Gower, R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:42.116454Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:f2fb32bb3c1a507c43520ccadf507625a5f8031ad1ec65ec64e379b8c5c61365","observation_id":"223201c8-ae83-455d-83eb-913e55d31ac1","resolution":{"observed_at":"2026-08-03T03:56:42.116454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:42.170986Z","title":"A., Von Werra, L., Wolf, T., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:42.170986Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:447bf06fb516a37f0c591db98ebd3e8f70106d5e5c37bd5a1e61dde3f991ce5d","observation_id":"39fbf2aa-2ec3-46a3-ba09-78a527a465e7","resolution":{"observed_at":"2026-08-03T03:56:42.170986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07529","last_updated":"2025-06-06T13:42:19Z","snapshot_observed_at":"2026-08-16T22:34:28.103547Z","submitted_at":"2025-02-11T13:10:34Z","title":"Training Deep Learning Models with Norm-Constrained LMOs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07529","snapshot_observed_at":"2026-08-03T03:56:42.216925Z","title":"Training deep learning models with norm-constrained lmos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:42.216925Z"},"links":{"cited_paper":"/paper/2502.07529","citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:ec31c55675d3917a9b5b4ac9d6868c1f983ace1adb4eee3e6b6e5002cf9d63a4","observation_id":"2e68b0f9-1983-49e3-913e-325e95a379e6","resolution":{"observed_at":"2026-08-03T03:56:42.216925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:42.307997Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:42.307997Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:5cd5607a27418255e21e2df44af4329d698dedd7cf74efcdcfb99ffeda8ee53d","observation_id":"1a14bb04-04b0-4a7c-94ab-aa1e6a0a8b0c","resolution":{"observed_at":"2026-08-03T03:56:42.307997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:42.392705Z","title":"and Mahoney, M","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:42.392705Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:e577d207c4095b560fb155e9e4a74ae39abc910607f1653f137aa5ead045d28e","observation_id":"fceaf0d0-7edf-4f26-98dd-763d595515a8","resolution":{"observed_at":"2026-08-03T03:56:42.392705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:42.478317Z","title":"and Stern, M","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:42.478317Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:f7612f8224ec1d5da1f797da64f0c1d42f04ae32ab36cdc45ce3ba63350514b1","observation_id":"902760e6-8b93-40de-a898-373efba67ee4","resolution":{"observed_at":"2026-08-03T03:56:42.478317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23737","last_updated":"2026-07-28T01:40:23Z","snapshot_observed_at":"2026-08-17T04:14:11.630903Z","submitted_at":"2025-05-29T17:58:01Z","title":"On the Convergence Analysis of Muon","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23737","snapshot_observed_at":"2026-08-03T03:56:42.536383Z","title":"On the convergence analysis of muon","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:42.536383Z"},"links":{"cited_paper":"/paper/2505.23737","citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:321f5b29a807b3e4787c0e7077419314cc949b41830255c737dd963deefdd820","observation_id":"d63023fc-c201-43c7-aa76-a71b1f71a521","resolution":{"observed_at":"2026-08-03T03:56:42.536383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:42.588374Z","title":"Adamuon: Adaptive muon optimizer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:42.588374Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:38b4adb1bfa63ab33128246a4a5bd503773db8764eba8a32cf73405773d7642a","observation_id":"3b1412d5-7d11-463b-ae6a-f324971a5785","resolution":{"observed_at":"2026-08-03T03:56:42.588374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:42.728053Z","title":"Lecture 6.5-rmsprop: Divide the gradient by a running average of its recent magnitude","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:42.728053Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:10756ae1db603fd91b7848093649b7a6a15ed2c38f68a6fed01e809b7e6c28f9","observation_id":"2a88408f-3be9-4c85-902f-5c15f3a21213","resolution":{"observed_at":"2026-08-03T03:56:42.728053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:42.810748Z","title":"Accelerating ill-conditioned low-rank matrix estimation via scaled gradient descent","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:42.810748Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:32d4a21515e630d31def4f65cd0175e2ef11f066748fe3e4318958bb65654ea9","observation_id":"5a1f69ee-a2bb-4d29-9ca7-b6994ce8799c","resolution":{"observed_at":"2026-08-03T03:56:42.810748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10777","last_updated":"2026-05-16T11:31:52Z","snapshot_observed_at":"2026-08-16T04:56:16.403198Z","submitted_at":"2025-10-12T19:39:41Z","title":"Preconditioned Norms: A Unified Framework for Steepest Descent, Quasi-Newton and Adaptive Methods","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.10777","snapshot_observed_at":"2026-08-03T03:56:42.847187Z","title":"Preconditioned norms: A unified framework for steepest descent, quasi-newton and adaptive methods","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:42.847187Z"},"links":{"cited_paper":"/paper/2510.10777","citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:4e9f1fd778e432e5e6b3752a8b70da2d99590bc8a138b7e2d54cc0e29c38f888","observation_id":"b1de61b7-24ed-4ce5-9763-32a02285426c","resolution":{"observed_at":"2026-08-03T03:56:42.847187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11321","last_updated":"2025-01-31T18:52:42Z","snapshot_observed_at":"2026-08-15T04:58:58.957938Z","submitted_at":"2024-09-17T16:18:05Z","title":"SOAP: Improving and Stabilizing Shampoo using Adam","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11321","snapshot_observed_at":"2026-08-03T03:56:42.901175Z","title":"Soap: Improving and stabilizing shampoo using adam","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:42.901175Z"},"links":{"cited_paper":"/paper/2409.11321","citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:42a224f053bf3fcf52473e18fd47a4935c140e2c83521c6719306f7fc511fe9d","observation_id":"9a382460-d17a-4ca5-aae9-7899d5aba3d2","resolution":{"observed_at":"2026-08-03T03:56:42.901175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.13152","last_updated":"2020-04-27T20:18:29Z","snapshot_observed_at":"2026-08-16T05:01:38.917594Z","submitted_at":"2020-04-27T20:18:29Z","title":"Some people aren't worth listening to: periodically retraining classifiers with feedback from a team of end users","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.13152","snapshot_observed_at":"2026-08-03T03:56:42.960283Z","title":"and Saul, L","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:42.960283Z"},"links":{"cited_paper":"/paper/2004.13152","citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:c8c9919bce3e7a46efafa1a4faaabedb2303dcc7d16f7e42d1daaf014763bc2b","observation_id":"af7cce2a-69b2-4deb-b363-5defa76ac7dd","resolution":{"observed_at":"2026-08-03T03:56:42.960283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-18T07:20:56.759709Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-03T03:56:43.064248Z","title":"Fantastic pretraining optimizers and where to find them","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:43.064248Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:9211024fd249362e39172000344900a4635ba7097065f835221ebe847eea4dfb","observation_id":"1cda9634-30c0-49fb-bbc4-4c47b6d58783","resolution":{"observed_at":"2026-08-03T03:56:43.064248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04261","last_updated":"2022-10-21T17:23:00Z","snapshot_observed_at":"2026-08-16T19:14:50.158837Z","submitted_at":"2020-10-08T21:18:11Z","title":"Dissecting Hessian: Understanding Common Structure of Hessian in Neural Networks","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04261","snapshot_observed_at":"2026-08-03T03:56:43.178574Z","title":"Dissecting hessian: Understanding common structure of hessian in neural networks","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:43.178574Z"},"links":{"cited_paper":"/paper/2010.04261","citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:6e232faa53c53d77c0d5a5fbee02fcf81add5b5e01550f2bbe8516a0a07b4f68","observation_id":"de58b063-0d6f-4f8a-a3b4-5580a4322e40","resolution":{"observed_at":"2026-08-03T03:56:43.178574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:43.240388Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:43.240388Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:26ecf9806b3846e299f1be859a792e5c330f5ea2cc8395d7ebfcdb491d2539c9","observation_id":"36287a84-982b-40f5-9c81-8292da84840e","resolution":{"observed_at":"2026-08-03T03:56:43.240388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:43.271141Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:43.271141Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:c98735279f97983bf17156158137f9d02e3c0efb44440067c021ebe5d16a19bb","observation_id":"1365f664-8535-44f5-aaf3-93e9bef3d711","resolution":{"observed_at":"2026-08-03T03:56:43.271141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02981","snapshot_observed_at":"2026-08-03T03:56:43.342273Z","title":"Adagrad meets muon: Adaptive stepsizes for orthogonal updates","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:43.342273Z"},"links":{"cited_paper":"/paper/2509.02981","citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:1f92b3f918092328b2125d96eef292921f9156ea72ff3c76a54dc1ac2822d622","observation_id":"e544531f-c17e-4347-9f5e-ca0051463067","resolution":{"observed_at":"2026-08-03T03:56:43.342273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:43.412857Z","title":"Why transformers need adam: A hessian perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:43.412857Z"},"links":{"citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:c82849a7d177221fd3886d56cb0dd3441d61001d7289322688cbf1982ce94f94","observation_id":"3bd2a7ee-9047-4eec-8131-acba52bef08e","resolution":{"observed_at":"2026-08-03T03:56:43.412857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16793","last_updated":"2025-02-24T11:29:08Z","snapshot_observed_at":"2026-08-18T08:35:53.576897Z","submitted_at":"2024-06-24T16:56:41Z","title":"Adam-mini: Use Fewer Learning Rates To Gain More","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16793","snapshot_observed_at":"2026-08-03T03:56:43.476260Z","title":"P., Ye, Y., Luo, Z.-Q., and Sun, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:43.476260Z"},"links":{"cited_paper":"/paper/2406.16793","citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:ad3b5808de03fac249f9b37f820f1e08eca95fa6a2335f4668d69ff38f57bdae","observation_id":"eef81a0f-b6bf-4672-9e37-1cfd7134bf26","resolution":{"observed_at":"2026-08-03T03:56:43.476260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T13:17:56.363673Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":66,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 1 inbound Pith citation observation for arXiv:2602.06880."}