{"as_of":"2026-08-21T23:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a2fcf5cda67907252e16b5fbec91d5528c1c207fe0e5cadbfb7fbc3108ed7a0d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":45,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T01:10:04.430235Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:29:38.574824Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-08-15T20:20:53.821206Z","title":"Understanding gradient orthogonalization for deep learning via non-Euclidean trust-region optimization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13416","last_updated":"2025-05-19T17:50:45Z","snapshot_observed_at":"2026-08-17T21:25:27.735163Z","submitted_at":"2025-05-19T17:50:45Z","title":"Gluon: Making Muon & Scion Great Again! (Bridging Theory and Practice of LMO-based Optimizers for LLMs)","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:20:53.821206Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2505.13416"},"observation_digest":"sha256:0b9f4bca8999a1966ad4274e6fb36e48a598fe64ce2fa5bca15fca46fb69d9a3","observation_id":"71fcfa0c-e72a-4410-af0d-4f238ce0ef33","resolution":{"observed_at":"2026-08-15T20:20:53.821206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":"2503.12645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-07-04T07:29:38.574824Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":"fe62cb1b-f9dc-4379-8586-5c2f591ba7e5","year":2025},"citing_paper":{"arxiv_id":"2505.23737","last_updated":"2026-07-28T01:40:23Z","snapshot_observed_at":"2026-08-17T04:14:11.630903Z","submitted_at":"2025-05-29T17:58:01Z","title":"On the Convergence Analysis of Muon","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T13:19:37.035526Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2505.23737"},"observation_digest":"sha256:722d0ab157329a5c6840b14d345e91648e96b7ba5a70429e2f47a0ff683b6415","observation_id":"a403ee15-b40b-461e-9cb3-2621c37bd61e","resolution":{"observed_at":"2026-05-19T13:22:19.190615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-08-07T12:45:19.083274Z","title":"Understanding gradient orthogonalization for deep learning via non-euclidean trust- region optimization.arXiv preprint arXiv:2503.12645,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23737","last_updated":"2026-07-28T01:40:23Z","snapshot_observed_at":"2026-08-17T04:14:11.630903Z","submitted_at":"2025-05-29T17:58:01Z","title":"On the Convergence Analysis of Muon","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:19.083274Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2505.23737"},"observation_digest":"sha256:01e24ad4fb838a7bac3a7f842d196c1d22a05b7174fecd27c13602df6cdb0da7","observation_id":"9c7a278f-ce05-4ead-bf51-e1a07dabc265","resolution":{"observed_at":"2026-08-07T12:45:19.083274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-08-06T21:45:08.503792Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23803","last_updated":"2025-06-30T12:47:10Z","snapshot_observed_at":"2026-08-13T19:01:04.086144Z","submitted_at":"2025-06-30T12:47:10Z","title":"SGD with Adaptive Preconditioning: Unified Analysis and Momentum Acceleration","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:08.503792Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2506.23803"},"observation_digest":"sha256:32dc73a74d1b84d44ff0e7c3fe26f0497262e0432f21bea303cd2900b9ae94a4","observation_id":"7e55803d-1621-4fa3-9926-13f92e574a0b","resolution":{"observed_at":"2026-08-06T21:45:08.503792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-08-06T20:57:10.260807Z","title":"Understanding gradient orthogonalization for deep learning via non-euclidean trust-region optimiza- tion.arXiv,https://arxiv.org/abs/2503.12645,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01598","last_updated":"2026-06-08T02:38:54Z","snapshot_observed_at":"2026-08-16T23:33:31.313167Z","submitted_at":"2025-07-02T11:03:13Z","title":"Convergence Bound and Critical Batch Size of Muon Optimizer","version":5},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T20:57:10.260807Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2507.01598"},"observation_digest":"sha256:7ad3b23c48c13cc0a9269132c37af7e2d7a87d4aec9d1b232e12c64b30af0d63","observation_id":"5404d0a2-7c9d-475b-8089-0d0e6fa8232f","resolution":{"observed_at":"2026-08-06T20:57:10.260807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-08-05T15:43:57.016425Z","title":"Understanding gradient orthogonalization for deep learning via non-euclidean trust-region optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19712","last_updated":"2025-08-27T09:18:51Z","snapshot_observed_at":"2026-08-17T13:28:09.638976Z","submitted_at":"2025-08-27T09:18:51Z","title":"Simple Stepsize for Quasi-Newton Methods with Global Convergence Guarantees","version":1},"reference_index":1993,"source":"pdf_text","source_observed_at":"2026-08-05T15:43:57.016425Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2508.19712"},"observation_digest":"sha256:1cdee0b83fbd4d0c3a88983a45f680d52880d57ebc9b196ebe224084f2645b24","observation_id":"eee4ad59-1abc-4558-9daf-6ec7edd85f4e","resolution":{"observed_at":"2026-08-05T15:43:57.016425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-08-05T11:25:45.016558Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-17T08:28:41.290969Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.016558Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:7e98e2f8df0e065280f2bc7cc47de4591f4d37a7b7475f3a138c717ebab183b7","observation_id":"2a56226a-725f-4d22-b5f4-0a573f71370d","resolution":{"observed_at":"2026-08-05T11:25:45.016558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":"2503.12645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-07-04T07:29:38.574824Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":"fe62cb1b-f9dc-4379-8586-5c2f591ba7e5","year":2025},"citing_paper":{"arxiv_id":"2509.11983","last_updated":"2026-04-19T16:56:37Z","snapshot_observed_at":"2026-08-13T05:15:24.130541Z","submitted_at":"2025-09-15T14:28:53Z","title":"Low-rank Orthogonalization for Large-scale Matrix Optimization with Applications to Foundation Model Training","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T15:48:43.422716Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2509.11983"},"observation_digest":"sha256:494bcee18af0fa6beae440b332a2fb55c26875eb1c3e08645881d300829593f2","observation_id":"b279ccfb-6373-4faf-8821-92c8a85b74d2","resolution":{"observed_at":"2026-05-18T15:51:33.991661Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-08-15T15:57:38.243210Z","title":"Understanding gradient orthogonalization for deep learning via non-euclidean trust-region optimization.arXiv preprint arXiv:2503.12645,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.14562","last_updated":"2026-07-24T13:07:17Z","snapshot_observed_at":"2026-08-16T22:35:10.348502Z","submitted_at":"2025-09-18T02:49:27Z","title":"LiMuon: Light and Fast Muon Optimizer for Large Models","version":5},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-15T15:57:38.243210Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2509.14562"},"observation_digest":"sha256:3bd44e95b6537c4498ab24491701c67cdb3d9645014e03bdc8d4703910bbcedd","observation_id":"b59ea046-1d03-4ce1-a722-85a675230cfc","resolution":{"observed_at":"2026-08-15T15:57:38.243210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-08-04T13:25:32.657347Z","title":"Understanding gradient orthogonalization for deep learning via non-Euclidean trust-region optimization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01377","last_updated":"2026-06-02T08:11:16Z","snapshot_observed_at":"2026-08-17T18:58:06.745502Z","submitted_at":"2025-10-01T19:06:11Z","title":"DeMuon: A Decentralized Muon for Matrix Optimization over Graphs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T13:25:32.657347Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2510.01377"},"observation_digest":"sha256:d97bd2c025efd3f91319dd39d263873286a9083a656f8a55395849bef5f5ce13","observation_id":"57eb9d9d-2d5d-4dea-8cf8-b3e09d8adc77","resolution":{"observed_at":"2026-08-04T13:25:32.657347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-08-03T22:20:05.564818Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.11466","last_updated":"2026-06-22T13:35:19Z","snapshot_observed_at":"2026-08-13T05:16:19.109873Z","submitted_at":"2025-11-14T16:38:15Z","title":"Non-Euclidean SGD for Structured Optimization: Unified Analysis and Improved Rates","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-03T22:20:05.564818Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2511.11466"},"observation_digest":"sha256:31279768a7fd60323c736d2af7d97b3d78278a4ce2645f5ec282193374952447","observation_id":"31fac1bf-6fa3-4f1a-920a-03ea72ffd199","resolution":{"observed_at":"2026-08-03T22:20:05.564818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-08-03T04:14:15.087140Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05725","last_updated":"2026-06-03T16:40:26Z","snapshot_observed_at":"2026-08-17T20:44:52.996699Z","submitted_at":"2026-02-05T14:49:40Z","title":"Muon in Associative Memory Learning: Training Dynamics and Scaling Laws","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-03T04:14:15.087140Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2602.05725"},"observation_digest":"sha256:1a1d413d8a0485b24baa2aa84297a2948e7cf9ceefda5e54b18ef2674cb0a2e5","observation_id":"32aafd05-c463-4274-82c8-177a95cc14d9","resolution":{"observed_at":"2026-08-03T04:14:15.087140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":"2503.12645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-07-04T07:29:38.574824Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":"fe62cb1b-f9dc-4379-8586-5c2f591ba7e5","year":2025},"citing_paper":{"arxiv_id":"2602.21545","last_updated":"2026-05-14T00:38:30Z","snapshot_observed_at":"2026-08-04T04:29:45.131716Z","submitted_at":"2026-02-25T04:04:00Z","title":"MUON+: Towards More Effective Muon via One Additional Normalization Step for LLM Pre-training","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T19:24:22.699712Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2602.21545"},"observation_digest":"sha256:72cd0995344d30baf7e8d158019026272831859435160017541ac0296b0644aa","observation_id":"08bf6a57-2fa3-4747-afa6-add27c1398bb","resolution":{"observed_at":"2026-05-15T19:26:31.356452Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":"2503.12645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-07-04T07:29:38.574824Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":"fe62cb1b-f9dc-4379-8586-5c2f591ba7e5","year":2025},"citing_paper":{"arxiv_id":"2604.02505","last_updated":"2026-04-02T21:02:10Z","snapshot_observed_at":"2026-08-12T12:27:48.772037Z","submitted_at":"2026-04-02T21:02:10Z","title":"Optimal Projection-Free Adaptive SGD for Matrix Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T20:56:41.466669Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2604.02505"},"observation_digest":"sha256:1dde4b81aea708536fb9b688c25d1ae4d7c85368c0a4002bc55946ae9ef6f171","observation_id":"d4f427ad-ab0b-44fe-9324-88d058f61489","resolution":{"observed_at":"2026-05-13T20:58:15.724809Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-07-13T10:41:51.251736Z","title":"Dmitry Kovalev","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.04229","last_updated":"2026-04-05T19:08:51Z","snapshot_observed_at":"2026-08-14T15:31:53.970726Z","submitted_at":"2026-04-05T19:08:51Z","title":"Hierarchical Semantic Correlation-Aware Masked Autoencoder for Unsupervised Audio-Visual Representation Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T10:41:51.251736Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2604.04229"},"observation_digest":"sha256:eeea98134f0579d6de47ff17bb8dfc83a26c09627a45296359ddf173c979064c","observation_id":"5644bc27-0c90-4460-8b7f-13fdffb925a8","resolution":{"observed_at":"2026-07-13T10:41:51.251736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":"2503.12645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-07-04T07:29:38.574824Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":"fe62cb1b-f9dc-4379-8586-5c2f591ba7e5","year":2025},"citing_paper":{"arxiv_id":"2604.10689","last_updated":"2026-04-12T15:30:28Z","snapshot_observed_at":"2026-08-14T05:22:29.005328Z","submitted_at":"2026-04-12T15:30:28Z","title":"Communication-Efficient Gluon in Federated Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-10T15:16:15.739456Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2604.10689"},"observation_digest":"sha256:708c6d1b338867be290a6fea976091fbbc94bb6c3ddf903cb05b82ccd7ce37f0","observation_id":"db3811a1-8987-466a-a078-189239afeba2","resolution":{"observed_at":"2026-05-11T10:56:03.238852Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":"2503.12645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-07-04T07:29:38.574824Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":"fe62cb1b-f9dc-4379-8586-5c2f591ba7e5","year":2025},"citing_paper":{"arxiv_id":"2605.06884","last_updated":"2026-05-07T19:32:39Z","snapshot_observed_at":"2026-08-14T00:21:23.410887Z","submitted_at":"2026-05-07T19:32:39Z","title":"Muon with Nesterov Momentum: Heavy-Tailed Noise and (Randomized) Inexact Polar Decomposition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-11T00:54:23.683013Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2605.06884"},"observation_digest":"sha256:cc4e723be0e8834b773753b909760b4b9844438f37a816ae9d28f697cea23f95","observation_id":"68c33c2a-8056-46bc-818c-01ca6e0e7086","resolution":{"observed_at":"2026-05-11T05:00:56.679583Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":"2503.12645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-07-04T07:29:38.574824Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":"fe62cb1b-f9dc-4379-8586-5c2f591ba7e5","year":2025},"citing_paper":{"arxiv_id":"2605.09331","last_updated":"2026-05-10T05:06:07Z","snapshot_observed_at":"2026-08-12T21:27:57.144723Z","submitted_at":"2026-05-10T05:06:07Z","title":"Dimension-Free Saddle-Point Escape in Muon","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T04:38:25.480020Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2605.09331"},"observation_digest":"sha256:3a65733460207a8fb4692f2212e36ec72d6f3ecb4ea75cf2247e52423164b12f","observation_id":"c5e23c37-b1b4-4987-a14c-ec5eacfec255","resolution":{"observed_at":"2026-05-12T06:01:26.384083Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":"2503.12645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-07-04T07:29:38.574824Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":"fe62cb1b-f9dc-4379-8586-5c2f591ba7e5","year":2025},"citing_paper":{"arxiv_id":"2605.10468","last_updated":"2026-05-11T12:34:20Z","snapshot_observed_at":"2026-08-18T00:15:56.488539Z","submitted_at":"2026-05-11T12:34:20Z","title":"Can Muon Fine-tune Adam-Pretrained Models?","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-12T03:53:11.469583Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2605.10468"},"observation_digest":"sha256:6c19ff847bd9cb99e26b476824431088ec38814ee19157fa0a4c0a7ee05ce239","observation_id":"f84eac50-3db7-4eda-937f-962f38444cd5","resolution":{"observed_at":"2026-05-12T06:51:28.816677Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":"2503.12645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-07-04T07:29:38.574824Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":"fe62cb1b-f9dc-4379-8586-5c2f591ba7e5","year":2025},"citing_paper":{"arxiv_id":"2605.11181","last_updated":"2026-05-11T19:42:48Z","snapshot_observed_at":"2026-08-20T09:21:30.141360Z","submitted_at":"2026-05-11T19:42:48Z","title":"Muon is Not That Special: Random or Inverted Spectra Work Just as Well","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-13T04:16:48.332851Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2605.11181"},"observation_digest":"sha256:faf3da2245c940604131a8aa14b67a10ba154879e9ec79027fd05d8370bfb871","observation_id":"2da3c9a3-fd34-4e5b-8432-e89c744aaf97","resolution":{"observed_at":"2026-05-13T04:17:13.744761Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":"2503.12645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-07-04T07:29:38.574824Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":"fe62cb1b-f9dc-4379-8586-5c2f591ba7e5","year":2025},"citing_paper":{"arxiv_id":"2605.11850","last_updated":"2026-05-12T09:36:13Z","snapshot_observed_at":"2026-08-11T10:43:39.565980Z","submitted_at":"2026-05-12T09:36:13Z","title":"Constrained Stochastic Spectral Preconditioning Converges for Nonconvex Objectives","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T05:34:48.195468Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2605.11850"},"observation_digest":"sha256:6229faabfcfee9266b4b835e381e80f0ed3774a62cd0d60d60d7e3acaf82e3a1","observation_id":"27324d75-d6d0-405f-a281-84a770635039","resolution":{"observed_at":"2026-05-13T05:37:19.199758Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":"2503.12645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-07-04T07:29:38.574824Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":"fe62cb1b-f9dc-4379-8586-5c2f591ba7e5","year":2025},"citing_paper":{"arxiv_id":"2605.13079","last_updated":"2026-05-13T06:54:01Z","snapshot_observed_at":"2026-08-13T09:26:44.851794Z","submitted_at":"2026-05-13T06:54:01Z","title":"Spectral Flattening Is All Muon Needs: How Orthogonalization Controls Learning Rate and Convergence","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T19:56:23.124500Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2605.13079"},"observation_digest":"sha256:350cb83c74b2f32a522b45adf52f196ef4a48fb773319542b7cba2148e0c0e1b","observation_id":"cc020d3c-5332-471f-b36b-22789052180e","resolution":{"observed_at":"2026-05-14T19:57:53.124895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":"2503.12645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-07-04T07:29:38.574824Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":"fe62cb1b-f9dc-4379-8586-5c2f591ba7e5","year":2025},"citing_paper":{"arxiv_id":"2605.18106","last_updated":"2026-06-22T06:06:33Z","snapshot_observed_at":"2026-08-14T08:05:42.459480Z","submitted_at":"2026-05-18T09:17:26Z","title":"Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-20T09:34:45.186929Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2605.18106"},"observation_digest":"sha256:bed34035c057249485ab6b1efec029f86f957e5e2a8d17f5e7f941d1bace504e","observation_id":"fc703698-597a-43f9-96c4-149c0f5d0827","resolution":{"observed_at":"2026-05-20T09:38:11.144993Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":"2503.12645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-07-04T07:29:38.574824Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":"fe62cb1b-f9dc-4379-8586-5c2f591ba7e5","year":2025},"citing_paper":{"arxiv_id":"2605.18106","last_updated":"2026-06-22T06:06:33Z","snapshot_observed_at":"2026-08-14T08:05:42.459480Z","submitted_at":"2026-05-18T09:17:26Z","title":"Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers","version":4},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-06-30T18:42:01.854481Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2605.18106"},"observation_digest":"sha256:a68098ec4fd015049db511b941ed05be0509079ff10cd8c09db4b6ad18472599","observation_id":"dd6c9bb4-3fd9-4e3d-a8c6-c59268ee4379","resolution":{"observed_at":"2026-06-30T18:45:00.379916Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":"2503.12645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-07-04T07:29:38.574824Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":"fe62cb1b-f9dc-4379-8586-5c2f591ba7e5","year":2025},"citing_paper":{"arxiv_id":"2605.18174","last_updated":"2026-05-18T10:18:02Z","snapshot_observed_at":"2026-08-15T08:55:48.785673Z","submitted_at":"2026-05-18T10:18:02Z","title":"Ringmaster LMO: Asynchronous Linear Minimization Oracle Momentum Method","version":1},"reference_index":291,"source":"arxiv_source","source_observed_at":"2026-05-20T13:08:52.912250Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2605.18174"},"observation_digest":"sha256:ad166eeca9aa3eeb055f69ed6ee87a8a779e1c40d17bacfea242f6b98ea09665","observation_id":"3ae51170-44fa-4757-bf12-cac193dd8c65","resolution":{"observed_at":"2026-05-20T13:13:18.539911Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":"2503.12645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-07-04T07:29:38.574824Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":"fe62cb1b-f9dc-4379-8586-5c2f591ba7e5","year":2025},"citing_paper":{"arxiv_id":"2605.18528","last_updated":"2026-05-31T14:16:59Z","snapshot_observed_at":"2026-08-16T16:35:20.023880Z","submitted_at":"2026-05-18T15:13:18Z","title":"Scale-Invariant Neural Network Optimization: Norm Geometry and Heavy-Tailed Noise","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-06-30T18:27:40.390908Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2605.18528"},"observation_digest":"sha256:7f314884681c0f400ec82cfa35cf52ad7d89e2934a8fea4d36ae8f4cb68db28f","observation_id":"a48fa612-1c17-4b82-9c88-de12dc58630e","resolution":{"observed_at":"2026-07-01T14:55:48.633794Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":"2503.12645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-07-04T07:29:38.574824Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":"fe62cb1b-f9dc-4379-8586-5c2f591ba7e5","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:387aa1421e0a5f5799565c006341350edb06e9e158aee348b2861090fffd8dfc","observation_id":"e5bdcb5e-c7a0-4ad1-9652-0246994ced76","resolution":{"observed_at":"2026-05-20T08:13:08.332905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":"2503.12645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-07-04T07:29:38.574824Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":"fe62cb1b-f9dc-4379-8586-5c2f591ba7e5","year":2025},"citing_paper":{"arxiv_id":"2605.20866","last_updated":"2026-05-20T08:01:45Z","snapshot_observed_at":"2026-08-13T16:04:20.229116Z","submitted_at":"2026-05-20T08:01:45Z","title":"LOSCAR-SGD: Local SGD with Communication-Computation Overlap and Delay-Corrected Sparse Model Averaging","version":1},"reference_index":292,"source":"arxiv_source","source_observed_at":"2026-05-21T05:49:28.713982Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2605.20866"},"observation_digest":"sha256:8ff3fb0a6d191c27dde4acb7a9f3d40e36a71da4b815d2f95f2e785e336c31b4","observation_id":"f21999a9-1d98-463a-8383-c83f55c8bfbf","resolution":{"observed_at":"2026-05-21T05:49:40.639082Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":"2503.12645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-07-04T07:29:38.574824Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":"fe62cb1b-f9dc-4379-8586-5c2f591ba7e5","year":2025},"citing_paper":{"arxiv_id":"2605.23871","last_updated":"2026-05-22T17:28:53Z","snapshot_observed_at":"2026-08-19T17:46:20.022039Z","submitted_at":"2026-05-22T17:28:53Z","title":"Move on Muon : A Hamiltonian probability gradient flow perspective of Muon optimizer","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-25T02:56:18.035759Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2605.23871"},"observation_digest":"sha256:482f2c8ae5b7eac45c87f83d44ac20b0565d8dd3ded5cf5ca19b301ecb612bb0","observation_id":"a9e57df4-e912-4f7a-a6c6-13c2da87d407","resolution":{"observed_at":"2026-05-25T02:56:33.542117Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":"2503.12645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-07-04T07:29:38.574824Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":"fe62cb1b-f9dc-4379-8586-5c2f591ba7e5","year":2025},"citing_paper":{"arxiv_id":"2606.03899","last_updated":"2026-06-03T02:06:07Z","snapshot_observed_at":"2026-08-13T15:26:53.742695Z","submitted_at":"2026-06-02T16:54:38Z","title":"Denoise First, Orthogonalize Later: Understanding Momentum in Muon via Spectral Filtering","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T11:24:38.292078Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2606.03899"},"observation_digest":"sha256:b579cff9a4208d4197a499886eeb5c95acc28c4697408a4cd5e04be605e6a90a","observation_id":"d1b21808-3b1a-460c-a8c0-61c11dbe8459","resolution":{"observed_at":"2026-07-02T01:56:27.803949Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":"2503.12645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-07-04T07:29:38.574824Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":"fe62cb1b-f9dc-4379-8586-5c2f591ba7e5","year":2025},"citing_paper":{"arxiv_id":"2606.04662","last_updated":"2026-06-03T09:40:30Z","snapshot_observed_at":"2026-08-21T04:14:31.253279Z","submitted_at":"2026-06-03T09:40:30Z","title":"Why Muon Outperforms Adam: A Curvature Perspective","version":1},"reference_index":158,"source":"arxiv_source","source_observed_at":"2026-06-28T07:04:21.012269Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2606.04662"},"observation_digest":"sha256:798b93904512eb13969acfa1de88dca97e0ccc6327755880089baeda3f9c5d33","observation_id":"d15c3da6-790d-4fde-9e38-517bc61fda1d","resolution":{"observed_at":"2026-07-02T07:16:44.401048Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":"2503.12645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-07-04T07:29:38.574824Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":"fe62cb1b-f9dc-4379-8586-5c2f591ba7e5","year":2025},"citing_paper":{"arxiv_id":"2606.06418","last_updated":"2026-06-04T17:22:58Z","snapshot_observed_at":"2026-08-16T10:17:57.703806Z","submitted_at":"2026-06-04T17:22:58Z","title":"Double Preconditioning (DoPr): Optimization for Test-Time Performance, not Validation Loss","version":1},"reference_index":174,"source":"arxiv_source","source_observed_at":"2026-06-28T02:35:39.845487Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2606.06418"},"observation_digest":"sha256:9e13999c1b6743892b7d83dbeb61b32cb72b0814246196e0870c186b1f896824","observation_id":"a6d4c29e-6ceb-4b6d-b6e2-277b35a6c2aa","resolution":{"observed_at":"2026-07-02T11:56:55.972612Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":"2503.12645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-07-04T07:29:38.574824Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":"fe62cb1b-f9dc-4379-8586-5c2f591ba7e5","year":2025},"citing_paper":{"arxiv_id":"2606.09658","last_updated":"2026-06-08T15:42:54Z","snapshot_observed_at":"2026-08-12T20:25:49.594664Z","submitted_at":"2026-06-08T15:42:54Z","title":"Muon Learns More Robust and Transferable Features than Adam","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-06-27T17:08:30.717799Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2606.09658"},"observation_digest":"sha256:67e2c72fa5725e63ff4a78ae2fdf2d6fee5aa89d5db7345e0237d1960dd7e8d7","observation_id":"9a7b1be7-92a7-45b0-8396-c61ef473872c","resolution":{"observed_at":"2026-07-03T00:27:30.190097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":"2503.12645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-07-04T07:29:38.574824Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":"fe62cb1b-f9dc-4379-8586-5c2f591ba7e5","year":2025},"citing_paper":{"arxiv_id":"2606.21354","last_updated":"2026-06-19T11:54:49Z","snapshot_observed_at":"2026-07-06T23:56:21.824303Z","submitted_at":"2026-06-19T11:54:49Z","title":"Restart and Adaptive Acceleration in Stochastic Gradient Methods","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-26T14:00:19.385619Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2606.21354"},"observation_digest":"sha256:9537e5b2866a4bbb75690dfa270b42b3ba198e1596ca12b528c90c09e3cad9e2","observation_id":"a83a9502-bad2-4dd0-ac1c-c4ee563acc12","resolution":{"observed_at":"2026-07-04T06:59:37.581655Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":"2503.12645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-07-04T07:29:38.574824Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":"fe62cb1b-f9dc-4379-8586-5c2f591ba7e5","year":2025},"citing_paper":{"arxiv_id":"2606.21581","last_updated":"2026-06-19T16:36:53Z","snapshot_observed_at":"2026-07-06T23:56:35.743669Z","submitted_at":"2026-06-19T16:36:53Z","title":"Convergence Analysis of Muon-type Methods with Inexact LMO in the Degenerate Case","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-26T13:28:36.618788Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2606.21581"},"observation_digest":"sha256:b911562f0f6fd8e0aba938fd3e555472a5634ad0aadd05fe7a4fb49bab51388a","observation_id":"27877e57-6a11-4f20-8e68-4525bcd92350","resolution":{"observed_at":"2026-07-04T07:29:38.576286Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":"2503.12645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-07-04T07:29:38.574824Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":"fe62cb1b-f9dc-4379-8586-5c2f591ba7e5","year":2025},"citing_paper":{"arxiv_id":"2606.30634","last_updated":"2026-06-29T17:57:50Z","snapshot_observed_at":"2026-08-08T07:12:14.083887Z","submitted_at":"2026-06-29T17:57:50Z","title":"One-Step Gradient Delay is Not a Barrier for Large-Scale Asynchronous Pipeline Parallel LLM Pretraining","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T06:41:55.732230Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2606.30634"},"observation_digest":"sha256:2d93893832f44feb90cf55902dcee45eeb522e6e157ea86c880d0a367f3321f1","observation_id":"d81577a1-d2f5-4d0a-a6e7-1d7e99935950","resolution":{"observed_at":"2026-06-30T06:44:18.874749Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":"2503.12645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-07-04T07:29:38.574824Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":"fe62cb1b-f9dc-4379-8586-5c2f591ba7e5","year":2025},"citing_paper":{"arxiv_id":"2607.01124","last_updated":"2026-07-01T16:12:24Z","snapshot_observed_at":"2026-08-13T09:43:21.024056Z","submitted_at":"2026-07-01T16:12:24Z","title":"Muon as a Residual Connection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-02T15:39:06.013130Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2607.01124"},"observation_digest":"sha256:89a769996403a441b3bd68a33216e93b71f10338ed105364b2de9be7c204aa36","observation_id":"90e3855b-ec5b-4461-bb0d-7df4849b25c5","resolution":{"observed_at":"2026-07-02T15:47:05.787269Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":"2503.12645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-07-04T07:29:38.574824Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":"fe62cb1b-f9dc-4379-8586-5c2f591ba7e5","year":2025},"citing_paper":{"arxiv_id":"2607.01487","last_updated":"2026-07-01T21:32:14Z","snapshot_observed_at":"2026-08-14T08:13:08.765869Z","submitted_at":"2026-07-01T21:32:14Z","title":"How to Allocate Your Tokens? Scaling Laws with Training Steps and Batch Size","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-03T21:02:31.246432Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2607.01487"},"observation_digest":"sha256:85e10081c4535a70af114d58928266777eceec312e1f6c83d2500c19ac261714","observation_id":"0fdde877-86a3-400f-b3c7-77b547e89579","resolution":{"observed_at":"2026-07-03T21:08:57.594636Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-08-02T05:49:20.095841Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13246","last_updated":"2026-08-01T19:18:42Z","snapshot_observed_at":"2026-08-17T22:30:33.654823Z","submitted_at":"2026-07-14T20:21:38Z","title":"Reassessing Muon for Matrix Factorization","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-02T05:49:20.095841Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2607.13246"},"observation_digest":"sha256:a8b7629b2af0b7912960e00bcb066954d444f6cc9bd064804f372568a756d67d","observation_id":"286bd7cf-619e-4dde-b067-ce118df92e4b","resolution":{"observed_at":"2026-08-02T05:49:20.095841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-08-02T05:49:29.127140Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13246","last_updated":"2026-08-01T19:18:42Z","snapshot_observed_at":"2026-08-17T22:30:33.654823Z","submitted_at":"2026-07-14T20:21:38Z","title":"Reassessing Muon for Matrix Factorization","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-02T05:49:29.127140Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2607.13246"},"observation_digest":"sha256:c3a98e6bccf168cc699d98999ece846c30b7efdccc479ab74a8b4f03639ef7a3","observation_id":"83163206-68a5-4987-a452-0f8b275f4bbc","resolution":{"observed_at":"2026-08-02T05:49:29.127140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-08-04T04:22:57.127991Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13246","last_updated":"2026-08-01T19:18:42Z","snapshot_observed_at":"2026-08-17T22:30:33.654823Z","submitted_at":"2026-07-14T20:21:38Z","title":"Reassessing Muon for Matrix Factorization","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T04:22:57.127991Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2607.13246"},"observation_digest":"sha256:d84ee5134c9985e3b8003563f048fe7e1c4ae4c959a2147447b01c33c040d0fd","observation_id":"f121ad90-f4bb-4347-be89-68b31afbfc2e","resolution":{"observed_at":"2026-08-04T04:22:57.127991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-08-04T04:23:03.940072Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13246","last_updated":"2026-08-01T19:18:42Z","snapshot_observed_at":"2026-08-17T22:30:33.654823Z","submitted_at":"2026-07-14T20:21:38Z","title":"Reassessing Muon for Matrix Factorization","version":2},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-04T04:23:03.940072Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2607.13246"},"observation_digest":"sha256:1e3d78b9b80a3aabbb0cd2bb4da140a4e5f4b98d03f0aff6dd5c197ecc45da56","observation_id":"ce417a14-eb4d-400d-8945-4f731974707c","resolution":{"observed_at":"2026-08-04T04:23:03.940072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-08-03T02:09:01.948787Z","title":"InProceedings of the 36th Inter- national Conference on Machine Learning, volume 97 of Proceedings of Machine Learning Research, 3252–3261","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29674","last_updated":"2026-07-31T17:54:46Z","snapshot_observed_at":"2026-08-15T23:58:54.031853Z","submitted_at":"2026-07-31T17:54:46Z","title":"Sign compression for Muon: SignMuon, MuonSign, and the Limits of Error Feedback","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-03T02:09:01.948787Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2607.29674"},"observation_digest":"sha256:6289706e3e4ac81d42ad7fe75ef227122a777c19116daa271ec3bbc058e7d241","observation_id":"9fd80c70-3004-4e13-a6ce-3a669fbf97e4","resolution":{"observed_at":"2026-08-03T02:09:01.948787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-08-04T18:34:20.692665Z","title":"Understanding gradient orthogonalization for deep learning via Non-Euclidean trust-region optimization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01911","last_updated":"2026-08-03T08:45:15Z","snapshot_observed_at":"2026-08-14T10:15:00.672630Z","submitted_at":"2026-08-03T08:45:15Z","title":"A Continuous-Time Analysis of Smoothed Matrix-Polar Spectral Gradient Flows for Muon-Type Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T18:34:20.692665Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2608.01911"},"observation_digest":"sha256:6e08413ca1ce942bbe97b5c702cbf976a301c5fc934bc8faf9f6db8c9d63128a","observation_id":"cac7645d-81c6-4c70-a7d9-f8b90b295011","resolution":{"observed_at":"2026-08-04T18:34:20.692665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-08-16T01:10:04.430235Z","title":"Understanding gradient orthogonalization for deep learning via non-euclidean trust-region optimization.arXiv preprint arXiv:2503.12645,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12710","last_updated":"2026-08-18T06:18:40Z","snapshot_observed_at":"2026-08-21T23:10:49.916847Z","submitted_at":"2026-08-13T01:46:26Z","title":"Federated Compositional Muon Optimizer for Matrix-Wise Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T01:10:04.430235Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2608.12710"},"observation_digest":"sha256:52f81e018acd777a5b824353f84fe1995d3aa3660dd9b48f8151cc14ae83174d","observation_id":"6192ee82-19e9-4df3-ac41-20cae44fb588","resolution":{"observed_at":"2026-08-16T01:10:04.430235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2503.12645/citation-record","integrity":"/paper/2503.12645/integrity","json":"/paper/2503.12645/citation-record.json","paper":"/paper/2503.12645"},"outbound":[],"paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 45 inbound Pith citation observations for arXiv:2503.12645."}