{"as_of":"2026-08-05T15:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:661e5525560c75ea17c6e2221cb6aff16c0cb8fdaf5dd91c672d19641a245d2f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":30,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T11:25:45.045809Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T17:36:25.409899Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-08-05T11:25:45.045809Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02981","last_updated":"2025-09-06T21:55:53Z","snapshot_observed_at":"2026-08-05T11:25:44.295557Z","submitted_at":"2025-09-03T03:42:22Z","title":"AdaGrad Meets Muon: Adaptive Stepsizes for Orthogonal Updates","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:45.045809Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2509.02981"},"observation_digest":"sha256:f805202d270b42d356a0c33a8c37cf7813b6864a4aff8abbd221194c770b7176","observation_id":"86af1c9f-556c-48ca-943c-896c458b9206","resolution":{"observed_at":"2026-08-05T11:25:45.045809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":"2505.02222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-07-09T17:36:25.409899Z","title":"arXiv preprint arXiv:2505.02222 , year=","venue":"cs.LG","work_id":"3b5f21a7-2f9f-4001-bba4-8f7b7f0468f4","year":2025},"citing_paper":{"arxiv_id":"2509.11983","last_updated":"2026-04-19T16:56:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-15T14:28:53Z","title":"Low-rank Orthogonalization for Large-scale Matrix Optimization with Applications to Foundation Model Training","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T15:48:43.422716Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2509.11983"},"observation_digest":"sha256:96bf6d063684f769f32148c74a424605b6559bb6c30f609ef0526c659c4f34a0","observation_id":"3ef161de-d686-4f44-acaf-fee6a21ce99a","resolution":{"observed_at":"2026-05-18T15:51:34.006458Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":"2505.02222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-07-09T17:36:25.409899Z","title":"arXiv preprint arXiv:2505.02222 , year=","venue":"cs.LG","work_id":"3b5f21a7-2f9f-4001-bba4-8f7b7f0468f4","year":2025},"citing_paper":{"arxiv_id":"2509.15816","last_updated":"2026-05-10T06:58:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T09:43:37Z","title":"On the Convergence of Muon and Beyond","version":5},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-18T15:56:30.602824Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2509.15816"},"observation_digest":"sha256:6e3ff021c1b4ab02a9613075a0c39c56171921f3ce3f5f96b805043c4b02f15a","observation_id":"aafa7f7b-ac99-401a-bd7f-0abe23f8a46b","resolution":{"observed_at":"2026-05-18T15:56:34.043222Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-08-03T18:37:49.619202Z","title":"Prac- tical efficiency of muon for pretraining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04632","last_updated":"2026-07-06T09:24:33Z","snapshot_observed_at":"2026-08-03T18:37:48.859151Z","submitted_at":"2025-12-04T10:06:22Z","title":"Turbo-Muon: Almost-Orthogonal Pre-Conditioning for Fast Muon Updates","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:49.619202Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2512.04632"},"observation_digest":"sha256:b5fca8cb5604af0bde3d9318061e0039ecff5b80191462e493020d61ac86471f","observation_id":"55a7b33f-d76b-44ca-9ad5-5b8da9da975d","resolution":{"observed_at":"2026-08-03T18:37:49.619202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":"2505.02222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-07-09T17:36:25.409899Z","title":"arXiv preprint arXiv:2505.02222 , year=","venue":"cs.LG","work_id":"3b5f21a7-2f9f-4001-bba4-8f7b7f0468f4","year":2025},"citing_paper":{"arxiv_id":"2603.10067","last_updated":"2026-05-21T20:35:00Z","snapshot_observed_at":"2026-07-06T22:48:35.345421Z","submitted_at":"2026-03-10T02:12:24Z","title":"HTMuon: Improving Muon via Heavy-Tailed Spectral Correction","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-25T06:50:29.893126Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2603.10067"},"observation_digest":"sha256:4e193db92f2bf25002fbf4beaa29e85d949cbe8a2899258c8114e07cdc14f88d","observation_id":"6d9c33b0-99ee-4795-8c89-42204078306f","resolution":{"observed_at":"2026-05-25T06:55:26.326911Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":"2505.02222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-07-09T17:36:25.409899Z","title":"arXiv preprint arXiv:2505.02222 , year=","venue":"cs.LG","work_id":"3b5f21a7-2f9f-4001-bba4-8f7b7f0468f4","year":2025},"citing_paper":{"arxiv_id":"2603.28254","last_updated":"2026-05-10T06:51:11Z","snapshot_observed_at":"2026-07-06T22:51:05.074191Z","submitted_at":"2026-03-30T10:28:18Z","title":"MuonEq: Balancing Before Orthogonalization with Lightweight Equilibration","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-14T21:12:32.579136Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2603.28254"},"observation_digest":"sha256:0cbca536d30538c2190e736a3cb65015ac7adc550f91c65651f347eba30c8b23","observation_id":"cac04a5f-9adf-47aa-9d8b-26599e1f7b3e","resolution":{"observed_at":"2026-05-14T21:12:58.520493Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":"2505.02222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-07-09T17:36:25.409899Z","title":"arXiv preprint arXiv:2505.02222 , year=","venue":"cs.LG","work_id":"3b5f21a7-2f9f-4001-bba4-8f7b7f0468f4","year":2025},"citing_paper":{"arxiv_id":"2605.06615","last_updated":"2026-05-07T17:32:09Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:32:09Z","title":"When and Why SignSGD Outperforms SGD: A Theoretical Study Based on $\\ell_1$-norm Lower Bounds","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T12:14:28.866499Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2605.06615"},"observation_digest":"sha256:bca9751ba844269482e15962f34b62989fd2b0b419f752fa31a0f6afb4722238","observation_id":"b248fa8f-4d4a-41aa-a97f-0d83363b8073","resolution":{"observed_at":"2026-05-11T19:21:07.621850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":"2505.02222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-07-09T17:36:25.409899Z","title":"arXiv preprint arXiv:2505.02222 , year=","venue":"cs.LG","work_id":"3b5f21a7-2f9f-4001-bba4-8f7b7f0468f4","year":2025},"citing_paper":{"arxiv_id":"2605.09552","last_updated":"2026-05-10T14:11:22Z","snapshot_observed_at":"2026-07-06T23:21:39.966502Z","submitted_at":"2026-05-10T14:11:22Z","title":"Phases of Muon: When Muon Eclipses SignSGD","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-12T04:05:08.899876Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2605.09552"},"observation_digest":"sha256:b0d6914081b7a0f84a2f9a556503c84f6d1b3b67366b9cefe7ba511b7b693a72","observation_id":"48ed429a-230b-44cc-89b7-b686921bc1e4","resolution":{"observed_at":"2026-05-12T06:41:28.527213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":"2505.02222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-07-09T17:36:25.409899Z","title":"arXiv preprint arXiv:2505.02222 , year=","venue":"cs.LG","work_id":"3b5f21a7-2f9f-4001-bba4-8f7b7f0468f4","year":2025},"citing_paper":{"arxiv_id":"2605.10468","last_updated":"2026-05-11T12:34:20Z","snapshot_observed_at":"2026-07-06T23:22:28.318343Z","submitted_at":"2026-05-11T12:34:20Z","title":"Can Muon Fine-tune Adam-Pretrained Models?","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-12T03:53:11.469583Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2605.10468"},"observation_digest":"sha256:187ff22294cd8d0ab71fc515e4f4105ed2d48a3b918f6c27dd05f703cd66315a","observation_id":"bd2fbc96-4e95-4d56-8ad2-9384536099b7","resolution":{"observed_at":"2026-05-12T06:51:28.805735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":"2505.02222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-07-09T17:36:25.409899Z","title":"arXiv preprint arXiv:2505.02222 , year=","venue":"cs.LG","work_id":"3b5f21a7-2f9f-4001-bba4-8f7b7f0468f4","year":2025},"citing_paper":{"arxiv_id":"2605.11838","last_updated":"2026-05-12T09:24:59Z","snapshot_observed_at":"2026-07-06T23:23:34.924221Z","submitted_at":"2026-05-12T09:24:59Z","title":"Gradient Clipping Beyond Vector Norms: A Spectral Approach for Matrix-Valued Parameters","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-13T07:01:37.086159Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2605.11838"},"observation_digest":"sha256:a76270fd4a245897f35658ff7f5f6d53707d4ecc10f48f9ccd76fd51c596808b","observation_id":"420bef66-0725-4256-8409-9f33221fc793","resolution":{"observed_at":"2026-05-13T07:02:27.357102Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":"2505.02222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-07-09T17:36:25.409899Z","title":"arXiv preprint arXiv:2505.02222 , year=","venue":"cs.LG","work_id":"3b5f21a7-2f9f-4001-bba4-8f7b7f0468f4","year":2025},"citing_paper":{"arxiv_id":"2605.13405","last_updated":"2026-05-13T12:00:11Z","snapshot_observed_at":"2026-07-06T23:24:57.051440Z","submitted_at":"2026-05-13T12:00:11Z","title":"When is Warmstarting Effective for Scaling Language Models?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T20:00:47.126736Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2605.13405"},"observation_digest":"sha256:dce62a339fb20a438e9077a5b10336be7eea04a0e1d41e02c0b8fb3fc75d2b97","observation_id":"c018810f-77f1-493e-b2f7-79b864874de0","resolution":{"observed_at":"2026-05-14T20:02:53.040706Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":"2505.02222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-07-09T17:36:25.409899Z","title":"arXiv preprint arXiv:2505.02222 , year=","venue":"cs.LG","work_id":"3b5f21a7-2f9f-4001-bba4-8f7b7f0468f4","year":2025},"citing_paper":{"arxiv_id":"2605.15622","last_updated":"2026-05-18T07:21:10Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T05:11:43Z","title":"Position: Zeroth-Order Optimization in Deep Learning Is Underexplored, Not Underpowered","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-20T21:19:55.074853Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2605.15622"},"observation_digest":"sha256:256d2fe896878cbf07313a4ed24552646aee93aab04fe766bc303c78944cdc06","observation_id":"7247fd3d-6627-4a75-82b8-51ba5fc2a570","resolution":{"observed_at":"2026-05-20T21:23:44.493653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":"2505.02222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-07-09T17:36:25.409899Z","title":"arXiv preprint arXiv:2505.02222 , year=","venue":"cs.LG","work_id":"3b5f21a7-2f9f-4001-bba4-8f7b7f0468f4","year":2025},"citing_paper":{"arxiv_id":"2605.18106","last_updated":"2026-06-22T06:06:33Z","snapshot_observed_at":"2026-07-06T23:28:59.503300Z","submitted_at":"2026-05-18T09:17:26Z","title":"Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T09:34:45.186929Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2605.18106"},"observation_digest":"sha256:6ffd69292ff5b02472081f387b98d5a7f086da2155b414c2b298df13cb08dc4c","observation_id":"9031b060-fdf4-48ba-8c8e-4971ac5fbb20","resolution":{"observed_at":"2026-05-20T09:38:10.928442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":"2505.02222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-07-09T17:36:25.409899Z","title":"arXiv preprint arXiv:2505.02222 , year=","venue":"cs.LG","work_id":"3b5f21a7-2f9f-4001-bba4-8f7b7f0468f4","year":2025},"citing_paper":{"arxiv_id":"2605.18106","last_updated":"2026-06-22T06:06:33Z","snapshot_observed_at":"2026-07-06T23:28:59.503300Z","submitted_at":"2026-05-18T09:17:26Z","title":"Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-30T18:42:01.854481Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2605.18106"},"observation_digest":"sha256:3d8783845f2af58af4542e351995a9b8b49166628fb3a0370b81a24f497ffa66","observation_id":"493da623-a6a5-4612-aa59-7e9f5008a1e2","resolution":{"observed_at":"2026-06-30T18:45:00.387167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":"2505.02222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-07-09T17:36:25.409899Z","title":"arXiv preprint arXiv:2505.02222 , year=","venue":"cs.LG","work_id":"3b5f21a7-2f9f-4001-bba4-8f7b7f0468f4","year":2025},"citing_paper":{"arxiv_id":"2605.26977","last_updated":"2026-05-26T13:02:49Z","snapshot_observed_at":"2026-08-02T02:22:20.158215Z","submitted_at":"2026-05-26T13:02:49Z","title":"Convergence of Spectral Descent for Non-smooth Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T19:30:04.244636Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2605.26977"},"observation_digest":"sha256:dc03aca20b7f6bc4492c35ba7d49a4ff108223f3a28fb54d837d302af7cccc92","observation_id":"1f15c100-c103-4bf7-9083-45f1c8292186","resolution":{"observed_at":"2026-06-29T19:33:53.990160Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":"2505.02222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-07-09T17:36:25.409899Z","title":"arXiv preprint arXiv:2505.02222 , year=","venue":"cs.LG","work_id":"3b5f21a7-2f9f-4001-bba4-8f7b7f0468f4","year":2025},"citing_paper":{"arxiv_id":"2606.04662","last_updated":"2026-06-03T09:40:30Z","snapshot_observed_at":"2026-07-06T23:44:42.700120Z","submitted_at":"2026-06-03T09:40:30Z","title":"Why Muon Outperforms Adam: A Curvature Perspective","version":1},"reference_index":182,"source":"arxiv_source","source_observed_at":"2026-06-28T07:04:21.012269Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2606.04662"},"observation_digest":"sha256:0ee944b58e25699b287f4e078a693a0b0cf0b55f04c712255c40c0457a937e48","observation_id":"1ac60fa5-4485-416f-9551-ad5095cc62aa","resolution":{"observed_at":"2026-07-02T07:16:44.450405Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":"2505.02222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-07-09T17:36:25.409899Z","title":"arXiv preprint arXiv:2505.02222 , year=","venue":"cs.LG","work_id":"3b5f21a7-2f9f-4001-bba4-8f7b7f0468f4","year":2025},"citing_paper":{"arxiv_id":"2606.08783","last_updated":"2026-06-26T09:55:08Z","snapshot_observed_at":"2026-07-06T23:48:11.819398Z","submitted_at":"2026-06-07T18:59:24Z","title":"OptMuon: Closed-Loop Orthogonalized Momentum Methods for Stochastic Optimization with Zero-Noise Optimality","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-27T17:47:21.377462Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2606.08783"},"observation_digest":"sha256:4051e4b2a8529fac6c4c00c12160a72c77b779fa6854ed7aee646338f4c4ce0c","observation_id":"9f62a87d-8f49-4b2f-a4b7-8f49c3f400fe","resolution":{"observed_at":"2026-07-02T23:47:28.517476Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":"2505.02222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-07-09T17:36:25.409899Z","title":"arXiv preprint arXiv:2505.02222 , year=","venue":"cs.LG","work_id":"3b5f21a7-2f9f-4001-bba4-8f7b7f0468f4","year":2025},"citing_paper":{"arxiv_id":"2606.08783","last_updated":"2026-06-26T09:55:08Z","snapshot_observed_at":"2026-07-06T23:48:11.819398Z","submitted_at":"2026-06-07T18:59:24Z","title":"OptMuon: Closed-Loop Orthogonalized Momentum Methods for Stochastic Optimization with Zero-Noise Optimality","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-06-29T05:33:27.870787Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2606.08783"},"observation_digest":"sha256:0dca6e043d25bfab642d029cf07abd506dabdb4462921764dd69985b7bcab946","observation_id":"63d0d553-5048-43ec-ac3c-81872faf0db6","resolution":{"observed_at":"2026-06-29T05:43:08.844851Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":"2505.02222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-07-09T17:36:25.409899Z","title":"arXiv preprint arXiv:2505.02222 , year=","venue":"cs.LG","work_id":"3b5f21a7-2f9f-4001-bba4-8f7b7f0468f4","year":2025},"citing_paper":{"arxiv_id":"2606.09658","last_updated":"2026-06-08T15:42:54Z","snapshot_observed_at":"2026-07-06T23:48:58.206424Z","submitted_at":"2026-06-08T15:42:54Z","title":"Muon Learns More Robust and Transferable Features than Adam","version":1},"reference_index":132,"source":"arxiv_source","source_observed_at":"2026-06-27T17:08:30.717799Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2606.09658"},"observation_digest":"sha256:49c63a87270464171249b58a42142c288abf9daec355a40d3d5a236b1d01a399","observation_id":"077a3478-dcd3-437f-a958-bb5b14d30788","resolution":{"observed_at":"2026-07-03T00:27:30.130549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":"2505.02222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-07-09T17:36:25.409899Z","title":"arXiv preprint arXiv:2505.02222 , year=","venue":"cs.LG","work_id":"3b5f21a7-2f9f-4001-bba4-8f7b7f0468f4","year":2025},"citing_paper":{"arxiv_id":"2606.21514","last_updated":"2026-06-19T15:10:20Z","snapshot_observed_at":"2026-07-06T23:56:31.454439Z","submitted_at":"2026-06-19T15:10:20Z","title":"Towards Understanding the Power and Limits of the Muon Optimizer: A River-Valley Perspective","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T14:22:54.988008Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2606.21514"},"observation_digest":"sha256:d81fbe80c8573ef1f734b8a112b8201c67259fd0d9b0130a021c90a727734866","observation_id":"f59b7dc6-7b80-43ff-8e49-ece95ba2844f","resolution":{"observed_at":"2026-07-04T06:29:38.189992Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":"2505.02222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-07-09T17:36:25.409899Z","title":"arXiv preprint arXiv:2505.02222 , year=","venue":"cs.LG","work_id":"3b5f21a7-2f9f-4001-bba4-8f7b7f0468f4","year":2025},"citing_paper":{"arxiv_id":"2606.23676","last_updated":"2026-06-22T17:58:52Z","snapshot_observed_at":"2026-08-02T19:09:38.605644Z","submitted_at":"2026-06-22T17:58:52Z","title":"Open Problem: Is AdamW Effective Under Heavy-Tailed Noise?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T09:08:41.993925Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2606.23676"},"observation_digest":"sha256:61ef7f7684b9cf2213fac7b59ecb727aa62172b84c68ea57af6a79ee411a539d","observation_id":"cd343fc2-81e3-4ddd-b42d-60e320a176f8","resolution":{"observed_at":"2026-07-04T10:09:44.613631Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":"2505.02222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-07-09T17:36:25.409899Z","title":"arXiv preprint arXiv:2505.02222 , year=","venue":"cs.LG","work_id":"3b5f21a7-2f9f-4001-bba4-8f7b7f0468f4","year":2025},"citing_paper":{"arxiv_id":"2607.01487","last_updated":"2026-07-01T21:32:14Z","snapshot_observed_at":"2026-07-07T00:07:04.211507Z","submitted_at":"2026-07-01T21:32:14Z","title":"How to Allocate Your Tokens? Scaling Laws with Training Steps and Batch Size","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-03T21:02:31.246432Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2607.01487"},"observation_digest":"sha256:c0e7b7f5769920e45443ca4f72f3e5d9c65b6780d26daee1e11fa10471ba8251","observation_id":"2954d78b-de09-40f5-a97c-39033652430e","resolution":{"observed_at":"2026-07-03T21:08:57.605111Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":"2505.02222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-07-09T17:36:25.409899Z","title":"arXiv preprint arXiv:2505.02222 , year=","venue":"cs.LG","work_id":"3b5f21a7-2f9f-4001-bba4-8f7b7f0468f4","year":2025},"citing_paper":{"arxiv_id":"2607.05895","last_updated":"2026-07-07T06:45:39Z","snapshot_observed_at":"2026-08-01T23:21:56.130892Z","submitted_at":"2026-07-07T06:45:39Z","title":"MatrixFSDP: communication-free matrix optimizers under ZeRO-3 parameter sharding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-08T21:33:20.705837Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2607.05895"},"observation_digest":"sha256:e7e1eeda827515bc1b148bb652517ffd7f630dd3ff902ea5f3977bf9dd16b2d0","observation_id":"82943d8c-eea0-4b23-9d70-919c72525ebb","resolution":{"observed_at":"2026-07-08T21:35:37.636034Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-07-14T15:58:18.828589Z","title":"Roger Fletcher","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.06723","last_updated":"2026-07-12T05:07:25Z","snapshot_observed_at":"2026-08-04T16:27:32.434694Z","submitted_at":"2026-07-07T18:42:00Z","title":"Optimization Geometrodynamics: Variational Reduction and Interaction Curvature","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T15:58:18.828589Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2607.06723"},"observation_digest":"sha256:cff96939e4d6f2f670e66e0844b268c99f638f50b90c5ab97aad996a6e7b7fd1","observation_id":"e056ac96-d5d7-43fe-bb66-cb01ce86a97a","resolution":{"observed_at":"2026-07-14T15:58:18.828589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":"2505.02222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-07-09T17:36:25.409899Z","title":"arXiv preprint arXiv:2505.02222 , year=","venue":"cs.LG","work_id":"3b5f21a7-2f9f-4001-bba4-8f7b7f0468f4","year":2025},"citing_paper":{"arxiv_id":"2607.07206","last_updated":"2026-07-11T18:06:27Z","snapshot_observed_at":"2026-07-31T02:44:27.308999Z","submitted_at":"2026-07-08T09:40:44Z","title":"Causal Optimizer Interaction Calculus: Hidden Geometric Relaxation and Identifiable Interventions","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-07-09T17:31:09.270342Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2607.07206"},"observation_digest":"sha256:8374f420250d30278aa6e13851d3e970a7d64eb81e011d9ac0a463a9ae7dc7a1","observation_id":"a28e6426-abd1-451c-8c1d-9a247fbde7ab","resolution":{"observed_at":"2026-07-09T17:36:25.411591Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-07-14T15:50:41.329016Z","title":"Polloreno, Karl Stratos, Philip Monk, Adarsh Chaluvaraju, Andrew Hojel, Andrew Ma, Anil Thomas, Ashish Tanwer, Darsh J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07206","last_updated":"2026-07-11T18:06:27Z","snapshot_observed_at":"2026-07-31T02:44:27.308999Z","submitted_at":"2026-07-08T09:40:44Z","title":"Causal Optimizer Interaction Calculus: Hidden Geometric Relaxation and Identifiable Interventions","version":2},"reference_index":150,"source":"arxiv_source","source_observed_at":"2026-07-14T15:50:41.329016Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2607.07206"},"observation_digest":"sha256:9ab3056f1c66ba380138b9ba05c6dbcbe1f858a51a4c5ca70b150e7de7583713","observation_id":"776cfd60-13c9-4da7-9080-7130a0e77bf7","resolution":{"observed_at":"2026-07-14T15:50:41.329016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-08-02T05:49:19.457536Z","title":"Polloreno and Karl Stratos and Philip Monk and Adarsh Chaluvaraju and Andrew Hojel and Andrew Ma and Anil Thomas and Ashish Tanwer and Darsh J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13246","last_updated":"2026-08-01T19:18:42Z","snapshot_observed_at":"2026-08-05T14:41:09.994091Z","submitted_at":"2026-07-14T20:21:38Z","title":"Reassessing Muon for Matrix Factorization","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-02T05:49:19.457536Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2607.13246"},"observation_digest":"sha256:c9dc32d6b73cef5cd226fba7ed5e712fe4e8e3ca50b26859a5d7198ced7fa438","observation_id":"8ae89e6d-1844-456a-9a82-9db356e79d87","resolution":{"observed_at":"2026-08-02T05:49:19.457536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-08-04T04:22:56.743147Z","title":"Polloreno and Karl Stratos and Philip Monk and Adarsh Chaluvaraju and Andrew Hojel and Andrew Ma and Anil Thomas and Ashish Tanwer and Darsh J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13246","last_updated":"2026-08-01T19:18:42Z","snapshot_observed_at":"2026-08-05T14:41:09.994091Z","submitted_at":"2026-07-14T20:21:38Z","title":"Reassessing Muon for Matrix Factorization","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T04:22:56.743147Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2607.13246"},"observation_digest":"sha256:8ad06bab86033426de8da2f61679f0ad53773a7b715017c9c0d9b1961e445ba9","observation_id":"366f1d69-2de7-4786-ac7d-149cc0e6f122","resolution":{"observed_at":"2026-08-04T04:22:56.743147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-08-02T01:58:57.151505Z","title":"Practical efficiency of muon for pretraining.arXiv preprint arXiv:2505.02222,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14536","last_updated":"2026-07-16T03:42:21Z","snapshot_observed_at":"2026-08-05T09:35:42.737107Z","submitted_at":"2026-07-16T03:42:21Z","title":"Muse: Representation Geometry of Muon Beyond Normalized Momentum","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T01:58:57.151505Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2607.14536"},"observation_digest":"sha256:a05328ee846784adb82bd7ef785d8f8a7c9e2fe9562423601f195c48f00bdbff","observation_id":"9ac3607e-eab5-45bc-861b-281d26212261","resolution":{"observed_at":"2026-08-02T01:58:57.151505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02222","snapshot_observed_at":"2026-08-02T06:45:11.255675Z","title":"Practical efficiency of muon for pretraining.arXiv preprint arXiv:2505.02222, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:11.255675Z"},"links":{"cited_paper":"/paper/2505.02222","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:d9b9f76b516c24423ed603cb6be0bef53e826bbdf25d7edca580d667335e3216","observation_id":"7910fb49-bf75-4774-be98-e01007f6edad","resolution":{"observed_at":"2026-08-02T06:45:11.255675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.02222/citation-record","integrity":"/paper/2505.02222/integrity","json":"/paper/2505.02222/citation-record.json","paper":"/paper/2505.02222"},"outbound":[],"paper":{"arxiv_id":"2505.02222","last_updated":"2025-05-20T01:04:35Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-01T16:14:25.058532Z","submitted_at":"2025-05-04T19:14:43Z","title":"Practical Efficiency of Muon for Pretraining"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 30 inbound Pith citation observations for arXiv:2505.02222."}