{"as_of":"2026-08-20T09:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bbf4e59504bd3ea928cc3e01c985ccad21e9062243991aff5f9f7cea2a624f00","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T08:10:14.711735Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T04:19:37.724140Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.19619","snapshot_observed_at":"2026-08-01T21:13:38.712209Z","title":"Jordan, K.; Jin, Y.; Boza, V.; You, J.; Cesista, F.; Newhouse, L.; and Bernstein, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16169","last_updated":"2026-08-02T14:51:38Z","snapshot_observed_at":"2026-08-18T02:02:01.039134Z","submitted_at":"2026-07-17T17:49:05Z","title":"When Does Muon Help Agentic Reinforcement Learning?","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T21:13:38.712209Z"},"links":{"cited_paper":"/paper/2605.19619","citing_paper":"/paper/2607.16169"},"observation_digest":"sha256:26a335abc509eadc148bc135b41651afde14dcc9f755fdc4c017f1f445330c50","observation_id":"e7de550a-ad9b-4509-9823-f6686917e6e7","resolution":{"observed_at":"2026-08-01T21:13:38.712209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.19619","snapshot_observed_at":"2026-08-04T04:19:37.724140Z","title":"Jordan, K.; Jin, Y.; Boza, V.; You, J.; Cesista, F.; Newhouse, L.; and Bernstein, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16169","last_updated":"2026-08-02T14:51:38Z","snapshot_observed_at":"2026-08-18T02:02:01.039134Z","submitted_at":"2026-07-17T17:49:05Z","title":"When Does Muon Help Agentic Reinforcement Learning?","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T04:19:37.724140Z"},"links":{"cited_paper":"/paper/2605.19619","citing_paper":"/paper/2607.16169"},"observation_digest":"sha256:f6928e6bc76d81e4fa2be2114d2417f34a17b56ae7e95d3ddc37a2ae7c0926cc","observation_id":"480bcf6f-b36b-4529-b349-a8c5530ef28b","resolution":{"observed_at":"2026-08-04T04:19:37.724140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.19619/citation-record","integrity":"/paper/2605.19619/integrity","json":"/paper/2605.19619/citation-record.json","paper":"/paper/2605.19619"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SIAM","venue":null,"work_id":"575a07c2-f51e-4b11-8d14-61ae40be0d89","year":2017},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:d3f5519f862b3db3f4d1301fe5b88faa9cb50b1a0f92903b505c2b1a06f62698","observation_id":"29e4659d-ca7a-4b95-8fa2-0f212eb30ae4","resolution":{"observed_at":"2026-05-20T08:13:24.842739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20325","last_updated":"2024-12-06T14:09:22Z","snapshot_observed_at":"2026-08-12T12:26:45.359430Z","submitted_at":"2024-09-30T14:26:12Z","title":"Old Optimizer, New Norm: An Anthology","version":2},"cited_work":{"arxiv_id":"2409.20325","doi":"10.48550/arxiv.2409.20325","metadata_source":"pith","pith_arxiv_id":"2409.20325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Old Optimizer, New Norm: An Anthology","venue":"cs.LG","work_id":"c0089db6-7349-44fd-b103-0d7b36142bab","year":2024},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/2409.20325","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:4bf1e166e0063975c20d5d36ee93b2de1504081ecdcc58b3d4ba680540355de4","observation_id":"9e0f1fe8-18a4-4f45-96f5-e968fd446dfe","resolution":{"observed_at":"2026-05-20T08:13:08.260499Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimization methods for large-scale machine learning.SIAM review, 60(2):223–311","venue":null,"work_id":"2925d763-7c3a-42ee-8d5c-896e8fa36266","year":2018},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:af6413662324e6169cf59f7f72301d12b141cd466a2c27bb928e59027fbd49ac","observation_id":"e6c8271c-ccf0-4c31-aee0-a2bfd1ddac67","resolution":{"observed_at":"2026-05-20T08:13:24.865568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.15816","last_updated":"2026-05-10T06:58:46Z","snapshot_observed_at":"2026-08-18T20:56:42.898921Z","submitted_at":"2025-09-19T09:43:37Z","title":"On the Convergence of Muon and Beyond","version":5},"cited_work":{"arxiv_id":"2509.15816","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.15816","snapshot_observed_at":"2026-07-04T07:29:38.596450Z","title":"On the Convergence of Muon and Beyond","venue":"cs.LG","work_id":"4a43859c-1056-4934-bc0b-1d3e33bbc5b0","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/2509.15816","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:17fdcc964954e3b676860e202e7075faab0704a8ca30c5073749c58404c363f7","observation_id":"3f5f8f4b-4061-41bf-86b8-fe023b42d8e6","resolution":{"observed_at":"2026-05-20T08:13:08.263494Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Symbolic discovery of optimization algorithms","venue":null,"work_id":"18e96fc3-3894-4643-963c-5f7bf5679191","year":2023},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:5e1d64c57e4183f8c0c9731db2bbd67cfefb18148b517b752dc1b04af46bc78c","observation_id":"2dffdd8b-bc04-4d98-abf3-dc0db2a50054","resolution":{"observed_at":"2026-05-20T08:13:24.876384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.00742","last_updated":"2026-06-29T14:07:01Z","snapshot_observed_at":"2026-08-14T11:57:16.637647Z","submitted_at":"2026-02-28T17:37:15Z","title":"To Use or not to Use Muon: How Simplicity Bias in Optimizers Matters","version":2},"cited_work":{"arxiv_id":"2603.00742","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.00742","snapshot_observed_at":"2026-07-03T00:27:30.119812Z","title":"To use or not to use muon: How simplicity bias in optimizers matters","venue":"cs.LG","work_id":"6cd8d5da-36e4-4803-8fa3-8a1d50875091","year":2026},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/2603.00742","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:1854cc50827da4f877f4523739b29cedda007dc20e5d3e030204e619503913b0","observation_id":"d39fbfda-e927-44e0-8779-953b4bfeb699","resolution":{"observed_at":"2026-06-30T03:18:06.554181Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Combining axes precondi- tioners through kronecker approximation for deep learning","venue":null,"work_id":"ba66760c-1e9a-44ae-9b8a-37f4812bf83a","year":2024},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:90f1048eca2e6e1b161ae3177d408f2b72efcabf6031d1c4251e23d8e39ccf9e","observation_id":"3b3e3e53-423b-423b-a7e5-7ddacf91d1fc","resolution":{"observed_at":"2026-05-20T08:13:24.850530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Shampoo: Preconditioned stochastic tensor optimization","venue":null,"work_id":"6aae5137-dc4d-422b-9126-cc1945364764","year":2018},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:cbed1f241bc16d3a6a20787d6783cae0d7d1aac617241797b1eb92f5cdbf58ad","observation_id":"53c48c25-8f64-4b10-a3e5-0979bb03224d","resolution":{"observed_at":"2026-05-20T08:13:24.853947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Trainfaster,generalizebetter: Stabilityofstochasticgradientdescent","venue":null,"work_id":"c203fd1e-1952-4a86-a1cd-8e9fd22ddcd4","year":2016},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:b9656b5127e604e79b952cb206835adf129b2032efae0faf53b378465843eed2","observation_id":"45b08244-b4ed-4b46-b466-5c88cf28e743","resolution":{"observed_at":"2026-05-20T08:13:24.853728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Variance-reduced and projection-free stochastic optimization","venue":null,"work_id":"c834df41-fabb-4583-a1eb-4aca15f60a14","year":2016},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:6ed70249b24bd8d06b580a4d994414edcd9f2a78ae41ccdd3faa43bc05d33faf","observation_id":"82874cdc-20ce-45d2-82fc-df4f5ef33ab2","resolution":{"observed_at":"2026-05-20T08:13:24.832148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.11983","last_updated":"2026-04-19T16:56:37Z","snapshot_observed_at":"2026-08-13T05:15:24.130541Z","submitted_at":"2025-09-15T14:28:53Z","title":"Low-rank Orthogonalization for Large-scale Matrix Optimization with Applications to Foundation Model Training","version":2},"cited_work":{"arxiv_id":"2509.11983","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.11983","snapshot_observed_at":"2026-07-04T07:29:38.557965Z","title":"Low-rank Orthogonalization for Large-scale Matrix Optimization with Applications to Foundation Model Training","venue":"cs.LG","work_id":"837753d0-a1f6-45b8-92f2-d83dfcc7f9ed","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/2509.11983","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:a39f0c624478f4b2d41fef74b9e64c287ea2892553603fad44d28ab1b2745725","observation_id":"0c05e2db-2d5e-4018-9d94-75dc16ace877","resolution":{"observed_at":"2026-05-20T08:13:08.314267Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.14562","last_updated":"2026-07-24T13:07:17Z","snapshot_observed_at":"2026-08-16T22:35:10.348502Z","submitted_at":"2025-09-18T02:49:27Z","title":"LiMuon: Light and Fast Muon Optimizer for Large Models","version":5},"cited_work":{"arxiv_id":"2509.14562","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.14562","snapshot_observed_at":"2026-07-04T07:29:38.590843Z","title":"Huang, Y","venue":"cs.LG","work_id":"8d242626-c2ae-4a0d-b443-bbb01cc766ed","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/2509.14562","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:06a11837a071f753a8cac7331974854c3b583d7d1b763b6db5ee9d31e1de15bf","observation_id":"0f29fe57-6b63-479a-8779-8821bcf5f848","resolution":{"observed_at":"2026-06-01T02:02:18.613734Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Muon: An optimizer for hidden layers in neural networks.URL https://kellerjordan","venue":null,"work_id":"25f73f9a-ec88-4c45-8a4c-8aa491b79a7f","year":2024},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:fd48b08ef971b23b2068d0a93d400e7b101be1068fb81b2e144311a804f8df5c","observation_id":"e7fad70b-c5b6-4117-aa24-4d1886edd039","resolution":{"observed_at":"2026-05-20T08:13:24.847105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.19156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:29:38.158764Z","title":"Convergence of muon with newton-schulz","venue":null,"work_id":"2f290040-1932-48e9-8781-4d40f61448f1","year":2026},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:497b59876f51208a901e5da180bfe7c841fff94e5c9ac525cd0ec7ab014b8075","observation_id":"1ca2b02e-d262-4591-817e-d13fbbed18d8","resolution":{"observed_at":"2026-05-20T08:13:08.326652Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:14f144d6e50acb12937ecb7af90862fe45f6896c32edc516c765bdb01951f8a1","observation_id":"a4872cac-673e-4c5b-83c4-08d1716e881f","resolution":{"observed_at":"2026-05-20T08:13:08.329300Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12645","last_updated":"2025-04-08T16:47:42Z","snapshot_observed_at":"2026-08-18T11:39:27.990371Z","submitted_at":"2025-03-16T20:49:34Z","title":"Understanding Gradient Orthogonalization for Deep Learning via Non-Euclidean Trust-Region Optimization","version":2},"cited_work":{"arxiv_id":"2503.12645","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12645","snapshot_observed_at":"2026-07-04T07:29:38.574824Z","title":"arXiv preprint arXiv:2503.12645 , year=","venue":null,"work_id":"fe62cb1b-f9dc-4379-8586-5c2f591ba7e5","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/2503.12645","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:9450f2d0f0e5636c6a69056c783ece89fa5dea945772ba652957d7bc1cbbcee4","observation_id":"e5bdcb5e-c7a0-4ad1-9652-0246994ced76","resolution":{"observed_at":"2026-05-20T08:13:08.332905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagenet classification with deep convolutional neural networks.Communications of the ACM, 60(6):84–90","venue":null,"work_id":"f0e00718-29e2-4645-8a9f-d38737a6f4cf","year":2017},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:ebf27a4139576f5441a94f2f318137f45d40f79ddb019a1c449142d0b2e7bd5e","observation_id":"359ddfdb-a869-4929-a407-f12365b40b55","resolution":{"observed_at":"2026-05-20T08:13:24.843826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.17155","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T15:37:05.748310Z","title":"arXiv preprint arXiv:2602.17155 , year=","venue":null,"work_id":"1df1b796-c9ea-4b58-b17c-8f31c1b5c547","year":2026},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:4745daeee6553661c96bdb18456137e55d3bfeddbdf64c483b541bb258aa3355","observation_id":"ff660517-b6cf-42a8-9ee6-9596fbf743a8","resolution":{"observed_at":"2026-05-20T08:13:08.320442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stability and generalization of stochastic optimization with nonconvex and nonsmooth problems","venue":null,"work_id":"9bda2949-8dac-4e44-b12f-2455ce3a1c28","year":2023},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:14b0a41c41f17e87a5eca326ed3eec83c253f864b4caa4ae3e58a819845b4bb9","observation_id":"8372ee1a-e25c-4766-b828-08256756f8e2","resolution":{"observed_at":"2026-05-20T08:13:24.860032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fine-grainedanalysisofstabilityandgeneralizationforstochasticgradientdescent","venue":null,"work_id":"6963a635-0b62-402e-9dbe-52d49a10dd13","year":2020},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:a90c28d007de600f0720b05af17f4bae7480a6d2ffe07ac055ea104b07b6cd5d","observation_id":"0577ffeb-98ea-4f82-8d82-b19c0ea44193","resolution":{"observed_at":"2026-05-20T08:13:24.868003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02900","last_updated":"2025-06-01T18:46:31Z","snapshot_observed_at":"2026-08-09T10:38:54.874245Z","submitted_at":"2025-02-05T05:44:22Z","title":"A Note on the Convergence of Muon","version":2},"cited_work":{"arxiv_id":"2502.02900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02900","snapshot_observed_at":"2026-07-01T14:55:48.649763Z","title":"Li and M","venue":null,"work_id":"be3f1424-323d-44e4-9ebc-c38289176866","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/2502.02900","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:735bafe6a81a6fc5e1f2a2c17a54ab2e1cd72a6dc8d982a11f6df14dff65a0ec","observation_id":"c707ac7f-1707-4829-b40b-80accbec84ce","resolution":{"observed_at":"2026-05-20T08:13:08.311412Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-16T22:48:15.725816Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:03b830a3c5dd200efd67c031d27e3a62e89858bad4c22c5f6cbe2619fda28d2e","observation_id":"7e5e0ac7-5f69-452b-b20c-7eea6194db59","resolution":{"observed_at":"2026-05-20T08:13:08.317153Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.21800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T18:45:00.331118Z","title":"Mars-m: When variance reduction meets matrices","venue":null,"work_id":"de336b48-579a-4978-9675-ba8ad53169d8","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:a3660bdf55c4301f1831a2d6a25a6e213f0aa455dfbb35f9339b5204989293c6","observation_id":"87f06778-4073-42dc-9f80-495df0fcf78a","resolution":{"observed_at":"2026-05-20T08:13:08.323747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:5c846c0d6f2b1250a707eadba1014100ed405b4efc64a2474dc1b07c431d73ec","observation_id":"703c1601-ec4b-4212-970a-60548504c453","resolution":{"observed_at":"2026-05-20T08:13:08.335795Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.13474","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:29:38.166830Z","title":"Charles H Martin and Christopher Hinrichs","venue":null,"work_id":"c78cf2a1-55f8-45ba-8922-f30f990616be","year":2026},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:2b6b2c449ebdd39010bc3430808eeabd5f6bdf4283a909c69a537c3f4a448f4f","observation_id":"bc4f9095-d838-4956-a4ad-1ee6682b71e8","resolution":{"observed_at":"2026-05-20T08:13:08.304003Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07529","last_updated":"2025-06-06T13:42:19Z","snapshot_observed_at":"2026-08-16T22:34:28.103547Z","submitted_at":"2025-02-11T13:10:34Z","title":"Training Deep Learning Models with Norm-Constrained LMOs","version":2},"cited_work":{"arxiv_id":"2502.07529","doi":"10.48550/arxiv.2502.07529","metadata_source":"pith","pith_arxiv_id":"2502.07529","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Deep Learning Models with Norm-Constrained LMOs","venue":"cs.LG","work_id":"4f1b774a-8ada-4d79-a90b-520511fce5d0","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/2502.07529","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:80d014d7f4426c98bc396f185dac27be847e05ab0aeb4412f79ee2ecb16b2e6c","observation_id":"90f930fd-0532-4e7a-a872-0ca1648d556e","resolution":{"observed_at":"2026-05-21T21:22:37.653978Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.01913","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2506.01913 (2025)","venue":null,"work_id":"057cb508-3699-43d9-8723-0fbd5d1fc0c9","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:e3af0a4ba8baf068410707e86c2b2bedaf1342bb74938d1d6d6ca6516f043b18","observation_id":"4ae2af87-42de-4908-ace7-25402a579c69","resolution":{"observed_at":"2026-05-20T08:13:08.296247Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.16598","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T07:29:38.572251Z","title":"Muon is provably faster with momentum variance reduction","venue":null,"work_id":"37153aaa-19e8-485a-a601-5824a36737ce","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:a099e190440c52a23a94ce65bad39b8fdd630257df21b70b4dad194d5758acff","observation_id":"f1bc9b73-db33-4f91-b28d-5277c38fbb71","resolution":{"observed_at":"2026-05-20T08:13:08.288942Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the gener- alization of stochastic gradient descent with momentum.Journal of Machine Learning Research, 25(22):1–56","venue":null,"work_id":"c52849bb-e40e-4827-bf0e-04cf24785d39","year":2024},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:87ad96d2311081bf5639b0e5bca05ac093d2b3178cbdb6d036fd0441f6b5db67","observation_id":"20cddf3c-2cc1-4687-8ae2-39c328c1fa4c","resolution":{"observed_at":"2026-05-20T08:13:24.865973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.24749","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sumo: Subspace-aware moment- orthogonalization for accelerating memory-efficient llm training","venue":null,"work_id":"a9f97689-cda1-4b3e-b2be-f9d9d6ab5a8f","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:9f02cde009834d673cdd425df3678eed047e7b6604bda2835b124f7fe5cf0175","observation_id":"c5846eea-cb46-4c82-bf10-5b95795708ec","resolution":{"observed_at":"2026-05-20T08:13:08.292289Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13416","last_updated":"2025-05-19T17:50:45Z","snapshot_observed_at":"2026-08-17T21:25:27.735163Z","submitted_at":"2025-05-19T17:50:45Z","title":"Gluon: Making Muon & Scion Great Again! (Bridging Theory and Practice of LMO-based Optimizers for LLMs)","version":1},"cited_work":{"arxiv_id":"2505.13416","doi":"10.48550/arxiv.2505.13416","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13416","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gluon: Making muon & scion great again! (bridging theory and practice of lmo-based optimizers for llms).arXiv preprint arXiv:2505.13416","venue":"ArXiv.org","work_id":"2c6f1a84-0bed-4e77-b4e0-760a8296a5c9","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/2505.13416","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:f0751f9fc639ff369774f212661c8f13a9e1bf485d1b512cc6d5be535c3ef983","observation_id":"66c05d6b-7ffb-47a8-9121-8ac607731255","resolution":{"observed_at":"2026-05-20T08:13:08.300435Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A stochastic approximation method.The annals of mathematical statistics, pages 400–407","venue":null,"work_id":"41262d21-f032-41aa-8487-97811652c93a","year":1951},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:7cdcad9b583d9d6346f6d6a0ddc5e578431e5bd319f42f8f3cf2711937c95de1","observation_id":"e7922a00-ffb3-4f26-987b-84805401ee22","resolution":{"observed_at":"2026-05-20T08:13:24.871133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25164","doi":"10.48550/arxiv.2509.25164","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Yolo26: Key architectural enhancements and performance bench- marking for real-time object detection","venue":"Open MIND","work_id":"d7d3b2c6-bdeb-4143-b9c1-15ee21c8a254","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:82b092b0feff99dea0ffb1534e28bdb4d7566f98ce4e9d7dab3a58ee5ed9de80","observation_id":"10f0c8a5-014f-484e-b69a-7ed177258383","resolution":{"observed_at":"2026-05-20T08:13:08.282484Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-16T22:51:55.558502+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T22:51:55.558502+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04192","last_updated":"2026-07-24T19:09:15Z","snapshot_observed_at":"2026-08-15T12:46:58.369811Z","submitted_at":"2025-06-04T17:39:03Z","title":"Lions and Muons: Optimization via Stochastic Frank-Wolfe under Heavy-Tailed Noise","version":3},"cited_work":{"arxiv_id":"2506.04192","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04192","snapshot_observed_at":"2026-07-28T01:21:32.152085Z","title":"Lionsandmuons: Optimizationviastochasticfrank-wolfe.arXivpreprint","venue":null,"work_id":"e3ffc6e0-4027-4843-89b2-9027a609d6ea","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/2506.04192","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:f6cad8570bac6212849131896f69305c52a2655b6a45dc9c9937f5e5ae906022","observation_id":"bc2425e5-1e27-4a6a-9a0e-9887c8b8e84a","resolution":{"observed_at":"2026-07-28T01:21:32.152085Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learnability, stability and uniform convergence.The Journal of Machine Learning Research, 11:2635–2670","venue":null,"work_id":"cb8d3c94-4c98-4d6a-8c3e-6c576f670653","year":2010},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:28baed495c449eec30bfeb0ba75c912e9811a0211062852e4ad60796501bf5d3","observation_id":"b731ffab-e136-4ad3-9687-b9caeb8714b3","resolution":{"observed_at":"2026-05-20T08:13:24.862172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23737","last_updated":"2026-07-28T01:40:23Z","snapshot_observed_at":"2026-08-17T04:14:11.630903Z","submitted_at":"2025-05-29T17:58:01Z","title":"On the Convergence Analysis of Muon","version":3},"cited_work":{"arxiv_id":"2505.23737","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23737","snapshot_observed_at":"2026-07-04T18:40:03.190709Z","title":"On the Convergence Analysis of Muon","venue":"stat.ML","work_id":"fe8817f3-ca08-4ed5-a8fd-c2bfdaf1a459","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/2505.23737","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:5cb3b702d0a0ee7f18b8ae87b31ce7c4884adf9c6977a8e7538928f8e5ab4fcb","observation_id":"7d5818ff-b8a7-4cc7-b377-e88ce7c4f8db","resolution":{"observed_at":"2026-05-20T08:13:08.275659Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.00674","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:29:38.165345Z","title":"ArXiv Preprint: 2511.00674 , Year =","venue":null,"work_id":"5e0fa664-f7a6-4ce3-934b-dd6d242ac7c6","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:f37e205cf48cc7d821c498ae2d8bad3400e0b2b8952b16594b8d0635dd62c880","observation_id":"97cd6aae-58ab-4769-8f50-0209e025a0d1","resolution":{"observed_at":"2026-05-20T08:13:08.279033Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the importance of initialization and momentum in deep learning","venue":null,"work_id":"74c63dcf-30ae-4182-bc38-c266887769c0","year":2013},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:b91b8c30b8414560197a536818f5ba5687266de3ff93e2d9310476ce5979e26b","observation_id":"52afabd6-c6f6-4945-8ffd-b1c186882b94","resolution":{"observed_at":"2026-05-20T08:13:24.826636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:16:21.111301Z","title":"Qwen3 technical report","venue":null,"work_id":"d95873d5-9f2e-4813-aee5-72264f679d9c","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:af24ebaadc5cdd2fd1ff88847ccbafdef278495ed45d2cc2ccbff13ccbe412d9","observation_id":"4d6629f2-cbaa-496f-9f65-4068e0ee4718","resolution":{"observed_at":"2026-05-20T08:13:24.879436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On generalization of spectral gradient descent: A case study on imbalanced data","venue":null,"work_id":"ae2c59fa-6c6c-4675-b484-ac07481cdfc4","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:e16d7634961639eb9831924255305ad15c256b0920bebf86b0166342da43deb5","observation_id":"afc05cc5-941a-4ac4-ae45-b99e3a68dc92","resolution":{"observed_at":"2026-05-20T08:13:24.859455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:47:23.567466Z","title":"Attention is all you need.Advances in neural information processing systems, 30","venue":null,"work_id":"751efe07-5e91-415c-b3d1-f4734aa26960","year":2017},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:1eb7ffc7d2022ee1675fa2ce6b41a74bba8ec93aa2b3aea8bedea14a2bb01cf9","observation_id":"ad2cc4d3-cf6c-42e6-a0e9-394152973a61","resolution":{"observed_at":"2026-05-20T08:13:24.835563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.07425","last_updated":"2026-05-08T15:36:59Z","snapshot_observed_at":"2026-07-06T22:44:56.252955Z","submitted_at":"2026-02-07T07:47:14Z","title":"Sign-Based Optimizers Are Effective Under Heavy-Tailed Noise","version":2},"cited_work":{"arxiv_id":"2602.07425","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.07425","snapshot_observed_at":"2026-07-03T03:27:35.760207Z","title":"Sign-Based Optimizers Are Effective Under Heavy-Tailed Noise","venue":"cs.LG","work_id":"70c90fb5-976f-4771-8045-e810d6c5cc12","year":2026},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/2602.07425","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:4a9d88d38527b3fccea4f8c4a96df13128dc4c540f4a8e972d9bbd66cbc479f5","observation_id":"269e7726-0e5d-42e7-b26d-39531eb72668","resolution":{"observed_at":"2026-05-20T08:13:08.272996Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A useful variant of the davis–kahan theorem for statisticians","venue":null,"work_id":"c1302e49-bc81-4da1-8a67-c8e296e0ec6e","year":2015},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:33bc2f02d811aa1ccd9863f63e26db6068a34b30e2c04808be2367ac9aab43cb","observation_id":"639ad069-f14b-4806-820e-dbdd88484d83","resolution":{"observed_at":"2026-05-20T08:13:24.873896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cambridge University Press","venue":null,"work_id":"b3bec7ef-2113-49c5-98aa-a4a076a54335","year":2023},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:09e05f7d5d458ce06a58b962559805f3ed79549271454f264d9cc74e6e8b9b92","observation_id":"c03b6f8d-ab4d-4adf-a0b4-9a15bf5af4de","resolution":{"observed_at":"2026-05-20T08:13:24.856417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T01:59:48.715115Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":0,"verified_exact":20,"verified_fuzzy":20},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 2 inbound Pith citation observations for arXiv:2605.19619."}