{"as_of":"2026-08-05T05:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c70061d79cbfbac82979d8768d59e942ae8432de95296c77474a495dbc878801","coverage":[{"denominator":114,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":200,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":200,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":184,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T21:51:05.313853Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2303.08112","last_updated":"2025-11-11T01:13:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-14T17:47:09Z","title":"Eliciting Latent Predictions from Transformers with the Tuned Lens","version":6},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-05-12T16:54:37.382049Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2303.08112"},"observation_digest":"sha256:a25a3ea733f8c450b73c893fe5330c7b3d7f81bc2f6e10ee7264fc3b963aa794","observation_id":"1c8d5c47-a6a5-40c7-adad-c9db58cfed8d","resolution":{"observed_at":"2026-05-12T16:54:37.589737Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2501.07237","last_updated":"2026-04-27T13:03:55Z","snapshot_observed_at":"2026-07-06T20:20:14.452585Z","submitted_at":"2025-01-13T11:35:09Z","title":"GWT: Scalable Optimizer State Compression for Large Language Model Training","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-23T05:57:09.276224Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2501.07237"},"observation_digest":"sha256:9a581ed0731cec03f28b8232d99f8c39c7dd015ee65312151a35803745316fd8","observation_id":"bd0c1398-2ded-4a28-bf0f-31c707348370","resolution":{"observed_at":"2026-05-23T05:57:36.698034Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2502.07529","last_updated":"2025-06-06T13:42:19Z","snapshot_observed_at":"2026-08-03T03:50:14.086851Z","submitted_at":"2025-02-11T13:10:34Z","title":"Training Deep Learning Models with Norm-Constrained LMOs","version":2},"reference_index":195,"source":"arxiv_source","source_observed_at":"2026-05-21T21:22:36.870292Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2502.07529"},"observation_digest":"sha256:308238d64844ed4572ae10113954520191e434e1ec679f33749ad0ca99d3cc31","observation_id":"1abb37ca-9b1e-4a01-a0ab-727623b95114","resolution":{"observed_at":"2026-05-21T21:22:37.053910Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2504.01805","last_updated":"2025-05-21T09:38:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-02T15:12:17Z","title":"SpaceR: Reinforcing MLLMs in Video Spatial Reasoning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T15:18:43.724432Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2504.01805"},"observation_digest":"sha256:f331f10ce22c689dad68c6cb4080671b28872387c82c7583a728fb8361f720a4","observation_id":"bb2dc52c-4fe7-4999-8f96-38a57c4de888","resolution":{"observed_at":"2026-05-15T15:18:43.909761Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-11T19:21:26.933349Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2504.18425"},"observation_digest":"sha256:4a4c0911fb066832ae4c2c40905b3b3c1c7138df77c0f687a254a36121abc987","observation_id":"779f8ea5-0cab-4f2c-abc8-edb41048c54d","resolution":{"observed_at":"2026-05-11T23:02:52.981675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2505.23737","last_updated":"2026-07-28T01:40:23Z","snapshot_observed_at":"2026-07-31T23:54:11.554863Z","submitted_at":"2025-05-29T17:58:01Z","title":"On the Convergence Analysis of Muon","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T13:19:37.035526Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2505.23737"},"observation_digest":"sha256:cb2687e199870596cdfe11623b727b996d54e8ede3e50ec3d059445b6de6ce63","observation_id":"028443af-ccb7-41c9-b7b5-5de65298e426","resolution":{"observed_at":"2026-05-19T13:22:19.180929Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2506.16659","last_updated":"2026-05-20T23:37:18Z","snapshot_observed_at":"2026-07-06T21:45:02.192166Z","submitted_at":"2025-06-20T00:10:35Z","title":"Memory-Efficient LLM Pretraining via Minimalist Optimizer Design","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T13:23:55.233840Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2506.16659"},"observation_digest":"sha256:08fb1a7c69c4620314df2e6ea279794cbc8f6d182043b337871fef43be8dd7b3","observation_id":"8ac2c9a3-d5ce-4a81-bdec-76d82c467ae7","resolution":{"observed_at":"2026-05-22T13:24:53.207881Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T17:49:27.926646Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2507.20534"},"observation_digest":"sha256:7db4c39f0c53b0b8696a0b55226006ceb249115d45c0fb22a9a4fe232a20d59f","observation_id":"23c85ed5-aa98-44c1-b5fb-1e0a6e8d7cc8","resolution":{"observed_at":"2026-05-11T23:02:52.981675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2508.06471","last_updated":"2025-08-08T17:21:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-08T17:21:06Z","title":"GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T17:50:08.399160Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2508.06471"},"observation_digest":"sha256:117d26802b01077df6d729df1c3a31b9200d1fbfeaa87f030e1b246d0e41d635","observation_id":"dd200900-e693-451a-8f30-4c6a5327215a","resolution":{"observed_at":"2026-05-11T23:02:52.981675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-04T21:51:05.313853Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.07727","last_updated":"2025-09-09T13:28:41Z","snapshot_observed_at":"2026-08-04T21:51:02.865764Z","submitted_at":"2025-09-09T13:28:41Z","title":"MoE-Compression: How the Compression Error of Experts Affects the Inference Accuracy of MoE Model?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T21:51:05.313853Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2509.07727"},"observation_digest":"sha256:f8dee6033023b7ad0fcd5edf2df1f2307c6e99d82699bc1fac5cf7e41d237389","observation_id":"d84da147-e5ab-4ced-ac32-2eb0ea9b1545","resolution":{"observed_at":"2026-08-04T21:51:05.313853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2509.11983","last_updated":"2026-04-19T16:56:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-15T14:28:53Z","title":"Low-rank Orthogonalization for Large-scale Matrix Optimization with Applications to Foundation Model Training","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-18T15:48:43.422716Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2509.11983"},"observation_digest":"sha256:f962b0bac965c442f0c875f0c0c716dcbaf1418d0f630bfdb8da5ca27d813f8e","observation_id":"8106248e-29ca-4ddb-a302-3578382c0ab9","resolution":{"observed_at":"2026-05-18T15:51:33.994807Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2509.15816","last_updated":"2026-05-10T06:58:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T09:43:37Z","title":"On the Convergence of Muon and Beyond","version":5},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-18T15:56:30.602824Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2509.15816"},"observation_digest":"sha256:001512a6dc27e48332966816f0cc7d0667d0caa2242b620201ce9e1fe5f1cc94","observation_id":"f20acbef-4f18-4bf9-95e6-66ca5b658d1c","resolution":{"observed_at":"2026-05-18T15:56:34.068152Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2509.23638","last_updated":"2026-04-16T07:53:37Z","snapshot_observed_at":"2026-08-02T18:57:31.493788Z","submitted_at":"2025-09-28T04:35:12Z","title":"LayerScope: Predictive Cross-Layer Scheduling for Efficient Multi-Batch MoE Inference on Legacy Servers","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T12:38:31.783807Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2509.23638"},"observation_digest":"sha256:6757d78740b82e240af23d4445be6b8c1bc92010617b2830287a992097a6662b","observation_id":"5dbd9f93-54bc-45a2-8270-a0b344d78fe4","resolution":{"observed_at":"2026-05-18T12:41:22.754671Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2510.04988","last_updated":"2026-05-10T14:57:23Z","snapshot_observed_at":"2026-08-04T04:12:48.359316Z","submitted_at":"2025-10-06T16:24:57Z","title":"Adaptive Memory Momentum via a Model-Based Framework for Deep Learning Optimization","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T09:44:53.004293Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2510.04988"},"observation_digest":"sha256:f9b3c604c1a5c10ab4d1978116e937ca3576709209c7062e2a3ca4c567a1e6d5","observation_id":"53da14d2-3c98-4737-a976-d6c49bdd4168","resolution":{"observed_at":"2026-05-18T09:46:12.531052Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2510.07286","last_updated":"2026-04-11T09:47:15Z","snapshot_observed_at":"2026-08-04T08:50:20.789394Z","submitted_at":"2025-10-08T17:46:02Z","title":"Evolutionary Profiles for Protein Fitness Prediction","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-18T08:56:44.544404Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2510.07286"},"observation_digest":"sha256:7500a3b3f7e22285d1272f3323480f9550a3a1068b192e41926f14672ee3fc27","observation_id":"b202a901-a872-4140-81f3-f3b9e9cc3410","resolution":{"observed_at":"2026-05-18T09:01:09.675552Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:c0960905188f8d4db2db427a3eafb8435fd262c5a3a615ffb02ea9fa132f46da","observation_id":"51d4eab7-67fa-46b7-8794-9dbc0d13dfbf","resolution":{"observed_at":"2026-05-13T23:49:11.220159Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-03T22:20:05.578066Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.11466","last_updated":"2026-06-22T13:35:19Z","snapshot_observed_at":"2026-08-03T22:20:03.408484Z","submitted_at":"2025-11-14T16:38:15Z","title":"Non-Euclidean SGD for Structured Optimization: Unified Analysis and Improved Rates","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-03T22:20:05.578066Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2511.11466"},"observation_digest":"sha256:4dc0651fe0041ecf744b9c9bfe4b2f70568c239cfb3d11e3a369d1a7787d1e34","observation_id":"bd615397-34e6-4f3d-b93b-624e56dccaee","resolution":{"observed_at":"2026-08-03T22:20:05.578066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2511.14617","last_updated":"2026-04-03T12:47:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-18T16:12:21Z","title":"Seer: Online Context Learning for Fast Synchronous LLM Reinforcement Learning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-17T20:38:30.169363Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2511.14617"},"observation_digest":"sha256:dcd58d9d593fce5caf452aaf1cd4a951b94dabc4059bd1fa01be596152e6c3a2","observation_id":"d63cf5f7-9c32-4fc6-8221-433fc555cfa4","resolution":{"observed_at":"2026-05-17T20:40:14.556303Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-03T18:37:49.596778Z","title":"Muon is scalable for llm training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04632","last_updated":"2026-07-06T09:24:33Z","snapshot_observed_at":"2026-08-03T18:37:48.859151Z","submitted_at":"2025-12-04T10:06:22Z","title":"Turbo-Muon: Almost-Orthogonal Pre-Conditioning for Fast Muon Updates","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:49.596778Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2512.04632"},"observation_digest":"sha256:803b6a85426b2eb1e28cfc78061bd269014b67b352a8e248fb4fbe66a70eaff7","observation_id":"77f8b84a-73f9-4ea2-bf6f-7b336a2505e0","resolution":{"observed_at":"2026-08-03T18:37:49.596778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2601.12238","last_updated":"2026-07-24T03:23:33Z","snapshot_observed_at":"2026-08-03T10:09:34.130928Z","submitted_at":"2026-01-18T03:27:21Z","title":"On the Provable Suboptimality of Momentum SGD in Nonstationary Stochastic Optimization","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T15:36:44.154033Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2601.12238"},"observation_digest":"sha256:7f207246577803cfdae52cae3c41b49845fc61d664498e660963d8681994f0ec","observation_id":"f3bfe19c-93fa-486a-bef9-452a91363307","resolution":{"observed_at":"2026-05-21T15:40:18.938406Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-03T10:09:37.093609Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12238","last_updated":"2026-07-24T03:23:33Z","snapshot_observed_at":"2026-08-03T10:09:34.130928Z","submitted_at":"2026-01-18T03:27:21Z","title":"On the Provable Suboptimality of Momentum SGD in Nonstationary Stochastic Optimization","version":5},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T10:09:37.093609Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2601.12238"},"observation_digest":"sha256:6baeff0cd86615d06533cfc633f04dfc685eb07b0e54e2965826ba3974d0fa46","observation_id":"3176bd42-ff3e-405f-ac86-649b7b23ba6e","resolution":{"observed_at":"2026-08-03T10:09:37.093609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-03T06:57:48.394471Z","title":"Muon is Scalable for LLM Training.arXiv preprint arXiv:2502.16982,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.21579","last_updated":"2026-06-01T16:38:29Z","snapshot_observed_at":"2026-08-04T03:50:50.767974Z","submitted_at":"2026-01-29T11:43:05Z","title":"KromHC: Manifold-Constrained Hyper-Connections with Kronecker-Product Residual Matrices","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T06:57:48.394471Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2601.21579"},"observation_digest":"sha256:d1e91f29eda005f542d4bf50031622908a5cc47fd7d741b90a883ecdaa41353a","observation_id":"d33cb1ce-5500-497c-80be-7f05f59d008a","resolution":{"observed_at":"2026-08-03T06:57:48.394471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T16:09:05.225767Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2602.02276"},"observation_digest":"sha256:19ea64f9da48cc4ada860df20c118c2614c15cdb9c7644d69090058d0c7ee776","observation_id":"6dafce45-9263-48c8-9906-d5bac2f8e6ed","resolution":{"observed_at":"2026-05-11T23:02:52.981675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-03T05:27:10.427125Z","title":"Muon is scalable for llm training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02472","last_updated":"2026-06-29T15:41:30Z","snapshot_observed_at":"2026-08-03T05:27:04.791799Z","submitted_at":"2026-02-02T18:52:52Z","title":"SPARKLING: Balancing Signal Preservation and Symmetry Breaking for Width-Progressive Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T05:27:10.427125Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2602.02472"},"observation_digest":"sha256:5163bdc3a1c3194fb6bd7917af180404f6bee0b3f80969cc02fe2bb209060eb3","observation_id":"efd02246-9016-4e27-94dc-59067dfd3c17","resolution":{"observed_at":"2026-08-03T05:27:10.427125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-03T04:14:16.087028Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05725","last_updated":"2026-06-03T16:40:26Z","snapshot_observed_at":"2026-08-03T04:14:09.367178Z","submitted_at":"2026-02-05T14:49:40Z","title":"Muon in Associative Memory Learning: Training Dynamics and Scaling Laws","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-03T04:14:16.087028Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2602.05725"},"observation_digest":"sha256:712ad5ebe57669714502e6222b878bc2f3c95cc33d03e151588ba2603f09f6cf","observation_id":"dc4694a4-06e3-4f69-9336-3ca7353ecb1b","resolution":{"observed_at":"2026-08-03T04:14:16.087028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-03T03:56:41.622106Z","title":"Muon is scalable for llm training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-03T03:56:33.742201Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:41.622106Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:f01447cdd9945f9a81f3a89df6008fc301b185c257f14a55f49eaf586e8c5b43","observation_id":"82d1aae8-36a2-4341-9f32-4e429bb9a959","resolution":{"observed_at":"2026-08-03T03:56:41.622106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-03T00:19:05.635066Z","title":"Implicit bias of gradient descent for two-layer relu and leaky relu networks on nearly-orthogonal data.Advances in Neural Information Processing Systems, 36:30167–30221, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.11557","last_updated":"2026-06-16T11:03:18Z","snapshot_observed_at":"2026-08-04T11:11:48.264783Z","submitted_at":"2026-02-12T04:25:38Z","title":"The Implicit Bias of Steepest Descent with Mini-batch Stochastic Gradient","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-03T00:19:05.635066Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2602.11557"},"observation_digest":"sha256:de386d8c744492b88d09588225fce878efe2705ca7d6b4b83e6798ab1cde6da7","observation_id":"de8bbbba-21aa-46eb-9ad5-cb83fd061767","resolution":{"observed_at":"2026-08-03T00:19:05.635066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2602.21545","last_updated":"2026-05-14T00:38:30Z","snapshot_observed_at":"2026-08-04T04:29:45.131716Z","submitted_at":"2026-02-25T04:04:00Z","title":"MUON+: Towards More Effective Muon via One Additional Normalization Step for LLM Pre-training","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T19:24:22.699712Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2602.21545"},"observation_digest":"sha256:e299427de8346780f2c4808fb40b8fb5cee87db8a4b19bd3288019f31c5dfd3e","observation_id":"ef59ff3e-048b-4fa1-b43d-0c1cabffa28b","resolution":{"observed_at":"2026-05-15T19:26:31.348741Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2603.00541","last_updated":"2026-05-11T13:53:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-28T08:38:50Z","title":"Spectral Condition for $\\mu$P under Width-Depth Scaling","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T18:03:31.202134Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2603.00541"},"observation_digest":"sha256:0e333ff3c466b33e2cfa5d06089c1ec500735f73d562463746ba650ee967c740","observation_id":"4c27bc63-3c62-43be-8c8e-ed9c3682717f","resolution":{"observed_at":"2026-05-15T18:06:25.520938Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T06:39:04.312270Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2603.15031"},"observation_digest":"sha256:49bec64d62e1311fa6232485b0da39c1b4703d8b1d568d641c74b0360cfd18aa","observation_id":"9d93a0da-45d1-4a23-be1a-c0325b060e90","resolution":{"observed_at":"2026-05-21T06:39:04.506714Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2603.19096","last_updated":"2026-04-30T13:07:27Z","snapshot_observed_at":"2026-08-02T15:32:15.900527Z","submitted_at":"2026-03-19T16:21:56Z","title":"GLENN: Neural network-enhanced computation of Ginzburg-Landau energy minimizers","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T08:30:49.868638Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2603.19096"},"observation_digest":"sha256:1d4eed783056ea53e4637b6ec3567671b256c9c18558db60d8b712fb4600d9c1","observation_id":"613478ff-c5db-4e36-84fc-b923408a9f61","resolution":{"observed_at":"2026-05-15T08:35:19.268190Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2603.20527","last_updated":"2026-05-13T10:41:39Z","snapshot_observed_at":"2026-08-03T01:51:27.958885Z","submitted_at":"2026-03-20T21:55:28Z","title":"RMNP: Row-Momentum Normalized Preconditioning for Scalable Matrix-Based Optimization","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T07:49:39.417566Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2603.20527"},"observation_digest":"sha256:1fdc952c8f4532077cf6bd1121ecc17ff2d8da793c841ef825865d2181682ceb","observation_id":"c2d0b97b-bb88-456b-a333-5b8b7d0bf01c","resolution":{"observed_at":"2026-05-15T07:49:50.756272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2603.26554","last_updated":"2026-04-28T07:36:37Z","snapshot_observed_at":"2026-07-06T22:50:46.243903Z","submitted_at":"2026-03-27T16:13:18Z","title":"Sharp Capacity Scaling of Spectral Optimizers in Learning Associative Memory","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-14T23:37:33.106390Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2603.26554"},"observation_digest":"sha256:b4cb3bd7e8f16c6babe116e89efcb35aa6a23989fd77cfe707bef3d4a21a1b73","observation_id":"515d4ac9-d67d-4f32-a8e1-883ce029ccd2","resolution":{"observed_at":"2026-05-14T23:38:16.547879Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2603.28254","last_updated":"2026-05-10T06:51:11Z","snapshot_observed_at":"2026-07-06T22:51:05.074191Z","submitted_at":"2026-03-30T10:28:18Z","title":"MuonEq: Balancing Before Orthogonalization with Lightweight Equilibration","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T21:12:32.579136Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2603.28254"},"observation_digest":"sha256:94ded05a2e5d3a8f93e0b48846ddb46f7dafbcec364ee26c382c67247873cf12","observation_id":"7a6a9290-0319-47ea-8ab9-8e7ade9fba11","resolution":{"observed_at":"2026-05-14T21:12:58.572251Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2604.02505","last_updated":"2026-04-02T21:02:10Z","snapshot_observed_at":"2026-07-06T22:51:53.458444Z","submitted_at":"2026-04-02T21:02:10Z","title":"Optimal Projection-Free Adaptive SGD for Matrix Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T20:56:41.466669Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2604.02505"},"observation_digest":"sha256:dd787ba39c22bc9efa6cfaca67a80e6bee6109132b2a2e6c45f51b1277dfa403","observation_id":"b1a5ce80-7005-4e1a-9c30-b216974c0f81","resolution":{"observed_at":"2026-05-13T20:58:15.738102Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-07-13T10:41:51.251736Z","title":"Muon is scalable for llm training.arXiv preprint arXiv:2502.16982, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.04229","last_updated":"2026-04-05T19:08:51Z","snapshot_observed_at":"2026-08-04T06:41:40.344211Z","submitted_at":"2026-04-05T19:08:51Z","title":"Hierarchical Semantic Correlation-Aware Masked Autoencoder for Unsupervised Audio-Visual Representation Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T10:41:51.251736Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2604.04229"},"observation_digest":"sha256:fd7d4a54fbf87de81ff91efbe8ec91413bc4dbca4f9547b2561310c3a8a3dafd","observation_id":"40a15ea3-c03a-4718-9a26-b2a4e97e996c","resolution":{"observed_at":"2026-07-13T10:41:51.251736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2604.04726","last_updated":"2026-04-06T14:47:46Z","snapshot_observed_at":"2026-07-06T22:53:37.357996Z","submitted_at":"2026-04-06T14:47:46Z","title":"A Muon-Accelerated Algorithm for Low Separation Rank Tensor Generalized Linear Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T19:16:35.992399Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2604.04726"},"observation_digest":"sha256:53045b8168c4d3ab6ccf1fff96338d0384ef757b1b2bf32c2defd04c3bf3959c","observation_id":"13fd3e5e-6e3a-4c2d-8109-fc4bf2e882e1","resolution":{"observed_at":"2026-05-11T23:02:52.981675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2604.07350","last_updated":"2026-04-08T17:59:48Z","snapshot_observed_at":"2026-08-04T03:38:38.092494Z","submitted_at":"2026-04-08T17:59:48Z","title":"Fast Spatial Memory with Elastic Test-Time Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T18:27:24.750995Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2604.07350"},"observation_digest":"sha256:db475e914b10eef087e583203c46314b21e800e0e9b04016496aac8824fa90ca","observation_id":"4e2e3e8a-9e20-4273-a49b-7d7e5ac2f63b","resolution":{"observed_at":"2026-05-11T23:02:52.981675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2604.08649","last_updated":"2026-04-09T18:00:00Z","snapshot_observed_at":"2026-07-06T22:57:40.773778Z","submitted_at":"2026-04-09T18:00:00Z","title":"PRAGMA: Revolut Foundation Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T17:37:04.381074Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2604.08649"},"observation_digest":"sha256:a22f28c759872fe6a2f4ffc11011da6fb72a8366e63611d2dc64d950d29d5ea5","observation_id":"3c1893ac-f410-4a89-9ac8-1be1d80cfc0d","resolution":{"observed_at":"2026-05-11T23:02:52.981675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2604.10689","last_updated":"2026-04-12T15:30:28Z","snapshot_observed_at":"2026-07-06T22:59:13.936436Z","submitted_at":"2026-04-12T15:30:28Z","title":"Communication-Efficient Gluon in Federated Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-10T15:16:15.739456Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2604.10689"},"observation_digest":"sha256:8c2bc3b1c7322a70087b34a8f3f02d3f8f6fbb254cd2cc0501b8cf2d9e3378a3","observation_id":"10dd01c6-e6fe-46d2-8ad5-ba3210215024","resolution":{"observed_at":"2026-05-11T23:02:52.981675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2604.11947","last_updated":"2026-04-13T18:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T18:40:45Z","title":"ResBM: Residual Bottleneck Models for Low-Bandwidth Pipeline Parallelism","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:15.760164Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2604.11947"},"observation_digest":"sha256:89ef4142fc2d9db658b33a749f4dc132b274a084e3935c3cc0b86459672209d7","observation_id":"4486f7b9-e735-4ca7-acae-986cb115f93a","resolution":{"observed_at":"2026-05-11T23:02:52.981675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2604.15297","last_updated":"2026-04-17T17:48:55Z","snapshot_observed_at":"2026-07-31T08:41:17.524742Z","submitted_at":"2026-04-16T17:57:02Z","title":"Benchmarking Optimizers for MLPs in Tabular Deep Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T12:06:08.798712Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2604.15297"},"observation_digest":"sha256:235ca2de7472eaea33199c2758144a5c2feac9980923305e7354c8ef6156f244","observation_id":"b17e7849-5a25-49a3-82d1-0dd5458a9638","resolution":{"observed_at":"2026-05-11T23:02:52.981675Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2604.19741","last_updated":"2026-06-03T18:09:47Z","snapshot_observed_at":"2026-08-01T19:25:06.120681Z","submitted_at":"2026-04-21T17:59:03Z","title":"CityRAG: Stepping Into a City via Spatially-Grounded Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:54.935053Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2604.19741"},"observation_digest":"sha256:5ffeabf2354a6bd44c7f22e58942f9f15a45f381af7b7f9a9c48d0698231946f","observation_id":"ebe768c2-dc29-43a0-ab34-d5be14132dbe","resolution":{"observed_at":"2026-05-11T23:02:52.981675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2604.23098","last_updated":"2026-04-25T01:33:25Z","snapshot_observed_at":"2026-07-06T23:09:23.591544Z","submitted_at":"2026-04-25T01:33:25Z","title":"In-context modeling as a retrain-free paradigm for foundation models in computational science","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T07:06:51.187492Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2604.23098"},"observation_digest":"sha256:b148f608c27266a213e97e22feac34345a111586b7cbf715663a121ec8902b61","observation_id":"f6ccf5c5-5801-4fec-99cc-a2cdc32107ad","resolution":{"observed_at":"2026-05-11T23:02:52.981675Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2604.23980","last_updated":"2026-04-27T02:49:01Z","snapshot_observed_at":"2026-08-02T22:09:23.019618Z","submitted_at":"2026-04-27T02:49:01Z","title":"SUDA-Muon: Structural Design Principles and Boundaries for Fully Decentralized Muon","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T02:48:35.070309Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2604.23980"},"observation_digest":"sha256:b5b8bc4e52000486c994389f35e01d9f2a0db09aa010c86379d36e5cd57b6828","observation_id":"f4b85007-3a3c-4b57-aba4-e5f7eef53e6e","resolution":{"observed_at":"2026-05-11T23:02:52.981675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2604.23996","last_updated":"2026-04-27T03:23:19Z","snapshot_observed_at":"2026-07-06T23:10:07.178566Z","submitted_at":"2026-04-27T03:23:19Z","title":"SMoES: Soft Modality-Guided Expert Specialization in MoE-VLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-08T04:41:52.098355Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2604.23996"},"observation_digest":"sha256:7102ca6b5a8e917ab2fca10c8b0668c597e4bd292e0a7db96073c644a2a36eb3","observation_id":"52f23ffd-fd96-4273-ac76-49e58547b722","resolution":{"observed_at":"2026-05-11T23:02:52.981675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.01580","last_updated":"2026-05-02T19:06:35Z","snapshot_observed_at":"2026-07-06T23:14:47.444386Z","submitted_at":"2026-05-02T19:06:35Z","title":"Model Merging: Foundations and Algorithms","version":1},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-05-09T14:47:58.710291Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.01580"},"observation_digest":"sha256:4af8c98d4426edaaf5c371d38e0665edf971b8f2797207e10ad23b597eeb3220","observation_id":"f0339a5b-2a53-436f-8ba0-958d64dc4e3f","resolution":{"observed_at":"2026-05-11T23:02:52.981675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.02953","last_updated":"2026-05-02T09:59:56Z","snapshot_observed_at":"2026-07-06T23:15:55.848885Z","submitted_at":"2026-05-02T09:59:56Z","title":"DITRON: Distributed Multi-level Tiling Compiler for Parallel Tensor Programs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T15:57:35.983246Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.02953"},"observation_digest":"sha256:c231a1d1eace2018a18d0b73bf4436c9f884a0345a14f470cd5ccb046650faff","observation_id":"72d92fad-fd70-4650-b4bc-2c7a29ee42b5","resolution":{"observed_at":"2026-05-11T23:02:52.981675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.03769","last_updated":"2026-05-05T14:00:27Z","snapshot_observed_at":"2026-07-06T23:16:40.201701Z","submitted_at":"2026-05-05T14:00:27Z","title":"Nora: Normalized Orthogonal Row Alignment for Scalable Matrix Optimizer","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-07T16:42:34.498806Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.03769"},"observation_digest":"sha256:53110bc57cdf445e21b4a5e7a9bcc64eadceead1252a7763aed3cf3b1a90f966","observation_id":"7345c383-cb32-498a-bdc1-381d3660127f","resolution":{"observed_at":"2026-05-11T23:36:18.997820Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.04711","last_updated":"2026-05-06T10:02:31Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T10:02:31Z","title":"Budget-aware Auto Optimizer Configurator","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-08T17:46:09.673049Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.04711"},"observation_digest":"sha256:e3694663d7328077b12145157acd4aa61d046e93fd6fd17c50f3e0f3d3e00c2b","observation_id":"a8c2ae73-8b1d-4dcc-8fc9-bdcec59f3105","resolution":{"observed_at":"2026-05-11T23:02:52.981675Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.05365","last_updated":"2026-05-06T18:44:08Z","snapshot_observed_at":"2026-08-04T22:00:35.849220Z","submitted_at":"2026-05-06T18:44:08Z","title":"ZAYA1-8B Technical Report","version":1},"reference_index":199,"source":"arxiv_source","source_observed_at":"2026-05-08T17:36:37.182196Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.05365"},"observation_digest":"sha256:5d975a32126d8fe1c77340dcc4dc4c8cf09720796a53063a4e980cefbcb2628f","observation_id":"2c3cf7ab-8c86-423c-a0d9-653851ae2b25","resolution":{"observed_at":"2026-05-11T23:02:52.981675Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-02T14:48:38.107956Z","title":"Muon is scalable for llm training.arXiv preprint arXiv:2502.16982, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.05540","last_updated":"2026-07-27T15:13:41Z","snapshot_observed_at":"2026-08-02T14:48:29.228330Z","submitted_at":"2026-05-07T00:41:47Z","title":"Autoregressive One-Step Generative Modeling for Dynamical System Forecasting","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T14:48:38.107956Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.05540"},"observation_digest":"sha256:0601d3879dfcb09a8e28abbd77a7006df07d15e205a504b0756b0e7a040590ca","observation_id":"adb25634-3da3-41c4-82f9-6ccb3d6c1d4b","resolution":{"observed_at":"2026-08-02T14:48:38.107956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.05794","last_updated":"2026-05-07T07:32:27Z","snapshot_observed_at":"2026-07-30T14:24:32.368109Z","submitted_at":"2026-05-07T07:32:27Z","title":"Revealing Modular Gradient Noise Imbalance in LLMs: Calibrating Adam via Signal-to-Noise Ratio","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-09T15:39:51.611115Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.05794"},"observation_digest":"sha256:49bc6f8421db93c9805b90ef2b2f4e0b1aed6d4fafb8f80cad1b51336f72358b","observation_id":"def732c4-3ec1-4ca9-ba36-44d39dbae4b7","resolution":{"observed_at":"2026-05-11T23:02:52.981675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:1fec04cee92499c95f3c4b6c153cee25667e1a5f6654624abf75a0cbc6cba89d","observation_id":"f1bafc29-79a4-4fea-83ef-1a532689648b","resolution":{"observed_at":"2026-05-11T23:02:52.981675Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.06258","last_updated":"2026-05-07T13:35:11Z","snapshot_observed_at":"2026-07-06T23:18:46.145104Z","submitted_at":"2026-05-07T13:35:11Z","title":"The Weight Gram Matrix Captures Sequential Feature Linearization in Deep Networks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T13:14:32.856570Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.06258"},"observation_digest":"sha256:98f1f0b74c9bd61121f4aac4a096e8a945e47f561e5386d5bb1973d06b3c4eaf","observation_id":"2eeae874-359d-4a75-986c-9e046e734539","resolution":{"observed_at":"2026-05-11T23:02:52.981675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:aa565697643733c2a1c0c3d88695f855ca200da6fe126359f64b0ca5f9ff17d9","observation_id":"4ac87229-543a-4618-82ed-a76d92920cdc","resolution":{"observed_at":"2026-05-11T23:02:52.981675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.06884","last_updated":"2026-05-07T19:32:39Z","snapshot_observed_at":"2026-07-06T23:19:20.674889Z","submitted_at":"2026-05-07T19:32:39Z","title":"Muon with Nesterov Momentum: Heavy-Tailed Noise and (Randomized) Inexact Polar Decomposition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-11T00:54:23.683013Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.06884"},"observation_digest":"sha256:08ecce927ae6c5e652a382acd9ee6d454aa9ac0792600d0d41fb9c4ded46b05b","observation_id":"fd89786f-fda9-40b4-830d-05dc7b5b46ed","resolution":{"observed_at":"2026-05-11T23:02:52.981675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.07731","last_updated":"2026-05-20T09:02:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T13:36:24Z","title":"Benchmarking EngGPT2-16B-A3B against Comparable Italian and International Open-source LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-11T03:40:04.692279Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.07731"},"observation_digest":"sha256:5b240836c4db55689c1a698879f6eddb54a4968f1d56d9680fddf809b0e1838b","observation_id":"9a27d841-7790-445e-8685-b04aa426701e","resolution":{"observed_at":"2026-05-11T23:02:52.981675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.07731","last_updated":"2026-05-20T09:02:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T13:36:24Z","title":"Benchmarking EngGPT2-16B-A3B against Comparable Italian and International Open-source LLMs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T08:14:55.858466Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.07731"},"observation_digest":"sha256:61d16f8c8133549fb183d3f42cc5b15e566b20564c1267d3fe9fe3a1e6e84400","observation_id":"6ad88bc1-6ada-4333-bd01-da2f5a247fd2","resolution":{"observed_at":"2026-05-21T08:19:52.939073Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.07815","last_updated":"2026-05-08T14:47:56Z","snapshot_observed_at":"2026-07-06T23:20:11.042952Z","submitted_at":"2026-05-08T14:47:56Z","title":"OrScale: Orthogonalised Optimization with Layer-Wise Trust-Ratio Scaling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T02:47:08.766380Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.07815"},"observation_digest":"sha256:ee401466a8c1ecfa59addeeb9f2f318439a50ab793813485e0591316531530c1","observation_id":"1f996a58-1a1a-4d0b-90ff-130a5dc0fcec","resolution":{"observed_at":"2026-05-11T23:02:52.981675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.08560","last_updated":"2026-05-08T23:41:13Z","snapshot_observed_at":"2026-08-02T10:00:31.466870Z","submitted_at":"2026-05-08T23:41:13Z","title":"ZAYA1-VL-8B Technical Report","version":1},"reference_index":131,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:16.607346Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.08560"},"observation_digest":"sha256:0658c09569b709cf53eb1698a011cf8c8248003cb80ad6691df680d319db75c9","observation_id":"9feeee59-8ee3-4639-9e50-378fba61f74e","resolution":{"observed_at":"2026-05-12T08:21:23.438502Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.08678","last_updated":"2026-07-06T13:36:13Z","snapshot_observed_at":"2026-07-31T14:41:52.251938Z","submitted_at":"2026-05-09T04:29:46Z","title":"MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-12T01:13:35.990078Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.08678"},"observation_digest":"sha256:c37ecc16babf939d9257d5dc54f139d49a593573861b94b05f8b46cf1fe3f34e","observation_id":"439cb60a-8571-43c0-b3a0-1804fe07baeb","resolution":{"observed_at":"2026-05-12T08:21:25.238346Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.08678","last_updated":"2026-07-06T13:36:13Z","snapshot_observed_at":"2026-07-31T14:41:52.251938Z","submitted_at":"2026-05-09T04:29:46Z","title":"MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-30T23:12:57.154537Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.08678"},"observation_digest":"sha256:9ef4933ec6edd83c8dc43792e7de75dcd136fa84f2c009a48df9bcd4be5b7f76","observation_id":"6f01e845-5ad5-4b83-8a4d-e6fbf1b43089","resolution":{"observed_at":"2026-07-01T13:25:46.043477Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-07-12T17:14:49.310598Z","title":"Muon is scalable for llm training.arXiv preprint arXiv:2502.16982, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.08678","last_updated":"2026-07-06T13:36:13Z","snapshot_observed_at":"2026-07-31T14:41:52.251938Z","submitted_at":"2026-05-09T04:29:46Z","title":"MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-12T17:14:49.310598Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.08678"},"observation_digest":"sha256:746bb831cf36feb2c38e0158e1d36d0de8397ace3fdb7edb6df0f7e9856cae79","observation_id":"4157f7d6-3182-4674-9842-4694dd87c5f1","resolution":{"observed_at":"2026-07-12T17:14:49.310598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.08949","last_updated":"2026-05-14T22:50:46Z","snapshot_observed_at":"2026-07-06T23:21:06.773761Z","submitted_at":"2026-05-09T13:42:08Z","title":"Muon-OGD: Muon-based Spectral Orthogonal Gradient Projection for LLM Continual Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T02:12:25.713592Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.08949"},"observation_digest":"sha256:753a061a9428d24e68def535e57e7162463caaf6a4fe54a5439a2ca5fa28f00a","observation_id":"082b43f8-c05d-4c48-8c34-e220d98336f2","resolution":{"observed_at":"2026-05-12T07:42:06.515065Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.08949","last_updated":"2026-05-14T22:50:46Z","snapshot_observed_at":"2026-07-06T23:21:06.773761Z","submitted_at":"2026-05-09T13:42:08Z","title":"Muon-OGD: Muon-based Spectral Orthogonal Gradient Projection for LLM Continual Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T15:11:43.827012Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.08949"},"observation_digest":"sha256:3c48019d901eb2e8c3d9de3c240494402cbf7a9a4d3cb95ff1a8b008779ab48a","observation_id":"ed53cae7-0045-4aea-a096-2cf0aa219e72","resolution":{"observed_at":"2026-05-19T15:12:37.512690Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.09034","last_updated":"2026-05-15T13:21:07Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T16:16:45Z","title":"Accelerating Zeroth-Order Spectral Optimization with Partial Orthogonalization from Power Iteration","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T17:33:00.747846Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.09034"},"observation_digest":"sha256:a5ff8df44a774a57d3aa2c82992626b0995ff4da033c5084a553e1fdae050d51","observation_id":"489a2f61-411b-402e-9ed1-1d257368a913","resolution":{"observed_at":"2026-05-19T17:33:09.431089Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.09176","last_updated":"2026-05-09T21:34:28Z","snapshot_observed_at":"2026-08-05T05:25:18.389837Z","submitted_at":"2026-05-09T21:34:28Z","title":"Navigating LLM Valley: From AdamW to Memory-Efficient and Matrix-Based Optimizers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:32.057022Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.09176"},"observation_digest":"sha256:1bfdcf28a03594779d48979d1e62b7640f8e5cb81b7f884d8be84d48bf4875ba","observation_id":"588618a4-18ba-487b-b379-860d76eff338","resolution":{"observed_at":"2026-05-12T06:41:45.320350Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.09331","last_updated":"2026-05-10T05:06:07Z","snapshot_observed_at":"2026-07-06T23:21:26.017420Z","submitted_at":"2026-05-10T05:06:07Z","title":"Dimension-Free Saddle-Point Escape in Muon","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T04:38:25.480020Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.09331"},"observation_digest":"sha256:55b77c1f51ceea026a95957b2c7935787bda2802f390a7ef50211c289770bced","observation_id":"cd84be3b-6c64-4028-b4bf-6b52a458b634","resolution":{"observed_at":"2026-05-12T06:01:26.345270Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.09552","last_updated":"2026-05-10T14:11:22Z","snapshot_observed_at":"2026-07-06T23:21:39.966502Z","submitted_at":"2026-05-10T14:11:22Z","title":"Phases of Muon: When Muon Eclipses SignSGD","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T04:05:08.899876Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.09552"},"observation_digest":"sha256:9391a488e81a04c204384efa77f8c32868cc748d45865caa0d009ca61d0cbdd7","observation_id":"07adcf44-0419-4878-ae91-8d2211613b70","resolution":{"observed_at":"2026-05-12T06:41:29.316395Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.10468","last_updated":"2026-05-11T12:34:20Z","snapshot_observed_at":"2026-07-06T23:22:28.318343Z","submitted_at":"2026-05-11T12:34:20Z","title":"Can Muon Fine-tune Adam-Pretrained Models?","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-12T03:53:11.469583Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.10468"},"observation_digest":"sha256:e63693e74cdb225e456999cb2c5e5400d62c5c3220b50577f743be4e84b637c1","observation_id":"6cf5ea67-3b49-4e40-9ffd-6a597ae35eb4","resolution":{"observed_at":"2026-05-12T06:51:28.739353Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.10537","last_updated":"2026-05-11T13:20:51Z","snapshot_observed_at":"2026-07-06T23:22:28.318343Z","submitted_at":"2026-05-11T13:20:51Z","title":"Mela: Test-Time Memory Consolidation based on Transformation Hypothesis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:01.993926Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.10537"},"observation_digest":"sha256:f9561a096e505f146a7c2d33a82758378eef4ada16a15861aaaca9ddde8a1d8c","observation_id":"c7a76cb0-7019-417f-8036-e07bb5e72db2","resolution":{"observed_at":"2026-05-12T06:46:33.348726Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.11059","last_updated":"2026-05-11T16:54:46Z","snapshot_observed_at":"2026-07-06T23:22:57.012338Z","submitted_at":"2026-05-11T16:54:46Z","title":"Uniform Scaling Limits in AdamW-Trained Transformers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T01:24:52.640510Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.11059"},"observation_digest":"sha256:9b4c437f3daecb2b9cfd6d058fd94e691c14e40bf0078bb9020151602af4fc26","observation_id":"83500b89-85a4-4ee5-939f-70c314f66592","resolution":{"observed_at":"2026-05-13T01:27:01.950220Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.11396","last_updated":"2026-07-22T18:27:29Z","snapshot_observed_at":"2026-08-02T14:24:46.831630Z","submitted_at":"2026-05-12T01:31:32Z","title":"MuonQ: Enhancing Low-Bit Muon Quantization via Directional Fidelity Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T02:11:43.022143Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.11396"},"observation_digest":"sha256:5503f7aa480b4b9a7e9ebbd4a4ed00dc138f9ce39c7c39acc19eee0539d8ab58","observation_id":"d81fa253-3fc1-43f7-bad7-fd6cadbb506d","resolution":{"observed_at":"2026-05-13T02:12:07.087426Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-02T14:24:48.118761Z","title":"Muon is scalable for LLM training.arXiv preprint arXiv:2502.16982,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.11396","last_updated":"2026-07-22T18:27:29Z","snapshot_observed_at":"2026-08-02T14:24:46.831630Z","submitted_at":"2026-05-12T01:31:32Z","title":"MuonQ: Enhancing Low-Bit Muon Quantization via Directional Fidelity Optimization","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T14:24:48.118761Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.11396"},"observation_digest":"sha256:00839567ade358bf028a7a944e5dbdee4bd277080023758f7e60610635e68d29","observation_id":"5f798e7d-9033-465e-a6c4-aad6ff2ee2a9","resolution":{"observed_at":"2026-08-02T14:24:48.118761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.12491","last_updated":"2026-05-12T17:59:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T17:59:26Z","title":"Elastic Attention Cores for Scalable Vision Transformers","version":1},"reference_index":165,"source":"pdf_text","source_observed_at":"2026-05-13T06:02:40.158866Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.12491"},"observation_digest":"sha256:79b4a0a3b3bd4294c49ffc98edc38d4a4cfeb0ac25f5bc7dab2550f57467d792","observation_id":"7b127981-0878-415d-b3c2-ea2a82116c00","resolution":{"observed_at":"2026-05-13T06:07:22.858225Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.12492","last_updated":"2026-05-12T17:59:34Z","snapshot_observed_at":"2026-07-31T18:31:37.222688Z","submitted_at":"2026-05-12T17:59:34Z","title":"Pion: A Spectrum-Preserving Optimizer via Orthogonal Equivalence Transformation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-13T04:53:52.898843Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.12492"},"observation_digest":"sha256:6902a8aa47343a4128d08efcb9d53180c6b9038fd7c58113e70517566fb88a1f","observation_id":"8709b56d-e829-4d26-9752-9b5e0612d388","resolution":{"observed_at":"2026-05-13T04:57:17.626506Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.13079","last_updated":"2026-05-13T06:54:01Z","snapshot_observed_at":"2026-07-06T23:24:42.799888Z","submitted_at":"2026-05-13T06:54:01Z","title":"Spectral Flattening Is All Muon Needs: How Orthogonalization Controls Learning Rate and Convergence","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T19:56:23.124500Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.13079"},"observation_digest":"sha256:d305350b5fa9553692a5e57c57ee06eb026abde518df49f0b137d36740c6d81a","observation_id":"475a0326-70d3-4ead-bdf2-0facbf298f23","resolution":{"observed_at":"2026-05-14T19:57:53.130865Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.15403","last_updated":"2026-05-14T20:39:28Z","snapshot_observed_at":"2026-07-06T23:26:41.848219Z","submitted_at":"2026-05-14T20:39:28Z","title":"$\\phi$-Balancing for Mixture-of-Experts Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T16:16:38.731203Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.15403"},"observation_digest":"sha256:e36cbb78ce38bd01ec7b0d186b4a4b883f98261988d8fec7fe0698ef5edb3088","observation_id":"3b2c0eb8-8870-4042-ae4a-d987ab929428","resolution":{"observed_at":"2026-05-19T16:22:40.144819Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.15622","last_updated":"2026-05-18T07:21:10Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T05:11:43Z","title":"Position: Zeroth-Order Optimization in Deep Learning Is Underexplored, Not Underpowered","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-20T21:19:55.074853Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.15622"},"observation_digest":"sha256:a9e747ad689d88d7f898552beade969a27de2a5a76b3e3acf89a34cc43a23ceb","observation_id":"3496cfcc-8c8d-40a8-b583-6e4fe1791b34","resolution":{"observed_at":"2026-05-20T21:23:44.548558Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.17064","last_updated":"2026-06-28T13:06:30Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T16:10:41Z","title":"Towards Human-Level Book-Writing Capability","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T15:40:53.245419Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.17064"},"observation_digest":"sha256:1dfad3f86749f69cf9ae8b050cf916120dce452a6c3a84dcdaaf127c004c9f07","observation_id":"e53c553a-4335-4195-8e83-eb13908704c2","resolution":{"observed_at":"2026-05-20T15:43:27.011512Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.17064","last_updated":"2026-06-28T13:06:30Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T16:10:41Z","title":"Towards Human-Level Book-Writing Capability","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:27.257098Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.17064"},"observation_digest":"sha256:635d54e8ce49c3a7215fe528da7904cf0ab72d8fb681d8f4435b5dea08edc1b9","observation_id":"98b1ed54-b265-4213-b9a4-c1ab2b4cac64","resolution":{"observed_at":"2026-06-30T19:05:00.331587Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.18106","last_updated":"2026-06-22T06:06:33Z","snapshot_observed_at":"2026-07-06T23:28:59.503300Z","submitted_at":"2026-05-18T09:17:26Z","title":"Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers","version":1},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-05-20T09:34:45.186929Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.18106"},"observation_digest":"sha256:5357230fd01791d18584a9875af3a86b72b4d2e09f789f4abce68a3edae24bf5","observation_id":"2f910442-65a7-4948-ba07-b30c69b04633","resolution":{"observed_at":"2026-05-20T09:38:11.113200Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.18106","last_updated":"2026-06-22T06:06:33Z","snapshot_observed_at":"2026-07-06T23:28:59.503300Z","submitted_at":"2026-05-18T09:17:26Z","title":"Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers","version":4},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-06-30T18:42:01.854481Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.18106"},"observation_digest":"sha256:f5666587de1c44020789bee2c29354bfdc496a03edf472579ef1f86e57924eb4","observation_id":"ae9030a1-d890-4c16-9497-c7003ec2333d","resolution":{"observed_at":"2026-06-30T18:45:00.342917Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.18528","last_updated":"2026-05-31T14:16:59Z","snapshot_observed_at":"2026-07-06T23:29:24.494326Z","submitted_at":"2026-05-18T15:13:18Z","title":"Scale-Invariant Neural Network Optimization: Norm Geometry and Heavy-Tailed Noise","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-06-30T18:27:40.390908Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.18528"},"observation_digest":"sha256:bc82b2512d1875aaad1d824bd5e562b6ea058f3e2527706638a1a86b18b06517","observation_id":"40c85e73-8832-41fb-883f-bd2ddc3c322f","resolution":{"observed_at":"2026-07-01T14:55:48.630939Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.18999","last_updated":"2026-05-18T18:19:26Z","snapshot_observed_at":"2026-07-06T23:29:47.081347Z","submitted_at":"2026-05-18T18:19:26Z","title":"Distance-Aware Muon: Adaptive Step Scaling for Normalized Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T12:24:07.167770Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.18999"},"observation_digest":"sha256:34827cd9d42370acd9c0e8447fa11441c536a0a8bb39c5468caa72c96e35f5ca","observation_id":"0da511cb-f4d0-4551-8171-f95bd4a1c45d","resolution":{"observed_at":"2026-05-20T12:28:17.207016Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.19282","last_updated":"2026-05-19T03:00:26Z","snapshot_observed_at":"2026-07-06T23:30:02.207108Z","submitted_at":"2026-05-19T03:00:26Z","title":"Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies for VLA and RLVR","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T07:14:31.613251Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.19282"},"observation_digest":"sha256:09ea891617169c6e2d45281c3c46f9b315ff9fd2ecd2424ae016f6f5e827c7cf","observation_id":"e7a935f2-eb42-431a-a562-2c26e1fa6b52","resolution":{"observed_at":"2026-05-20T07:18:07.210100Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.19619","last_updated":"2026-05-19T09:56:27Z","snapshot_observed_at":"2026-08-02T07:39:30.812941Z","submitted_at":"2026-05-19T09:56:27Z","title":"MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T08:10:14.711735Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.19619"},"observation_digest":"sha256:d141b6caec5d7857cd6da9b8c622ef309c6fa146fed252929825393228fa64b5","observation_id":"7e5e0ac7-5f69-452b-b20c-7eea6194db59","resolution":{"observed_at":"2026-05-20T08:13:08.317153Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-07-06T23:30:30.141040Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T07:24:55.516803Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:2b03292dca11ed0f9026cb9e1987a8cb39bc3b91e2fcd6077b402dc30900a342","observation_id":"8568f2cf-0fef-488a-9257-39c79db255ef","resolution":{"observed_at":"2026-05-20T07:28:06.808665Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-07-06T23:30:30.141040Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:0b8b72b402d32950b335ea80500f7ada6069b8adeaba9e6583c697f049698d1b","observation_id":"9230e505-d52a-4291-a4c4-cd2e6caf4c2d","resolution":{"observed_at":"2026-06-30T18:35:00.448741Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.20119","last_updated":"2026-06-04T11:57:56Z","snapshot_observed_at":"2026-07-06T23:30:44.092395Z","submitted_at":"2026-05-19T17:08:24Z","title":"Toto 2.0: Time Series Forecasting Enters the Scaling Era","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T06:42:13.688042Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.20119"},"observation_digest":"sha256:ce33fd45fc003cf220724247c84a5bc0cdd402ce33f9fa8caaf3b9cdf43b72a4","observation_id":"2d95b3b5-d4f1-44d4-b3f1-e1c51dc799c2","resolution":{"observed_at":"2026-05-20T06:43:05.682831Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.20119","last_updated":"2026-06-04T11:57:56Z","snapshot_observed_at":"2026-07-06T23:30:44.092395Z","submitted_at":"2026-05-19T17:08:24Z","title":"Toto 2.0: Time Series Forecasting Enters the Scaling Era","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T18:11:53.058900Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.20119"},"observation_digest":"sha256:01a472d4eb9854909ebc01b2c47d989c28df825fd7a85d54053e17fa556e6cc4","observation_id":"66207ba8-a4e4-4d7a-984d-2f4aea0ddd59","resolution":{"observed_at":"2026-06-30T18:14:59.910573Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.21724","last_updated":"2026-05-20T20:31:10Z","snapshot_observed_at":"2026-08-01T19:02:59.349289Z","submitted_at":"2026-05-20T20:31:10Z","title":"TBP-mHC: full expressivity for manifold-constrained hyper connections through transportation polytopes","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-22T10:00:07.226252Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.21724"},"observation_digest":"sha256:73828e89d694bac7d2b65c15b319a8124aef62e007655f3cc1a40ab621b53d40","observation_id":"4483ef33-44ec-4757-b69a-f26d42275e14","resolution":{"observed_at":"2026-05-22T10:01:23.422546Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.21803","last_updated":"2026-05-20T23:00:34Z","snapshot_observed_at":"2026-08-01T18:06:03.629869Z","submitted_at":"2026-05-20T23:00:34Z","title":"Same Architecture, Different Capacity: Optimizer-Induced Spectral Scaling Laws","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T08:49:32.864065Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.21803"},"observation_digest":"sha256:7d78b1ec467b005d0a078572aad87e3ee0b913893a686405e8cadf60900adcab","observation_id":"ca2c268b-d528-4cc1-a53c-6b96195ed89b","resolution":{"observed_at":"2026-05-22T08:51:18.227053Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-01T11:19:03.524897Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T07:44:16.677054Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:30ad69382aac764259e223f99bf8156057ddb5c6bcaa146b74449b3111fadf18","observation_id":"42973ad1-9341-4004-aa92-3496f450b54c","resolution":{"observed_at":"2026-05-22T07:44:42.659994Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.22297","last_updated":"2026-05-27T10:11:58Z","snapshot_observed_at":"2026-08-01T11:19:03.524897Z","submitted_at":"2026-05-21T10:46:23Z","title":"One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T17:31:32.533941Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.22297"},"observation_digest":"sha256:32f3a3c4cea02c40ac03ff89e3de15e7e8f7820e204d701d658a4e514facf989","observation_id":"400b49a7-d530-4f35-8c50-7b2f34679cef","resolution":{"observed_at":"2026-06-30T17:34:57.604761Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:0785ccf19a84f105f4d2366287cd6684c5c549ed8b3a1c283eb73e8ebb0eb981","observation_id":"b2bd861a-3e82-474f-a63a-6073cd79519e","resolution":{"observed_at":"2026-05-25T05:40:24.249511Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.23872","last_updated":"2026-05-22T17:31:16Z","snapshot_observed_at":"2026-07-06T23:33:59.210165Z","submitted_at":"2026-05-22T17:31:16Z","title":"Training-Free Looped Transformers","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-25T04:36:10.278337Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.23872"},"observation_digest":"sha256:1685ac09aa7eda1edc4cb0c960e2dfbfcdc2b3b60a2062f8d638406858d76ff4","observation_id":"a6d0dd5a-0a70-42c3-b00a-5f59378a7a05","resolution":{"observed_at":"2026-05-25T04:36:36.720763Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.24390","last_updated":"2026-05-23T04:21:20Z","snapshot_observed_at":"2026-07-29T19:08:40.287393Z","submitted_at":"2026-05-23T04:21:20Z","title":"Learning Laplacian Eigenspace with Mass-Aware Neural Operators on Point Clouds","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T14:50:49.368332Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.24390"},"observation_digest":"sha256:bd6cfb5aeba7863ef34c26dee6a6c3d01bdd531d9e61237d70df6665598d2894","observation_id":"454d169b-00e5-4c05-bb1d-dd07503770a9","resolution":{"observed_at":"2026-06-30T14:54:45.497577Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.25966","last_updated":"2026-05-25T15:42:34Z","snapshot_observed_at":"2026-08-03T22:27:49.482944Z","submitted_at":"2026-05-25T15:42:34Z","title":"Mapping the Schedule x Bit-Width Boundary in Sub-100M Quantisation-Aware Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T23:10:47.199537Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.25966"},"observation_digest":"sha256:15c2479cdc5467fc3781a0750bef357a5747d17dce0d4b944431530d91d02cff","observation_id":"f7482c3e-6e45-4439-a5fa-357a90e8cd11","resolution":{"observed_at":"2026-06-29T23:14:01.500246Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.16982/citation-record","integrity":"/paper/2502.16982/integrity","json":"/paper/2502.16982/citation-record.json","paper":"/paper/2502.16982"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"767db69a-3d05-49b5-a236-be3b816c4681","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:9ab5e00b0a67a4e4401747e966d044e6f2cf36afe1cbbbb35cc06e198e0e3e12","observation_id":"fb514fb3-d163-4219-bfbc-d7c18563d097","resolution":{"observed_at":"2026-05-11T23:02:52.778741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2017 , eprint=","venue":null,"work_id":"7c38877b-6cb3-4e92-ac8a-77edf06f3dac","year":2017},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:57f41253f54d3264b82b2249500892c4f275d715d873d322ae3d4b2128c61390","observation_id":"886ce2dd-d23f-4fb6-a33b-514a8a83d9c3","resolution":{"observed_at":"2026-05-11T23:02:52.793592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The effective rank: A measure of effective dimensionality , year=","venue":null,"work_id":"cada36e6-511f-4ee2-88e0-825e62f9448f","year":null},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:625307f5a79f59091c4d1c89aac75b9555cae939a295ed40500c48347a0f7ea7","observation_id":"d3b8bed8-e591-44bb-ba0f-544b61312d4e","resolution":{"observed_at":"2026-05-11T23:02:52.799753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1073/pnas.97.18.10101","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Brown and David Botstein , title =","venue":"Proceedings of the National Academy of Sciences","work_id":"04ac4f2c-f904-45b5-8153-e4741f3300db","year":2000},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:4721346bbcd2d89ceb8ed95e4be641c72c07473992c8fcb0b14154545d9213a7","observation_id":"d64caa3a-8fa7-4841-9acf-f4b88581c6e3","resolution":{"observed_at":"2026-05-11T23:02:51.860430Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T04:43:23.504694Z","title":"2023 , eprint=","venue":null,"work_id":"5f44cece-a5c8-4336-910c-d087a72a438e","year":2023},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:73f53e8e1adb26614914ce319d48dc2d0a25383da6e73d3a34bb6aa9497977c3","observation_id":"4b8188d2-9275-4586-a29b-376a6ae44505","resolution":{"observed_at":"2026-05-11T23:02:52.804186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"90e3f09c-bfa6-4dd5-bc3a-832f37efacd0","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:639a1ec24064e72584c9fe43d72ff4b436899092daf13557cc36dc3e46b3f6e8","observation_id":"aef93166-9bd0-4f18-8085-1907ad5e7baa","resolution":{"observed_at":"2026-05-11T23:02:52.807812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"ecaaddc6-dce3-4bf8-93f7-aa98be179716","year":null},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:52e0f29bc9de3b4ab2be8233116c0b994f710b797c6e8ae7fd8ce51565ad02a0","observation_id":"7a941ef3-59e7-4c5c-aa90-6df531766d9b","resolution":{"observed_at":"2026-05-11T23:02:52.812664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T21:11:29.243491Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"719a642e-ad17-479e-8d21-9280774e8974","year":null},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:d58201ef9104009818bf53bd93821c91c7dc350d800879c06c49c02a2c329c83","observation_id":"2beb3b2b-a8b7-4807-96ee-9f12ce2719da","resolution":{"observed_at":"2026-05-11T23:02:52.820688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"6e5c4440-e787-42ef-b508-ecbc3e24bb14","year":null},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:1621ba5d7a791abc034ff54d07990d8161a70f60d6caa9ced5fadbd928e8846a","observation_id":"56f944c8-504e-425a-ba49-eec402a91bac","resolution":{"observed_at":"2026-05-11T23:02:52.826851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"18033f88-4caa-4252-bb81-30b6ee90cbcb","year":null},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:93b78e396c09b88535a550000aad181085c72bd9227c8beff5c3b81569f8e1fc","observation_id":"3038a8e9-a940-44eb-aa91-1161e362c1e7","resolution":{"observed_at":"2026-05-11T23:02:52.831674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00071","last_updated":"2026-02-06T19:40:50Z","snapshot_observed_at":"2026-08-01T02:15:47.181936Z","submitted_at":"2023-08-31T18:18:07Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","version":3},"cited_work":{"arxiv_id":"2309.00071","doi":"10.48550/arxiv.2309.00071","metadata_source":"pith","pith_arxiv_id":"2309.00071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","venue":"cs.CL","work_id":"31f454a9-7de2-4696-86f2-9bfa1410f80d","year":2023},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"cited_paper":"/paper/2309.00071","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:f7cb5de9dcf4050936de487de68d69af89fee61596d63a70d226905cf67ea2a9","observation_id":"b219efbb-de3e-40cd-9cd7-17550a6aeb17","resolution":{"observed_at":"2026-05-12T06:46:51.373347Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MultiPL-E: A Scalable and Polyglot Approach to Benchmarking Neural Code Generation , year=","venue":null,"work_id":"00175f65-a6fa-4e66-ba3a-814d0d8909c2","year":null},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:def22517bfa227346083d636d376c4d3d5f6183aa9211b0efd8bbb26da3a4289","observation_id":"5432d18c-db72-404c-b234-3c7b78834898","resolution":{"observed_at":"2026-05-11T23:02:52.837217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T02:11:53.068535Z","title":"IEEE transactions on Systems Science and Cybernetics , volume=","venue":null,"work_id":"3d9481bb-0c80-4117-8b31-489195b7e3f7","year":1968},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:913ae4b52c0fd89f3df7d4a8413fc6fd9cb078f4c60e16a8a1b9810c0949384d","observation_id":"efe04cd2-d40e-49cc-9c53-0a2e03168609","resolution":{"observed_at":"2026-05-11T23:02:52.848348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International conference on computers and games , pages=","venue":null,"work_id":"ae71b1eb-ba74-48b9-b362-06ae20b82169","year":2006},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:cc765e2e3687691ad1bc399cfa2571fd7f408fb55ce5f8346a6860306afd0feb","observation_id":"b655815f-1d16-4b1d-9f0e-61cbff7a30fd","resolution":{"observed_at":"2026-05-11T23:02:52.853325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"European conference on machine learning , pages=","venue":null,"work_id":"8e60386f-4dff-44f1-b09a-0d32d8cac1fc","year":2006},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:12e62ad802d7790961577c394fad2c5fa948fd46a80b6b3d15e529f8276daba3","observation_id":"19db4135-72eb-4705-bff6-7954e08497f8","resolution":{"observed_at":"2026-05-11T23:02:52.857885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"fb1a90e9-432a-46a2-b0c4-5c70c498d69e","year":null},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:7281b570697e50743fc3ef5681f08ca1c7d3872897b1be172d8e18ecbc11f40d","observation_id":"ba6d9d32-e677-40a0-8f37-023d298fe290","resolution":{"observed_at":"2026-05-11T23:02:52.869987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"cited_work":{"arxiv_id":"2408.00724","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.00724","snapshot_observed_at":"2026-07-04T11:09:46.442555Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","venue":"cs.AI","work_id":"cef2c407-5d51-46a9-8eb6-f382b419502e","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"cited_paper":"/paper/2408.00724","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:9074be07f1d018dead8d07fa5fb0666df9f87b428734f8a326ef0a5384b35d57","observation_id":"b77600a2-1578-4996-92e0-53f2ea8bc468","resolution":{"observed_at":"2026-05-18T06:38:37.536547Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":"2408.03314","doi":"10.18653/v1/2025.acl-long.1486","metadata_source":"pith","pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","venue":"cs.LG","work_id":"a8d50b24-bdf5-46ed-bc4f-2927dfd81f1d","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:5ac07944d030da51364017ca45410e950be87d56ea1c834265cb8eac0149cc79","observation_id":"454dbe6f-7d6d-45cd-9182-ee68d466bed7","resolution":{"observed_at":"2026-05-11T23:02:52.253433Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:47:37.666062Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"1265447d-0324-4d07-abba-34fa29d172da","year":null},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:3a2b0ad70a41a0d156aa4de7b77291138b9c23afee76c9187877dec1b6b0b967","observation_id":"25fbcfea-0db0-43f8-935f-5fa23cb5b2e9","resolution":{"observed_at":"2026-05-11T23:02:52.878144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-07-06T19:06:41.697671Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":"2408.15240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-07-08T21:25:38.629808Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","venue":"cs.LG","work_id":"dbe9c116-8030-4e7c-a259-b52c80846d0e","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:2ab10fb50d9e063110a85da89a65602deac7acf0f88358eaf8c4f0de366ddd66","observation_id":"a97ed35f-381e-45e4-853b-52b45d252804","resolution":{"observed_at":"2026-05-11T23:02:52.312751Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":"2402.14740","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-07-09T08:56:06.435604Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","venue":"cs.LG","work_id":"7bb8f9ec-1241-4472-a4fa-c636c6d79892","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:c0fc7f19a94dc3ef54c13276d42d8db54c7947c62a91f65a84f4a21ef710595b","observation_id":"ee4b0765-b7e8-4e73-bcb9-54cbd5bbbb37","resolution":{"observed_at":"2026-05-13T01:42:22.769824Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":"807a8b1a-6361-4665-ba15-0ca9da1dac16","year":2019},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:1cd68010e65778920300c88b54b8522cef3d210749499081235661ebfc8c75af","observation_id":"c08fb611-51ed-4a05-81fc-0e9df8b6a122","resolution":{"observed_at":"2026-05-11T23:02:52.882834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 28th International Joint Conference on Artificial Intelligence , pages=","venue":null,"work_id":"3ff8003b-7dd5-49cb-a4c4-4694bd71a567","year":null},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:07c7fb2154f3ae37324f9e150667f62cdfaa46ccd18e708b06176d3d878582f2","observation_id":"f8f6113d-ac82-4ac8-b223-d044059720c0","resolution":{"observed_at":"2026-05-11T23:02:52.887700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.09814","last_updated":"2021-06-07T13:44:15Z","snapshot_observed_at":"2026-07-06T09:21:50.535507Z","submitted_at":"2020-05-20T01:30:43Z","title":"Mirror Descent Policy Optimization","version":5},"cited_work":{"arxiv_id":"2005.09814","doi":"10.48550/arxiv.2005.09814","metadata_source":"arxiv_reference","pith_arxiv_id":"2005.09814","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tomar, L","venue":"arXiv (Cornell University)","work_id":"9c3d6ef6-ec36-4cf3-a706-09f7907d91a4","year":2005},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"cited_paper":"/paper/2005.09814","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:b451c59d88da0669a99e281bb58a438e0c03fea2081c0128a775ef931a03386b","observation_id":"ce92ea2b-0577-448c-bb91-92038e927280","resolution":{"observed_at":"2026-05-11T23:02:52.240735Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"ad905cab-f9f5-476f-a34c-b6e4e10ad10a","year":null},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:6cdc4d7a7534903017ae5775e8957f41ee7f989adc1f488f37220057e24a9ecc","observation_id":"bff0a9b5-3de0-4a08-b0ab-e8d6a307c037","resolution":{"observed_at":"2026-05-11T23:02:52.903038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2feeb9d9-0448-49a9-9848-c64199ed0dc6","year":null},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:b31cafdf3f47a33025617c521ac1258dca4cc2b4069cd4f5d48705c7cd5c20fd","observation_id":"9584fd9d-7dd7-4646-ac66-67c7309c143e","resolution":{"observed_at":"2026-05-11T23:02:52.908300Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:08:01.568147Z","title":"Neurocomputing , volume=","venue":null,"work_id":"0cfd4ae7-837c-4c4f-bf6d-afc10f5a8ed1","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:eb5f7fee5426a16c535730a608ab53276014849d19c8a698c7a252020bd7d584","observation_id":"c572c383-e3a0-4b64-81aa-9aa0b40dcbae","resolution":{"observed_at":"2026-05-11T23:02:52.915322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T04:40:40.727535Z","title":"2024 , url=","venue":null,"work_id":"67977792-714f-4b96-b878-e4138f3a6b43","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:ef31d1eb8e47a36605041d9fd7020410a1cebd3079875c8524ade0282178f434","observation_id":"2ecc027d-356b-4301-9e74-1e1d66aed3b6","resolution":{"observed_at":"2026-05-11T23:02:52.920360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2020 , eprint=","venue":null,"work_id":"2a1f06be-15a4-4fe0-8661-014c6a973400","year":2020},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:87f1a3e833b53a643be04045a8cd17b51e841e49df249685c112b00649e3497d","observation_id":"745d6af4-01ba-4076-a8f9-7ee54fc918f8","resolution":{"observed_at":"2026-05-11T23:02:52.925202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T14:06:16.697681Z","title":"Proceedings of the ACM SIGOPS 29th Symposium on Operating Systems Principles , year=","venue":null,"work_id":"9a3c3fdb-ec54-4e64-9779-63c57fad506c","year":null},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:5643b7520e9227911cc138f9fe053ab42f961be2b88e870a990279de3704342e","observation_id":"47e734c1-68d0-4c6d-b134-557405cd62ac","resolution":{"observed_at":"2026-05-11T23:02:52.930560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"d5833c53-0f5f-494d-a01c-471a40a9f903","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:0ac43e25880cb34835485c402f97f8baf094f53fc5af0f7578109f91523714b5","observation_id":"218fdfe9-dd08-4663-92fb-e71f40e9b444","resolution":{"observed_at":"2026-05-11T23:02:52.937454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T17:42:44.632180Z","title":"2024 , eprint=","venue":null,"work_id":"58b1d94b-15a2-47f4-be1d-d91563d6a5ae","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:cfe74b09c9d1e5734234ef5df543b700dcf0c7b87b6788caeaf5f6bea7bf9e57","observation_id":"51fe9497-b28b-405b-bd37-7ee887bcc684","resolution":{"observed_at":"2026-05-11T23:02:52.944713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:57:43.494382Z","title":"Attention is All you Need , url =","venue":null,"work_id":"fa4d7178-75f8-4139-9b39-41030a2917db","year":null},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:c5d9b592eed3a30244a432e090b6b8836c24609cea03be386b6bcc1dcec209c2","observation_id":"0f347ae0-d2b3-4a06-8852-81fadffebc0f","resolution":{"observed_at":"2026-05-11T23:02:52.954370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ArXiv , year=","venue":null,"work_id":"3855772c-216a-40dd-b9b5-c69be6f98b22","year":null},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:97dadae4aeff07838ef60624cf72cbff6ab81fba88e35d771104e224953d0940","observation_id":"47715c98-443d-4357-b9aa-1935978d4d4e","resolution":{"observed_at":"2026-05-11T23:02:52.959643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"North American Chapter of the Association for Computational Linguistics , year=","venue":null,"work_id":"1f249ce8-4e94-4df1-a419-215f4bf4c245","year":null},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:a3b864c9a24107b82153004b28e81c2dd183ada80cf1d66f7fc8fc117245b404","observation_id":"3884b18c-2c95-41e0-b61c-e6016444b9a3","resolution":{"observed_at":"2026-05-11T23:02:52.964869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ArXiv , year=","venue":null,"work_id":"e2b29ddf-7e08-436c-b8cc-ca570f2e68bd","year":null},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:b3a93e475111c38a2ffe35e602b6ac83b5dc378b6301926226c814dfc85ac703","observation_id":"3ef53054-c7c7-4b06-bebe-003e2e18272a","resolution":{"observed_at":"2026-05-11T23:02:52.970007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , journal=","venue":null,"work_id":"3066dd07-43b8-464a-8aed-5714fea39a7d","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:7b326a2b5bd3f78431a4e45321d110ff24d197d87676e64b207da141fd41c497","observation_id":"9c4206c1-73ef-4da8-8d4f-1125511f16b5","resolution":{"observed_at":"2026-05-11T23:02:52.974239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Computational Linguistics , year=","venue":null,"work_id":"63abc120-a83e-4fe9-83f8-dfa6c1ff85aa","year":null},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:b170b32853ed50f33d7d49d87b6a1350be0ca965045f3ed4cd3aa8d370c7babe","observation_id":"42a8f0af-be7a-4117-b39b-4648b0f9b409","resolution":{"observed_at":"2026-05-11T23:02:52.979536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ArXiv , year=","venue":null,"work_id":"1dd7ec66-76fb-442a-9a65-d68dd5957d93","year":null},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:70c69a9e9ab3147e0ca92d2fa546810b9abd50cf8e3352d2ca5fa3bcb15999cb","observation_id":"ca864ecf-6c9e-45f8-b69b-bf1aea58544f","resolution":{"observed_at":"2026-05-11T23:02:52.362347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ArXiv , year=","venue":null,"work_id":"9091f631-dbc9-40ef-a9c7-2967c3cc7de4","year":null},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:25675419ebf6aa68ee515440a136f73be765fbc29b49e40c9b7cbae0c7ddc68d","observation_id":"e5abf61a-7a9d-43ce-9284-3e19c05b52a9","resolution":{"observed_at":"2026-05-11T23:02:52.373362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ArXiv , year=","venue":null,"work_id":"5af0fada-18c4-4c01-b4b9-18f4cfd58bb9","year":null},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:ec4d7c9ab388a27e5fda5aad9c66160d1278f5721badac26aa59350f78acaf0f","observation_id":"259b7364-c77d-4c74-a145-98f984338d56","resolution":{"observed_at":"2026-05-11T23:02:52.381475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-07-31T17:40:45.057417Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":"2305.20050","doi":"10.1007/bf00262952","metadata_source":"pith","pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Let's Verify Step by Step","venue":"cs.LG","work_id":"6d05b790-04c5-4fd2-91b2-ba1dfdd5770f","year":2023},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:7f11e47f3810e56a744b3dcbc0cc769dfa22456e4626a61d1f8c3e9e36aae3a4","observation_id":"1a7366c6-3d29-474c-93af-70d0191b028e","resolution":{"observed_at":"2026-05-11T23:02:51.885074Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14804","last_updated":"2024-02-22T18:56:38Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:38Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset","version":1},"cited_work":{"arxiv_id":"2402.14804","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.14804","snapshot_observed_at":"2026-07-03T20:48:56.151594Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset","venue":"cs.CV","work_id":"c59c0707-68e6-4ab4-9b9f-293004398dc7","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"cited_paper":"/paper/2402.14804","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:a09d1b2654e36f6cef0e15ad4473245e89db63c20e1734b5641352cfef5221e3","observation_id":"b18c9154-cbfe-4a1c-b7dc-8debf06b2534","resolution":{"observed_at":"2026-05-17T20:45:37.909362Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:22:58.620946Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":"04484a78-8a2c-4240-b409-15982bc5709e","year":null},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:357e2c0620c48077c656694da488eea2aabeabe0abef1b2a93264a3b3de99408","observation_id":"46e1fea2-eee6-4e06-a972-6b49dd525922","resolution":{"observed_at":"2026-05-11T23:02:52.391769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":"2310.02255","doi":"10.1109/cvpr52734.2025.01245","metadata_source":"pith","pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":"cs.CV","work_id":"e22c3789-9e71-4242-b6ea-3e60e06e2b66","year":2023},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:847bcd5ea14c5b73eadc6c6252795bd2d89bcaec66d03f24a63e94b65b7cfc6d","observation_id":"837a51a9-5e67-4a82-bdc8-4dab344e566f","resolution":{"observed_at":"2026-05-11T23:02:51.940482Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.01759","last_updated":"2016-08-09T17:38:43Z","snapshot_observed_at":"2026-07-06T05:02:39.487370Z","submitted_at":"2016-07-06T19:40:15Z","title":"Bag of Tricks for Efficient Text Classification","version":3},"cited_work":{"arxiv_id":"1607.01759","doi":null,"metadata_source":"pith","pith_arxiv_id":"1607.01759","snapshot_observed_at":"2026-07-10T20:47:34.542323Z","title":"Bag of Tricks for Efficient Text Classification","venue":"cs.CL","work_id":"649b3add-3742-4013-9580-ac39515f8f2a","year":2016},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"cited_paper":"/paper/1607.01759","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:5a17c8bf420f4b307a6c9bef70c67d281835cbdd39e3f7613dbe760993036be3","observation_id":"c6e22c65-b264-4d57-9f4c-6d554820de07","resolution":{"observed_at":"2026-05-11T23:02:52.041442Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03216","last_updated":"2025-12-12T11:26:32Z","snapshot_observed_at":"2026-07-06T17:25:35.493362Z","submitted_at":"2024-02-05T17:26:49Z","title":"M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation","version":5},"cited_work":{"arxiv_id":"2402.03216","doi":"10.48550/arxiv.2402.03216","metadata_source":"pith","pith_arxiv_id":"2402.03216","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation","venue":"cs.CL","work_id":"a9435752-4e49-42bd-95b4-0fec975633c8","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"cited_paper":"/paper/2402.03216","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:cf8e9b8a8f3d215a5fa6174549c94377df518d3575b4faaf17369984bd85cdd0","observation_id":"c0fe3862-babb-4845-928e-3732197b3774","resolution":{"observed_at":"2026-05-11T23:02:52.058712Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-02T15:25:02.551919Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":"2406.17557","doi":"10.48550/arxiv.2406.17557","metadata_source":"pith","pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","venue":"cs.CL","work_id":"1ac90585-1330-4f90-8836-6382fa63c4eb","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:75c59c74d20771c21de5f5686660bbfa633150ab55062025b6082bca9239b4a9","observation_id":"49884703-9a55-46ec-ace3-0babb8b1dc27","resolution":{"observed_at":"2026-05-13T04:36:45.776658Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"cited_work":{"arxiv_id":"2406.11794","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.11794","snapshot_observed_at":"2026-07-04T18:50:04.316326Z","title":"DataComp-LM: In search of the next generation of training sets for language models","venue":"cs.LG","work_id":"a4c88edf-049f-4a82-8f81-9110091a04ad","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"cited_paper":"/paper/2406.11794","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:a42cd9216b06032513f147c90e0c539e836b852fbb29753e89a66167f599f2be","observation_id":"2b92e572-5f33-4239-b90a-7faa28f0ed05","resolution":{"observed_at":"2026-05-17T22:58:17.761776Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06786","last_updated":"2023-10-10T16:57:28Z","snapshot_observed_at":"2026-08-02T22:16:20.939859Z","submitted_at":"2023-10-10T16:57:28Z","title":"OpenWebMath: An Open Dataset of High-Quality Mathematical Web Text","version":1},"cited_work":{"arxiv_id":"2310.06786","doi":"10.48550/arxiv.2310.06786","metadata_source":"pith","pith_arxiv_id":"2310.06786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Paster, M","venue":"cs.AI","work_id":"10597ba0-fe28-4426-882a-ba9aff6bdf3c","year":2023},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"cited_paper":"/paper/2310.06786","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:82b444c984ff23f0e56f2475b70a186ed5b2cfb180347fcad725ea852c3d626a","observation_id":"69ad38c9-2a10-47e0-8daf-ff886b1b8b93","resolution":{"observed_at":"2026-05-11T23:02:52.122348Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"ba0cb9c7-5c70-4b55-9c98-b2aad94473cb","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:fa8d2093680fe5402287537dcf9e613ac9cbd3aa8e12a574ede66060b117aa8f","observation_id":"4817a92b-4d58-4eb8-8dbf-5b32f884855f","resolution":{"observed_at":"2026-05-11T23:02:52.409671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T04:46:46.700327Z","title":"2024 , eprint=","venue":null,"work_id":"94860f33-c1e9-46de-b7ef-cdfde74468a5","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:a8978572e97ae231a062ae2ee0e70adbcd8752c9fae72c517871501c1bcfa5ff","observation_id":"71cd9f16-bac3-42cc-bad7-e63b2ab8adbf","resolution":{"observed_at":"2026-05-11T23:02:52.419390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T02:11:52.244833Z","title":"2024 , eprint=","venue":null,"work_id":"e056dcb0-61e3-4324-bf08-28c0b9871d7a","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:10fb84a17b864ec7c89bc24b04341a234bc083ecefa45e0ad02c76e5bd125648","observation_id":"3cfd9307-426a-4237-a64b-10268a5adc5c","resolution":{"observed_at":"2026-05-11T23:02:52.429650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:57:43.199137Z","title":"2024 , eprint=","venue":null,"work_id":"56de79bb-a384-4567-8274-19e8bfa69568","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:aac4eb684351e1242c230d7bc8e8683120da33d7d067b14a7f9207b16c3d6ecd","observation_id":"5309a0e4-bbe1-46cf-b595-07a34d1ce3b0","resolution":{"observed_at":"2026-05-11T23:02:52.439344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05653","last_updated":"2023-10-03T02:48:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-11T17:47:22Z","title":"MAmmoTH: Building Math Generalist Models through Hybrid Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2309.05653","doi":"10.48550/arxiv.2309.05653","metadata_source":"pith","pith_arxiv_id":"2309.05653","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MAmmoTH: Building Math Generalist Models through Hybrid Instruction Tuning","venue":"cs.CL","work_id":"e74feaec-ca8a-4bdb-945e-e747355406e7","year":2023},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"cited_paper":"/paper/2309.05653","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:f3e6d62d716dbeb7c5dfe9e647b3463b15ee7f8df1db572f1272624b121d27d0","observation_id":"863a3ad5-6f54-4f78-b28c-fb028a5e851e","resolution":{"observed_at":"2026-05-17T23:46:39.773471Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02595","last_updated":"2025-05-30T20:49:42Z","snapshot_observed_at":"2026-08-04T07:58:32.632698Z","submitted_at":"2024-12-03T17:28:50Z","title":"Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset","version":2},"cited_work":{"arxiv_id":"2412.02595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02595","snapshot_observed_at":"2026-07-02T17:47:18.026339Z","title":"Nemotron-cc: Transforming common crawl into a refined long-horizon pretraining dataset.arXiv preprint arXiv:2412.02595","venue":null,"work_id":"bab220a8-ec16-4f03-9452-4eb35d618607","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"cited_paper":"/paper/2412.02595","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:f40bf86e52ea28664d5cac8b23c6c182ba6cfc65d3828e74d49afa1d5966e833","observation_id":"b11cfc50-8406-40d3-a048-37ecaeeb235a","resolution":{"observed_at":"2026-05-11T23:02:52.280166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"cited_work":{"arxiv_id":"2308.08998","doi":"10.1126/sciadv.abg6611","metadata_source":"pith","pith_arxiv_id":"2308.08998","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforced Self-Training (ReST) for Language Modeling","venue":"cs.CL","work_id":"db054f5c-62a3-405b-aae8-43e02c39f672","year":2023},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"cited_paper":"/paper/2308.08998","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:61e72519a9f2ad0c49c88df34f40b2c385fb8fd0f84937ed50012e7869b324a8","observation_id":"6a6ce351-a034-489c-ab0e-dcb263f03aba","resolution":{"observed_at":"2026-05-11T23:02:52.299431Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.798387Z","title":"nature , volume=","venue":null,"work_id":"a27ef4bd-ab83-4053-8d1e-cfe6ce08b47a","year":2017},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:c668638e25e497d51b173c1672bbdc7e3f00c51e08a2ef6c56d550f9476fa7ea","observation_id":"24648568-03a9-427e-8527-ae940339d12f","resolution":{"observed_at":"2026-05-11T23:02:52.446057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:24:29.178152Z","title":"nature , volume=","venue":null,"work_id":"e67e2a1f-f6ce-42cf-89e4-c0a42406b028","year":2019},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:2a68a3168a43ae3056c29b1a1d5f0b4358758d4c1a8efeb01ad1e0bca9f98f53","observation_id":"d226672c-2fbc-4a49-953c-54051a936ea9","resolution":{"observed_at":"2026-05-11T23:02:52.452706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1912.06680","doi":"10.5281/zenodo.17096679","metadata_source":"pith","pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","venue":"cs.LG","work_id":"b047dc18-e9a3-4d11-8ff6-cd59d41a6357","year":2019},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:c48025c2ebd35a1794276d700c3b4b064d0754ca97d228a2dc17af21896e4b71","observation_id":"7d1e62c1-c4bc-451e-833a-0b6314859c9a","resolution":{"observed_at":"2026-05-12T22:18:16.018301Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T17:56:26.096579Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"c25e8154-fab2-455c-8a26-56e40aed5d2b","year":null},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:1b681cae7ced2ae440bcf3a8463838b55154faa56eb740b1dbb35067d5c18147","observation_id":"0cb61bc2-57fb-430f-8858-cf56bb15c7d1","resolution":{"observed_at":"2026-05-11T23:02:52.462678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:00b066ce0a4c989501a3d928cd4905b06e6fa8ae47ec05f4127ca6d75484da68","observation_id":"a4982843-a78a-4e39-a2db-6254f9a8c684","resolution":{"observed_at":"2026-05-11T23:02:51.896015Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"d6bad940-7bfd-40a6-92d6-b9a678724cab","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:37af579be499d843571432aba773dd5e4255ec8f760d8be5eac253447f559ac5","observation_id":"6d2d216c-a8ec-45ad-85e5-abcf105a04e0","resolution":{"observed_at":"2026-05-11T23:02:52.473591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"3ac70437-3dae-4ca0-91b3-4855ad6fdf80","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:76b553e59389fe08ad55865709479a6a6ac5181c30cf4febb677e093fdf31273","observation_id":"43dbd1b0-49b2-45ac-b3d2-78b5687f14df","resolution":{"observed_at":"2026-05-11T23:02:52.486494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.919743Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"be2b69de-45c4-4db5-ab23-0bff300c6059","year":null},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:44acc1e91f59e3b7013e42c1b1588a0b0824714be339029175fa6c8cbfb3af4c","observation_id":"4ba30ccc-ff60-4982-9a27-e58d5ab7f6d8","resolution":{"observed_at":"2026-05-11T23:02:52.492668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07666","last_updated":"2025-12-31T04:06:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-14T16:58:48Z","title":"Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities","version":5},"cited_work":{"arxiv_id":"2408.07666","doi":"10.48550/arxiv.2408.07666","metadata_source":"pith","pith_arxiv_id":"2408.07666","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities","venue":"cs.LG","work_id":"add1bfdb-f9a2-4280-a81e-ae663e81b3e3","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"cited_paper":"/paper/2408.07666","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:9a01db6cb226a5332ca07f96ab97c2270a3170aec3576e27e3033b2eff2d27c7","observation_id":"2a9b8a1f-0e12-46e7-a21d-d42e47d42237","resolution":{"observed_at":"2026-05-17T22:16:05.189340Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.631204Z","title":"2020 , eprint=","venue":null,"work_id":"097441f1-67a5-4255-b088-89b8224d151c","year":2020},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:f1900d1dd6513ca189cab04da5f0e78061a0c3186acfb01bb0b64d2d0f37f2ee","observation_id":"8d3ec19a-861c-4a7f-8993-442add9c6c59","resolution":{"observed_at":"2026-05-11T23:02:52.500737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T12:46:15.047550Z","title":"2022 , eprint=","venue":null,"work_id":"c88a6857-a07f-4530-b493-c1289f847b7b","year":2022},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:605311b1479b60256c71e28ba6c43cc4bcf78b2b7f60b233c79824d533cd2357","observation_id":"0edcdcdd-c3fb-4829-bf26-4dbb9eac454f","resolution":{"observed_at":"2026-05-11T23:02:52.508726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T02:11:52.246660Z","title":"2024 , eprint=","venue":null,"work_id":"73e9ef36-00d9-4e79-ba51-439e6b4c90cd","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:c08ff403c11ffbda7e8fa00023330cf6be70c98dd81b2683afc775393a53d791","observation_id":"9247de9c-dbca-4cfc-9353-d3ebd6eda934","resolution":{"observed_at":"2026-05-11T23:02:52.520076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"3d681b07-4c9c-441c-b5f3-8efb06f3656a","year":2023},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:11a704dca1f542f2f3545dcea74d3503d4a1ebfc3fa6029c437b756f95d648de","observation_id":"cf9cb028-ce10-4708-b546-9eac009236a6","resolution":{"observed_at":"2026-05-11T23:02:52.525423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01704","last_updated":"2024-09-03T08:41:31Z","snapshot_observed_at":"2026-08-01T15:04:20.648996Z","submitted_at":"2024-09-03T08:41:31Z","title":"General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model","version":1},"cited_work":{"arxiv_id":"2409.01704","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.01704","snapshot_observed_at":"2026-07-08T20:35:34.407064Z","title":"General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model","venue":"cs.CV","work_id":"67b1592f-02b6-4056-b3fe-cc594e484192","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"cited_paper":"/paper/2409.01704","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:c3a43bb5687fae9062bdb380ac6f095ac8a6c63068c86e3eb4ab6ad0f61f50b4","observation_id":"0b73bebb-7e9d-4dae-9ec4-25d3d96d9260","resolution":{"observed_at":"2026-05-17T20:50:57.985910Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2021 , eprint=","venue":null,"work_id":"777fa95c-c342-4ef3-8584-bb16005785b5","year":2021},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:bd9dcd01350eae316ab2647af546707648666812b70376f44c26fbc7ade07535","observation_id":"c04232aa-f25a-4a92-8760-f1cb83beb0a3","resolution":{"observed_at":"2026-05-11T23:02:52.534241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"ecaff758-6fb7-4b0a-bccc-3a568d2ab1b2","year":null},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:42f0eb6470e8784e4f294a86e7cdbc1c319d8ecd61e6615b95efdfff42f47583","observation_id":"be3f4f2f-1e36-4708-a436-c187dfd25a42","resolution":{"observed_at":"2026-05-11T23:02:52.542398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15685","last_updated":"2024-04-16T02:46:58Z","snapshot_observed_at":"2026-07-06T17:07:52.197869Z","submitted_at":"2023-12-25T10:29:28Z","title":"What Makes Good Data for Alignment? A Comprehensive Study of Automatic Data Selection in Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2312.15685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.15685","snapshot_observed_at":"2026-07-03T08:17:45.507249Z","title":"What makes good data for alignment? a comprehensive study of automatic data selection in instruction tuning","venue":null,"work_id":"bf928949-0348-46a2-b106-7fdc5ab7d707","year":2023},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"cited_paper":"/paper/2312.15685","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:61e98f3e24406ca686d2b680b9d8702eb8285774f36b9e6d8aeeecb3b32b7712","observation_id":"d92228bd-9519-474b-a53d-5786dc40b4b8","resolution":{"observed_at":"2026-05-11T23:02:52.146183Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12032","last_updated":"2024-04-06T03:52:04Z","snapshot_observed_at":"2026-07-06T16:09:28.325603Z","submitted_at":"2023-08-23T09:45:29Z","title":"From Quantity to Quality: Boosting LLM Performance with Self-Guided Data Selection for Instruction Tuning","version":5},"cited_work":{"arxiv_id":"2308.12032","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.12032","snapshot_observed_at":"2026-06-29T18:33:50.119173Z","title":"arXiv preprint arXiv:2308.12032 , year=","venue":null,"work_id":"f0d3307c-50ad-4166-ad9e-bc03f4382918","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"cited_paper":"/paper/2308.12032","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:a890d44a467cceada8f266556c19c0f79e369196b93b577d084d4e93a35e815a","observation_id":"8185dbc5-4548-4b35-b7aa-1c461762f290","resolution":{"observed_at":"2026-05-11T23:02:52.179429Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":"2412.21187","doi":"10.48550/arxiv.2412.21187","metadata_source":"pith","pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","venue":"cs.CL","work_id":"d79f8b7d-560d-4fbd-bd70-4d084f6d9ad6","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:39fdcc93d9923b4f6f94fea033be2e583f9536f62e33ffdf7866ab0aececbfb9","observation_id":"e9f0f70c-a7dd-4908-904b-d89ee30a0c47","resolution":{"observed_at":"2026-05-13T15:51:30.429014Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T02:20:41.719296+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T02:20:41.719296+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:08:01.085168Z","title":"2024 , url =","venue":null,"work_id":"3fbe430d-48a5-4bf1-b3ab-3491a0d1629a","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:7a7c7155970da0bb46655d331998d3204321b16f1a3c437161ead86a74e65cea","observation_id":"65ca70d8-8452-4428-aaca-1b1968a32574","resolution":{"observed_at":"2026-05-11T23:02:52.554669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T04:46:46.760109Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"c41c2b6d-2808-4a83-9537-f2d5bf48bc34","year":null},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:2e180bcddef67896873369a175c32260a1a0a7bc7108cc892debca270412ed11","observation_id":"2cc933f4-5fa3-481e-b972-5e83562bf20b","resolution":{"observed_at":"2026-05-11T23:02:52.563135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , month = Oct, url =","venue":null,"work_id":"e33824de-25e8-4287-9fb8-4ae31478ec16","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:ac8b9490ac14aea72bdb1e2f1105db9bd0bc5e8789f7787bd27d0f72ed4bba56","observation_id":"62acc690-6490-460c-aef6-6368b83111e4","resolution":{"observed_at":"2026-05-11T23:02:52.568447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , url =","venue":null,"work_id":"ca882eee-b06a-43e8-9091-8f6cc7477f6b","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:263e1b278a84ed04b70abe2d6bfa662af37e207564f4c928598f2c70df52cb57","observation_id":"eabc162d-b034-4ac0-84f3-174f869b1f5d","resolution":{"observed_at":"2026-05-11T23:02:52.580131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T20:46:34.194734Z","title":"Kingma and Jimmy Ba , editor =","venue":null,"work_id":"03bfe487-67cd-4832-be0e-f98027fded15","year":2015},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:3df374c0c118eaf3c53894796a7efe8a7410596b443519de4f602a4f932a740f","observation_id":"1cc1be1f-15d2-44e0-8557-bb616d4d9d4e","resolution":{"observed_at":"2026-05-11T23:02:52.586463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Twelfth International Conference on Learning Representations , year=","venue":null,"work_id":"1a7d4dad-020b-428f-9203-ff2baa272e4c","year":null},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:af8ca828b920b2047864f933f5d5275bed6972b54d54699496e5138ba0232ab6","observation_id":"d1790b3d-761c-4076-b2bf-c736a36bb187","resolution":{"observed_at":"2026-05-11T23:02:52.591632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kakade , booktitle=","venue":null,"work_id":"4fb757fa-e2b8-4479-9845-decd728f50c8","year":2025},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:d29532b39a93bbf2e4f0b7e04f92e3b480d2eb40ddd05e00aab3c8864060cbc7","observation_id":"eab95519-6437-4218-91a6-f8ce0b193ccf","resolution":{"observed_at":"2026-05-11T23:02:52.596864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"3c468979-37fe-4748-b056-b6b128332b37","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:e67ff909adaee1c5d3e60284a4ad8a1248d1e9df692354cd7ec7b84f351a928a","observation_id":"7164ae32-d75e-4f41-90be-c777bf4b3a31","resolution":{"observed_at":"2026-05-11T23:02:52.606188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1405.2020","last_updated":"2014-05-08T17:04:15Z","snapshot_observed_at":"2026-08-04T16:50:32.529025Z","submitted_at":"2014-05-08T17:04:15Z","title":"Generalized Slow Roll for Tensors","version":1},"cited_work":{"arxiv_id":"1405.2020","doi":"10.1109/sc41405.2020","metadata_source":"pith","pith_arxiv_id":"1405.2020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generalized Slow Roll for Tensors","venue":"astro-ph.CO","work_id":"32348cef-09e4-43f2-b53c-d785fa1937a5","year":2014},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/1405.2020","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:68ad96cdb86804a1822a1bfd9c4ec95fff7b5f138940177b383c14488f523afc","observation_id":"6e9ae587-8672-4b42-8429-ede093b82551","resolution":{"observed_at":"2026-05-11T23:02:51.871689Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.178338+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.178338+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:adb75b7f3772dc89824b3ca0daa520b7c34205f05c30d2756a900e40786d6c4b","observation_id":"3f2a0681-8893-47c9-9788-51b10763fb44","resolution":{"observed_at":"2026-05-11T23:02:52.338525Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T13:16:16.372377Z","title":"2024 , eprint=","venue":null,"work_id":"c340eca6-fc11-45b6-a0d7-068752a731c8","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:20f97b7fd8f07164413e26b9875e0f2c97ce77c487287447c6abd122c9334325","observation_id":"3042fe40-f88e-48de-9612-f6d904d6ba39","resolution":{"observed_at":"2026-05-11T23:02:52.611223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T05:30:44.179918Z","title":"2024 , eprint=","venue":null,"work_id":"0b7aac21-82fe-44d3-8d33-ef048f14196e","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:4ca32c4e53688abe2e035f3e1bf532d209123925b3913bd19ff6377cc123fffa","observation_id":"5beb1a16-9548-41de-a50a-a8df575e0e2b","resolution":{"observed_at":"2026-05-11T23:02:52.622339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T06:40:46.497558Z","title":"2024 , email =","venue":null,"work_id":"709fce0a-9c17-4959-9b28-dadbcaf75619","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:f7d91368ca959740f8e2850c08e8594eb83b697a5bef5cceffba85f65b29d892","observation_id":"8ca70984-6f90-45b4-848d-da4d5cef47e0","resolution":{"observed_at":"2026-05-11T23:02:52.631347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"08045df8-7be9-4632-8151-b621f0efb02a","year":2020},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:7bf9a47a0a25644049ef1bd18a6f19abc99d6f6b3f364a66223afa55ad8014b9","observation_id":"267dfd4b-1a3a-4ed6-9c47-00928948093e","resolution":{"observed_at":"2026-05-11T23:02:52.636172Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"1fdd50d9-a583-4c4b-81f9-d23f94b528dc","year":2025},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:30ea56703dad0ce538cfc0aa3294d5adb7f8244a1a1a1d26a9ec74b23671dc19","observation_id":"9d90a456-eb1b-4a75-bc4c-878908725abb","resolution":{"observed_at":"2026-05-11T23:02:52.646251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , url=","venue":null,"work_id":"8ae28c40-365a-415e-86c5-83d137293001","year":2025},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:7eab0d14de424feca2552cec3b7e11c0088ae856f84b3b50136fefb99ee8500f","observation_id":"c8c2a863-01b1-4057-afbf-66ab9330d08f","resolution":{"observed_at":"2026-05-11T23:02:52.662230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":"2401.02954","doi":"10.48550/arxiv.2401.02954","metadata_source":"pith","pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","venue":"cs.CL","work_id":"01b10587-025b-499d-8ba3-7a538d24c2d6","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:0f68c0703d594caf54abad6c9d4b88e78c86646f7bc237765e7818db2b74ef18","observation_id":"085eef7e-99e0-4653-a839-7f65fa8a4361","resolution":{"observed_at":"2026-05-11T23:02:51.951346Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-07-06T20:15:22.511263Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":"2501.00656","doi":"10.48550/arxiv.2501.00656","metadata_source":"pith","pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2 OLMo 2 Furious","venue":"cs.CL","work_id":"9ef0dc2b-fdfe-4f14-b235-ef7556dc709a","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:f2b6169030df9bbdcae8f84254d610690c20d720bbc613c16a78c05400c2b05a","observation_id":"19daf070-9e86-4e00-9fc2-cad4bbef2b63","resolution":{"observed_at":"2026-05-11T23:02:51.983358Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:19:24.20254+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:19:24.20254+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2019 , eprint=","venue":null,"work_id":"63604562-985c-461f-9427-4ec868740f51","year":2019},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:e93e26a95e971837f6debc299e7619daeb87e82ed58fd981dd37b88ac2d71bae","observation_id":"0099226d-dcb8-4b66-915a-790e5a06eba1","resolution":{"observed_at":"2026-05-11T23:02:52.670572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":"2408.00118","doi":"10.48550/arxiv.2408.00118","metadata_source":"pith","pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","venue":"cs.CL","work_id":"4dd94e2f-2b27-4cbf-88a0-4910f0772a57","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:bc9b440a39a564942096d8f6445fa6f392d2cb4769e95dd0af1130f26586232a","observation_id":"28e75e17-90e1-45b1-8283-28ba35d04394","resolution":{"observed_at":"2026-05-11T23:02:52.022870Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:46.183082+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:46.183082+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , month=","venue":null,"work_id":"6d6fb800-7c52-4768-84c7-2885e41caf52","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:6dc3ebd9fe8e54c32d5e7de06a4bf6ea051b1582aff55670baeb27ebd21272a8","observation_id":"239e3013-ac07-4a2c-aadc-ebace1e1b24e","resolution":{"observed_at":"2026-05-11T23:02:52.678187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T19:36:29.944605Z","title":"2021 , eprint=","venue":null,"work_id":"01eb26fa-b178-499b-bc7b-b2ff5dd67b24","year":2021},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:f9834ab869ad81348cc4f5fd1951787f374647c42e715638b873ec6f196871a6","observation_id":"e9cfec47-2c93-48e6-a9e4-c66e6aa25b00","resolution":{"observed_at":"2026-05-11T23:02:52.682511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:25:58.150409Z","title":"2024 , eprint=","venue":null,"work_id":"2e6153c7-c735-45ee-a827-edf678361466","year":2024},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:0f7ee24509f6fcb1be65ec4024cc66cd3d72aa0ff7d27079bea19094126da295","observation_id":"b078db38-f633-4b5e-a137-46673d6bfed2","resolution":{"observed_at":"2026-05-11T23:02:52.686683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:25:58.161975Z","title":"2022 , eprint=","venue":null,"work_id":"57843bfd-d117-4dd9-9b57-8d42a4f2a8ab","year":2022},"citing_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-11T23:02:51.656353Z"},"links":{"citing_paper":"/paper/2502.16982"},"observation_digest":"sha256:0e5a84d2ba56569f520851d4899b6f803bd9a499f3ed791c8763eaf5e5b59bc3","observation_id":"53530e26-5765-491b-91d6-199387f19311","resolution":{"observed_at":"2026-05-11T23:02:52.692691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":26,"parse_uncertain":0,"unresolved":2,"verified_exact":4,"verified_fuzzy":68},"total_outbound_references":114},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 100 of 114 outbound references and 100 inbound Pith citation observations for arXiv:2502.16982."}