{"as_of":"2026-08-14T07:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:026d3f646b4d9c0b317b15ca91b9658cbc518fadbe85318895ef27513f33027b","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T18:30:51.719396Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T02:09:01.644376Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.19811","snapshot_observed_at":"2026-08-03T02:09:01.644376Z","title":"Journal of Machine Learning Research, 24(276): 1–50","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29674","last_updated":"2026-07-31T17:54:46Z","snapshot_observed_at":"2026-08-11T02:25:01.813284Z","submitted_at":"2026-07-31T17:54:46Z","title":"Sign compression for Muon: SignMuon, MuonSign, and the Limits of Error Feedback","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T02:09:01.644376Z"},"links":{"cited_paper":"/paper/2605.19811","citing_paper":"/paper/2607.29674"},"observation_digest":"sha256:eafc4bee0e7cb22dc0211a83a9d3e4d4e185ee1ec3a65d40dbaadafc40892320","observation_id":"4b711375-aa9f-458a-a5c5-e73ab0145520","resolution":{"observed_at":"2026-08-03T02:09:01.644376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.19811/citation-record","integrity":"/paper/2605.19811/integrity","json":"/paper/2605.19811/citation-record.json","paper":"/paper/2605.19811"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":"2507.20534","doi":"10.1145/3448609","metadata_source":"pith","pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi K2: Open Agentic Intelligence","venue":"cs.LG","work_id":"7f18284c-12d3-4137-bea1-1da97e8cf3c1","year":2025},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:f42d9ee5231965d5b08a11c5779c4eb7ceb4f1eeb3d12adccee8f769d3530c0d","observation_id":"43f8849c-a28f-4161-ba35-c6fa89136fc9","resolution":{"observed_at":"2026-06-30T18:35:00.444559Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07179","last_updated":"2025-06-18T11:00:36Z","snapshot_observed_at":"2026-08-13T11:18:53.667848Z","submitted_at":"2023-06-12T15:21:02Z","title":"Benchmarking Neural Network Training Algorithms","version":2},"cited_work":{"arxiv_id":"2306.07179","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07179","snapshot_observed_at":"2026-07-01T22:06:16.031807Z","title":"arXiv preprint arXiv:2306.07179 , year=","venue":null,"work_id":"e4439980-5d66-481d-9faa-531133d46cde","year":2023},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"cited_paper":"/paper/2306.07179","citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:632ee9a12242b475b26dfbc83dd62b05160cfd27862919fff03b491491873003","observation_id":"2180b086-e9b5-4333-85e6-a98182ccc752","resolution":{"observed_at":"2026-06-30T18:35:00.437126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10777","last_updated":"2026-05-16T11:31:52Z","snapshot_observed_at":"2026-07-06T22:32:27.698678Z","submitted_at":"2025-10-12T19:39:41Z","title":"Preconditioned Norms: A Unified Framework for Steepest Descent, Quasi-Newton and Adaptive Methods","version":3},"cited_work":{"arxiv_id":"2510.10777","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.10777","snapshot_observed_at":"2026-06-30T18:45:00.282569Z","title":"Preconditioned Norms: A Unified Framework for Steepest Descent, Quasi-Newton and Adaptive Methods","venue":"cs.LG","work_id":"fd8b13b9-1a87-431f-9394-b7a2814bee69","year":2025},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"cited_paper":"/paper/2510.10777","citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:0f8bc4878515ec34447bae83d0817f7a7f62600778b1da264aa70eb7486f4fe0","observation_id":"38953ceb-7807-42c4-99ae-e5e63941dab1","resolution":{"observed_at":"2026-06-30T18:35:00.434687Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-08-09T05:23:26.365677Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":"1706.02677","doi":"10.48550/arxiv.1706.02677","metadata_source":"pith","pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","venue":"cs.CV","work_id":"f3dc32a4-cf81-467b-8ff4-3b2f21d3bf1f","year":2017},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:d5df89c783339911fa823c611361890072780515129b097aa25c74b06286e2bb","observation_id":"01da7740-22e8-44c7-b6fb-be9ab4d9a880","resolution":{"observed_at":"2026-06-30T18:35:00.439609Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:09.485311+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:09.485311+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:15d7375026bef5504846cb637fda90c2ba2e434c5afa198e1b77f7e80b4101f8","observation_id":"9230e505-d52a-4291-a4c4-cd2e6caf4c2d","resolution":{"observed_at":"2026-06-30T18:35:00.448741Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20325","last_updated":"2024-12-06T14:09:22Z","snapshot_observed_at":"2026-08-12T12:26:45.359430Z","submitted_at":"2024-09-30T14:26:12Z","title":"Old Optimizer, New Norm: An Anthology","version":2},"cited_work":{"arxiv_id":"2409.20325","doi":"10.48550/arxiv.2409.20325","metadata_source":"pith","pith_arxiv_id":"2409.20325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Old Optimizer, New Norm: An Anthology","venue":"cs.LG","work_id":"c0089db6-7349-44fd-b103-0d7b36142bab","year":2024},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"cited_paper":"/paper/2409.20325","citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:8f25d687ad8e689c89db19435c5d607e397cd6b228f895efd144173dde99e73c","observation_id":"4654a899-ad8e-4f87-a8f8-b421db0921c2","resolution":{"observed_at":"2026-06-30T18:35:00.429828Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.05291","last_updated":"2019-02-22T19:55:48Z","snapshot_observed_at":"2026-07-06T07:07:34.689643Z","submitted_at":"2018-10-11T23:50:32Z","title":"signSGD with Majority Vote is Communication Efficient And Fault Tolerant","version":3},"cited_work":{"arxiv_id":"1810.05291","doi":null,"metadata_source":"pith","pith_arxiv_id":"1810.05291","snapshot_observed_at":"2026-07-04T04:09:34.043882Z","title":"signSGD with Majority Vote is Communication Efficient And Fault Tolerant","venue":"cs.DC","work_id":"f1103325-0205-431f-b899-1f1ec01eb42c","year":2018},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"cited_paper":"/paper/1810.05291","citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:6698eeb64d955c0fe575d4cb46b50c1ec7c590bc7099f779bcd5aafab2e56939","observation_id":"f4dc4099-d745-4f81-a326-b1157c5b1049","resolution":{"observed_at":"2026-06-30T18:35:00.440962Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07923","last_updated":"2025-05-27T15:31:20Z","snapshot_observed_at":"2026-08-11T12:04:59.513253Z","submitted_at":"2025-02-11T19:54:11Z","title":"Sign Operator for Coping with Heavy-Tailed Noise in Non-Convex Optimization: High Probability Bounds Under $(L_0, L_1)$-Smoothness","version":2},"cited_work":{"arxiv_id":"2502.07923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07923","snapshot_observed_at":"2026-06-30T18:35:00.445011Z","title":"Sign Operator for Coping with Heavy-Tailed Noise: High Probability Convergence Bounds with Exten- sions to Distributed Optimization and Comparison Oracle","venue":null,"work_id":"d76b17d4-35ea-4b8b-856b-fe7f8be5ba81","year":2025},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"cited_paper":"/paper/2502.07923","citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:7b43ce52978ec126a1cf0e885954671c201711fbc0fb2b17c37bdd54c59dea89","observation_id":"dc04b226-d658-48f2-94b7-b5215330ee41","resolution":{"observed_at":"2026-06-30T18:35:00.446615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.07425","last_updated":"2026-05-08T15:36:59Z","snapshot_observed_at":"2026-07-06T22:44:56.252955Z","submitted_at":"2026-02-07T07:47:14Z","title":"Sign-Based Optimizers Are Effective Under Heavy-Tailed Noise","version":2},"cited_work":{"arxiv_id":"2602.07425","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.07425","snapshot_observed_at":"2026-07-03T03:27:35.760207Z","title":"Sign-Based Optimizers Are Effective Under Heavy-Tailed Noise","venue":"cs.LG","work_id":"70c90fb5-976f-4771-8045-e810d6c5cc12","year":2026},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"cited_paper":"/paper/2602.07425","citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:19ec07bbcb545109cac884ead5b0806fa41a120dac70a1843162ddfeb944ad09","observation_id":"cc35cef8-7662-49cc-aa13-c2ca6497693a","resolution":{"observed_at":"2026-06-30T18:35:00.449615Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.10067","last_updated":"2026-05-21T20:35:00Z","snapshot_observed_at":"2026-08-12T22:23:04.265995Z","submitted_at":"2026-03-10T02:12:24Z","title":"HTMuon: Improving Muon via Heavy-Tailed Spectral Correction","version":2},"cited_work":{"arxiv_id":"2603.10067","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.10067","snapshot_observed_at":"2026-06-30T18:35:00.450797Z","title":"Kwangjun Ahn, Byron Xu, Natalie Abreu, Ying Fan, Gagik Magakyan, Pratyusha Sharma, Zheng Zhan, and John Langford","venue":"cs.LG","work_id":"054f8278-396e-4a24-a60c-eed24c89503c","year":2026},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"cited_paper":"/paper/2603.10067","citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:7ee46d414fb7b21c526ade180024d9a14ba2217ef70bf2d792f6d4c6d3047643","observation_id":"10eb4b9b-f25b-40c9-807e-4dbdf40f11f8","resolution":{"observed_at":"2026-06-30T18:35:00.452419Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.16981","doi":"10.48550/arxiv.2510.16981","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2510.16981 , year=","venue":"ArXiv.org","work_id":"15052c26-b8e7-4957-ac0e-9af367d68fdf","year":2025},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:25b20a8322436c338b8a7401e86336b0826003fdcdf89447653b0b19713c25e1","observation_id":"7fcab13c-7c1e-4cef-8d38-e5315bec7f7f","resolution":{"observed_at":"2026-06-30T18:35:00.447155Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.14562","last_updated":"2026-07-24T13:07:17Z","snapshot_observed_at":"2026-08-11T17:48:00.416089Z","submitted_at":"2025-09-18T02:49:27Z","title":"LiMuon: Light and Fast Muon Optimizer for Large Models","version":5},"cited_work":{"arxiv_id":"2509.14562","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.14562","snapshot_observed_at":"2026-07-04T07:29:38.590843Z","title":"Huang, Y","venue":"cs.LG","work_id":"8d242626-c2ae-4a0d-b443-bbb01cc766ed","year":2025},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"cited_paper":"/paper/2509.14562","citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:1714ba3e4cae037f48720d3908dae1b59951e34fe6fb7918aed685da061520d2","observation_id":"56daeb54-9cbf-435b-bc7e-8e8718bdd918","resolution":{"observed_at":"2026-06-30T18:35:00.418531Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.01105","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T14:29:54.485013Z","title":"Noah Amsel, David Persson, Christopher Musco, and Robert M","venue":null,"work_id":"97926d2d-cfec-4708-9ae8-7e24e8ac0480","year":null},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:7f3983e2e7d824ea26c90def008f6e7b17f5d4dcb4e7976f45fcf359c0302238","observation_id":"5c92b568-e979-44ef-a70b-c4f6472356ca","resolution":{"observed_at":"2026-06-30T18:35:00.410785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.10935","doi":"10.48550/arxiv.2506.10935","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grishina, M","venue":"arXiv (Cornell University)","work_id":"e0965fe0-a555-4f58-8bc2-33b219db9443","year":2025},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:257bfb8552b00d69d24a0e44c3a1feb44bf1f07f56743fd8606dac91e5b60a31","observation_id":"371fd9dd-09fc-4ac1-a3b7-6f2bbbc5d0ab","resolution":{"observed_at":"2026-06-30T18:35:00.413285Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.07628","last_updated":"2017-12-20T18:34:08Z","snapshot_observed_at":"2026-08-07T18:27:25.346124Z","submitted_at":"2017-12-20T18:34:08Z","title":"Improving Generalization Performance by Switching from Adam to SGD","version":1},"cited_work":{"arxiv_id":"1712.07628","doi":null,"metadata_source":"pith","pith_arxiv_id":"1712.07628","snapshot_observed_at":"2026-07-04T06:29:38.183246Z","title":"Improving Generalization Performance by Switching from Adam to SGD","venue":"cs.LG","work_id":"4a527a83-20b0-4a2f-87e5-118020d3125d","year":2017},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"cited_paper":"/paper/1712.07628","citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:7d63cf33fef14b98b400ea3a24e0c66161ee75910a467a7b98f5385ff4d359ed","observation_id":"d115e252-230c-4869-a521-f31401024a2b","resolution":{"observed_at":"2026-06-30T18:35:00.408293Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.09843","last_updated":"2019-02-26T10:22:48Z","snapshot_observed_at":"2026-08-09T19:25:13.560135Z","submitted_at":"2019-02-26T10:22:48Z","title":"Adaptive Gradient Methods with Dynamic Bound of Learning Rate","version":1},"cited_work":{"arxiv_id":"1902.09843","doi":null,"metadata_source":"pith","pith_arxiv_id":"1902.09843","snapshot_observed_at":"2026-06-30T18:35:00.423360Z","title":"Adaptive Gradient Methods with Dynamic Bound of Learning Rate","venue":"cs.LG","work_id":"3340d7e4-34a9-4550-975b-fd9f076e1a1a","year":2019},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"cited_paper":"/paper/1902.09843","citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:cf0c2e45158c55a90e78fb28fdf82ce70915e3af4d441fce9908a4422308378e","observation_id":"855aef53-b5f3-4334-9432-097c22239749","resolution":{"observed_at":"2026-06-30T18:35:00.425057Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13849","last_updated":"2025-07-09T12:01:30Z","snapshot_observed_at":"2026-08-12T22:20:39.758827Z","submitted_at":"2024-10-17T17:59:01Z","title":"From Gradient Clipping to Normalization for Heavy Tailed SGD","version":3},"cited_work":{"arxiv_id":"2410.13849","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13849","snapshot_observed_at":"2026-06-30T18:35:00.430824Z","title":"From gradient clipping to normalization for heavy tailed sgd","venue":null,"work_id":"fd2224dd-ccb1-4fd3-a4f8-1034d397ef44","year":2024},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"cited_paper":"/paper/2410.13849","citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:0ddadd69414dbec9aea805434aa9db27db96c12dcf1fc7634bfb2dba4b83a19b","observation_id":"808b4a2a-c5db-43dd-bab0-47b2db711773","resolution":{"observed_at":"2026-06-30T18:35:00.432272Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02900","last_updated":"2025-06-01T18:46:31Z","snapshot_observed_at":"2026-08-09T10:38:54.874245Z","submitted_at":"2025-02-05T05:44:22Z","title":"A Note on the Convergence of Muon","version":2},"cited_work":{"arxiv_id":"2502.02900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02900","snapshot_observed_at":"2026-07-01T14:55:48.649763Z","title":"Li and M","venue":null,"work_id":"be3f1424-323d-44e4-9ebc-c38289176866","year":2025},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"cited_paper":"/paper/2502.02900","citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:62a6b3384e81d83c41ee9959ce1df13dfeeb789a1d71e5738dc1f78453e5c1c3","observation_id":"2086ae6f-f4aa-4372-a7af-db28820b9abc","resolution":{"observed_at":"2026-06-30T18:35:00.399798Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23737","last_updated":"2026-07-28T01:40:23Z","snapshot_observed_at":"2026-08-07T12:36:23.369583Z","submitted_at":"2025-05-29T17:58:01Z","title":"On the Convergence Analysis of Muon","version":3},"cited_work":{"arxiv_id":"2505.23737","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23737","snapshot_observed_at":"2026-07-04T18:40:03.190709Z","title":"On the Convergence Analysis of Muon","venue":"stat.ML","work_id":"fe8817f3-ca08-4ed5-a8fd-c2bfdaf1a459","year":2025},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"cited_paper":"/paper/2505.23737","citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:7beb5266894a5e46c5a178c6dff1c197655e4f0903092e4becaacecfb056db46","observation_id":"d8228e00-6052-4b25-9a4b-b76ab2652436","resolution":{"observed_at":"2026-06-30T18:35:00.408539Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.20762","doi":"10.48550/arxiv.2503.20762","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asgo: Adaptive structured gradient optimization.arXiv preprint arXiv:2503.20762","venue":"arXiv (Cornell University)","work_id":"96cc3325-c45a-429a-b585-8fbba970e8f2","year":2025},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:1eb5a963decf2d63611dd2d5c364ed278e5f776d68921646cc938f7af3254742","observation_id":"7ba37536-4c8f-4953-9aee-cfbebf0a49e0","resolution":{"observed_at":"2026-06-30T18:35:00.428031Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.19400","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T18:35:00.429192Z","title":"Improved convergence rates of muon optimizer for nonconvex optimiza- tion.arXiv preprint arXiv:2601.19400","venue":null,"work_id":"322b31b6-2aea-4b38-a32d-c70060551155","year":2026},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:91812499dd53c007b30568771f18e4a13f701daccad1e57baa1d6a09a1e121c3","observation_id":"f92ae67d-bbff-4202-a1bb-8b3252cbb418","resolution":{"observed_at":"2026-06-30T18:35:00.430715Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.15059","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T18:35:00.431760Z","title":"Muon converges under heavy-tailed noise: Nonconvex h\\\"{o}lder-smooth empirical risk minimiza- tion.arXiv preprint arXiv:2603.15059","venue":null,"work_id":"ad8976a3-4cfe-4245-bfc7-98568c22e5c8","year":null},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:039b0ed9fd5ad6bbe4670e9824e64b06a1aa4ed9b7f9b744ece26418b4f71183","observation_id":"e0e4f020-9abe-48f7-80dd-88660370a9b3","resolution":{"observed_at":"2026-06-30T18:35:00.433297Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01440","last_updated":"2025-09-01T12:50:30Z","snapshot_observed_at":"2026-08-14T03:03:01.600441Z","submitted_at":"2025-09-01T12:50:30Z","title":"Benchmarking Optimizers for Large Language Model Pretraining","version":1},"cited_work":{"arxiv_id":"2509.01440","doi":"10.48550/arxiv.2509.01440","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Benchmarking optimizers for large language model pretraining.arXiv preprint arXiv:2509.01440","venue":"ArXiv.org","work_id":"0365a535-39b7-4c6c-8ef2-d08314864789","year":2025},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"cited_paper":"/paper/2509.01440","citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:03768c939d0fc47053932cba7c8d51140a9cdfa678eb7f4c5a8e7ce3ba1940e0","observation_id":"8fd65943-b119-450d-a15c-bc72839058d5","resolution":{"observed_at":"2026-06-30T18:35:00.435900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15938","last_updated":"2024-03-30T13:50:06Z","snapshot_observed_at":"2026-08-13T11:33:35.484749Z","submitted_at":"2023-05-25T11:11:31Z","title":"First Order Methods with Markovian Noise: from Acceleration to Variational Inequalities","version":2},"cited_work":{"arxiv_id":"2305.15938","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15938","snapshot_observed_at":"2026-06-30T18:35:00.436973Z","title":"Accelerated stochastic ExtraGradient: Mixing hessian and gradient similarity to reduce communication in distributed and federated learning.arXiv preprint arXiv:2305.15938","venue":null,"work_id":"eb2db26a-c98c-4cdd-8a1b-812208c2670a","year":null},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"cited_paper":"/paper/2305.15938","citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:bbd788516e8f119ff4173c54224318c3b298e6e5131a5d3e8c0553144c1ec76a","observation_id":"707c5bf8-400d-4608-bed4-2a3993ebb481","resolution":{"observed_at":"2026-06-30T18:35:00.438609Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.402304Z","title":"From gradient clipping to normalization for heavy tailed sgd","venue":null,"work_id":"7eb3d3b4-1f26-44e3-8894-825d24d74ff3","year":2025},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:ef03f7326bb3c1f63fb96bb6b0ae776b0d3f07877fb0d6c258ef7cdb80d2b676","observation_id":"1a6f84b7-e31b-4820-a253-c5ea54f3663d","resolution":{"observed_at":"2026-07-08T04:14:30.403490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.404117Z","title":"t−1X j=0 βj 2 (1−β 2)St−j +β 2Rt−j ⋆ # ≤β t 2 · ∥E0∥⋆ + t−1X j=0 βj+1 2 E[∥Rt−j∥⋆] +E","venue":null,"work_id":"2e2c024d-bc4d-4182-b88b-ada2981b4920","year":2023},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:a3c5ec231f8b79d36d39265b6e21ae24e7c3504882865d9466af6984a39c4b99","observation_id":"f41e9d81-4aa2-425f-bd31-d403ed48e99c","resolution":{"observed_at":"2026-07-08T04:14:30.405279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.406052Z","title":"Taking the maximum over these two cases forP∈(1,∞), we getA2 = max{ηM , α·η L}","venue":null,"work_id":"164c65d0-bb2c-4fa0-b23f-645978b88a81","year":2024},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:9aede1aff24919f23dad09c9f5f2a3861c40aed62a3ce904fe243eec7d60513f","observation_id":"b0d4910e-c284-498c-bc58-a4eca569b001","resolution":{"observed_at":"2026-07-08T04:14:30.407420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.407955Z","title":null,"venue":null,"work_id":"1c5b0575-9f31-41ba-aff9-d546e4465bcc","year":2025},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:5b81793f63281f3a4eeae43347c0bfdf2fdf54f1ee24f5aca2355602e42dfd14","observation_id":"095768b5-29ac-47c3-9cfd-df498c8f224d","resolution":{"observed_at":"2026-07-08T04:14:30.409082Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1002.8642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T18:35:00.414337Z","title":"feel right","venue":null,"work_id":"96357bde-c8e0-43e5-a400-d835126a99ee","year":null},"citing_paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T18:30:51.719396Z"},"links":{"citing_paper":"/paper/2605.19811"},"observation_digest":"sha256:f82675db2db96f269eef0b431d1e46f4b7d24bd4e5c81f6050bba50a04d4275a","observation_id":"56d8ac24-bea0-4efd-9a18-262c8b826f4b","resolution":{"observed_at":"2026-06-30T18:35:00.415624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.19811","last_updated":"2026-06-21T10:26:37Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T08:16:28.633230Z","submitted_at":"2026-05-19T13:07:59Z","title":"LionMuon: Alternating Spectral and Sign Descent for Efficient Training"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":1,"verified_exact":20,"verified_fuzzy":3},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 1 inbound Pith citation observation for arXiv:2605.19811."}