{"as_of":"2026-08-04T13:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:959198f347f4074d8cc4c655e1f62f739101d68c627d6352fb80a9686e92bd3c","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-25T05:38:16.958574Z","state":"measured"},{"denominator":89,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":89,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-30T12:53:40.992720Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.23061","snapshot_observed_at":"2026-07-14T08:04:06.432613Z","title":"arXiv preprint arXiv:2605.23061 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10959","last_updated":"2026-07-12T23:24:42Z","snapshot_observed_at":"2026-08-03T13:16:14.672928Z","submitted_at":"2026-07-12T23:24:42Z","title":"WSqD: A Horizon-Free Learning Rate Schedule for Large Model Training","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-14T08:04:06.432613Z"},"links":{"cited_paper":"/paper/2605.23061","citing_paper":"/paper/2607.10959"},"observation_digest":"sha256:b174ddf77628c86fc2e2b193a552d9e992bebf22ef8469bc4d8f254a5d88004d","observation_id":"87452c44-f0f7-4b6a-93db-d6a4e860b88c","resolution":{"observed_at":"2026-07-14T08:04:06.432613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.23061","snapshot_observed_at":"2026-07-30T12:53:40.992720Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23777","last_updated":"2026-07-26T17:55:40Z","snapshot_observed_at":"2026-07-30T23:56:43.497541Z","submitted_at":"2026-07-26T17:55:40Z","title":"Scale Weight Decay and Train Better","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-30T12:53:40.992720Z"},"links":{"cited_paper":"/paper/2605.23061","citing_paper":"/paper/2607.23777"},"observation_digest":"sha256:13c81bfcbdb0b91ab8a2c238c92d108520a1844e3a5404821fc4f4b596654f82","observation_id":"911aa333-4fbd-400d-93a8-4a6c81f74004","resolution":{"observed_at":"2026-07-30T12:53:40.992720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.23061/citation-record","integrity":"/paper/2605.23061/integrity","json":"/paper/2605.23061/citation-record.json","paper":"/paper/2605.23061"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-0-387-84858-7.url:","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Springer New York, 2009.isbn: 9780387848587.doi: 10.1007/978-0-387-84858-7.url: http://dx.doi.org/ 10.1007/978-0-387-84858-7","venue":null,"work_id":"bde88411-dd74-43b0-bb2a-ac32d5000767","year":2009},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:41be3eaf2b28419070d7b109e16e3ef3e338437810b60f04c59a46802ce90303","observation_id":"67d02533-35c5-4638-b25c-1a26bbf5814d","resolution":{"observed_at":"2026-05-25T05:40:23.229924Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T15:54:35.897521+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T15:54:35.897521+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5415bed5-26dd-4287-a322-e000a871a743","year":2016},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:de5ad4681a0bcef7a03386e541042823c685fa209dfee371c32a1692e5f08a71","observation_id":"9aabb2cc-5ff8-42f0-9867-2c7b94c703dd","resolution":{"observed_at":"2026-05-25T11:06:58.269281Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-45468-4","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:21:49.942457Z","title":"Bishop and Hugh Bishop.Deep Learning: Foundations and Concepts","venue":null,"work_id":"fe1cde39-66b7-4d47-a588-f99b6e722990","year":2024},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:5f3131b0269a2282841c0ece0e63280d5120862ebaebc70645fb5c690ce788a6","observation_id":"8a85edfd-c2a2-4c0e-86ed-c47c167aca36","resolution":{"observed_at":"2026-05-25T05:40:23.233823Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T15:54:36.236415+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T15:54:36.236415+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are few-shot learners","venue":null,"work_id":"0ef60909-9980-4b4d-bc22-c179423e8462","year":2020},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:ec63d89c4fcc46959b1799f425332d11bc331ed476b74be0a39b565559c4d899","observation_id":"221a12f4-7e15-46c3-8811-0178d95b8eae","resolution":{"observed_at":"2026-05-25T11:06:58.286494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-11T03:47:48.508181Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:d9539951e5ead8fd50b6d6a279a14f8aa6a9dfcd258be8897be7fb29142ca183","observation_id":"e5aa6c21-dbde-4fe0-8cfd-03de4c4f015e","resolution":{"observed_at":"2026-05-25T05:40:24.532456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-04T13:42:54.679705Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":"2303.18223","doi":"10.18653/v1/d16-1080","metadata_source":"pith","pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"A Survey of Large Language Models","venue":"cs.CL","work_id":"de1b42b5-4a0a-4b1f-8c78-1f7fe21be6c9","year":2023},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:411f0615870aead57129c4ad3bbf32c0b8762f9dd3499bd6861089dfa98c3f83","observation_id":"4f201f2a-9dff-45b2-bce7-fe03cec0439b","resolution":{"observed_at":"2026-05-25T05:40:24.503827Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06196","last_updated":"2025-03-23T14:51:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-09T05:37:09Z","title":"Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":"2402.06196","doi":"10.48550/arxiv.2402.06196","metadata_source":"pith","pith_arxiv_id":"2402.06196","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Large Language Models: A Survey","venue":"cs.CL","work_id":"54e385fe-1786-48c3-8aa0-d727210eb50e","year":2024},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2402.06196","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:f48daea5539aa737ef8925df31804a572281809b13d7d04e9bc7d9af354974d2","observation_id":"87c0db5d-2d91-48dd-8a04-aad34fe628b4","resolution":{"observed_at":"2026-05-25T05:40:24.511807Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":"2307.15818","doi":"10.48550/arxiv.2307.15818","metadata_source":"pith","pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-07-10T10:07:00.865372Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","venue":"cs.RO","work_id":"ff438a8a-8003-4fae-9131-acd418b3597b","year":2023},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:4bc450db1eba5089ff5d6439cc107593ba5fbaadb61d0e03f12c6b39c986c2a0","observation_id":"f52fb94d-c78b-4a5b-afed-9875b19345e0","resolution":{"observed_at":"2026-05-25T05:40:24.423186Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"cited_work":{"arxiv_id":"2405.14093","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14093","snapshot_observed_at":"2026-07-04T13:49:52.027583Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","venue":"cs.RO","work_id":"9492fb3d-d667-4892-81bb-b2878f12ff0c","year":2024},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2405.14093","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:8c8b922516f884eb9c7c38cb14cd5b59c87c539c65f3f7ee9a038bf2ffb00fdf","observation_id":"17e3ec70-d319-4ea3-bde8-9813059afdd8","resolution":{"observed_at":"2026-05-25T05:40:24.443258Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:ddf60bbb07c30426a051930a3798cb06d76a8963c6f7ee91d6dd09298f4bbc63","observation_id":"4892bc6b-ef57-4484-bce0-15fa5d73a10c","resolution":{"observed_at":"2026-05-25T05:40:24.480379Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.neunet.2019.01.012","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T01:15:50.407185Z","title":"Continual lifelong learning with neural networks: A review","venue":null,"work_id":"cd310820-2f5a-49cf-9a01-6a9d34cdd1df","year":2019},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:017c3c4801404d4797bd1c9bcdc123a562ef4030cbba7e5a74604cac672c7b0f","observation_id":"724c3f1f-4495-42aa-80a0-0a257583401f","resolution":{"observed_at":"2026-05-25T05:40:23.260375Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:10.847333+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:10.847333+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"14eefefb-0350-400d-a99b-d8fb94520a0a","year":null},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:23acfbbd9835c88ee4363682e26535bcbb9369d7bbb176f3cecc4b29bce5ec63","observation_id":"4017adeb-12d9-4bb8-a579-e7e9ca2d95f1","resolution":{"observed_at":"2026-05-25T11:06:58.254283Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00487","last_updated":"2024-02-06T09:12:09Z","snapshot_observed_at":"2026-07-06T14:47:04.817434Z","submitted_at":"2023-01-31T11:34:56Z","title":"A Comprehensive Survey of Continual Learning: Theory, Method and Application","version":3},"cited_work":{"arxiv_id":"2302.00487","doi":"10.48550/arxiv.2302.00487","metadata_source":"arxiv_reference","pith_arxiv_id":"2302.00487","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"A comprehensive survey of continual learning: Theory, method and application","venue":null,"work_id":"acaa87c8-169d-427c-b4fe-85ce385c44f6","year":2024},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2302.00487","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:0bc76060bb89d0c59ac5593e8ebec588d91138659f60a461ce6b526cd78c26d9","observation_id":"251165b9-b237-4ec4-a9eb-8b07b7125252","resolution":{"observed_at":"2026-05-25T05:40:24.475359Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1073/pnas","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:47:00.455049Z","title":"Overcoming catastrophic forgetting in neural networks","venue":null,"work_id":"95a362b1-dfc7-4356-b573-94d20a6c7a42","year":2018},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:392cedca858078653bca312426f96ff5a8289974d4e07bfd65766559b00b829a","observation_id":"1283b2a3-629d-4739-a3c2-a94040d7ab82","resolution":{"observed_at":"2026-05-25T05:40:23.249463Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2021.305744","doi":"10.1109/tpami.2021.3057446","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"doi: 10.1109/tpami.2021.3057446","venue":null,"work_id":"8a07ef8e-0391-42bd-b16a-cdca070ce347","year":2021},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:7ee515d41e4d4c3ce9fea96469042fbd9544e9b617a4dbc450cc916b3a361af4","observation_id":"0199a976-abba-44ac-8f18-043f7ffbcd57","resolution":{"observed_at":"2026-05-25T05:40:23.255421Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T11:53:30.757522+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T11:53:30.757522+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17401","last_updated":"2024-01-30T19:35:43Z","snapshot_observed_at":"2026-07-06T17:22:45.506107Z","submitted_at":"2024-01-30T19:35:43Z","title":"Step-size Optimization for Continual Learning","version":1},"cited_work":{"arxiv_id":"2401.17401","doi":"10.48550/arxiv.2401.17401","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.17401","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Step-size optimization for continual learning","venue":null,"work_id":"5e4ed761-3b2a-4bdf-b5ba-0731e2dd7b25","year":2024},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2401.17401","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:935562a41f0817b790471d56a84cb9da5c51cfb9839e484c5aa9711ad3982fae","observation_id":"fb1c99a0-322b-4d65-8366-52ffb74ba763","resolution":{"observed_at":"2026-05-25T05:40:24.484726Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.03702","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Anytime Pretraining: Horizon-Free Learning-Rate Schedules with Weight Averaging","venue":null,"work_id":"3a71e683-3cea-4895-9996-20795fb65fbd","year":2026},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:f20a3bad79d771f49b862ea9a8a7383f5c49218203423c4d4596dca9aa030d05","observation_id":"5eeb1719-cbdc-4b7f-9f0a-d55a1733160e","resolution":{"observed_at":"2026-05-25T05:40:24.491763Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The road less scheduled","venue":null,"work_id":"a596d824-20df-4dbe-8d04-1179266fb034","year":2024},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:9c7961e969774a1a1347999b9cd0a9cdb8cb9ef0021dea1b4e27d26788745bc9","observation_id":"cf92c9ef-22a9-4f53-89df-75f9fc990e26","resolution":{"observed_at":"2026-05-25T11:06:58.256754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24005","last_updated":"2025-05-29T20:57:31Z","snapshot_observed_at":"2026-07-06T21:33:17.306281Z","submitted_at":"2025-05-29T20:57:31Z","title":"How far away are truly hyperparameter-free learning algorithms?","version":1},"cited_work":{"arxiv_id":"2505.24005","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24005","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How far away are truly hyperparameter-free learning algorithms?","venue":null,"work_id":"200e9ac2-e116-41b2-9f84-e490180c321f","year":2025},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2505.24005","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:c80362f8402dbc1aed4b3da4e6fad85999353d72ebbbd67bf4a86374489788c2","observation_id":"7f427c20-eae5-4e91-ad3e-006e7fe8e863","resolution":{"observed_at":"2026-05-25T05:40:24.428103Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","venue":null,"work_id":"e4dfde3c-367d-4eeb-95a1-686d1e05969e","year":2017},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:75c3e79019c70924c9ad17beed1f0dfcda1c985a87b6fe002698b14f37369442","observation_id":"9ac3cbec-f844-4d44-b424-a23272ece849","resolution":{"observed_at":"2026-05-25T11:06:58.261862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":"2203.15556","doi":"10.1098/rsta.2024.0522","metadata_source":"pith","pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Compute-Optimal Large Language Models","venue":"cs.CL","work_id":"b2faf28d-86b7-429c-bc42-469458efc246","year":2022},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:b077d878b94e4e7053231aed243802f312273aff6cb010625e636bcdf087b093","observation_id":"dc25f9dc-fb26-48e5-b3f5-5c4212c40f59","resolution":{"observed_at":"2026-05-25T05:40:24.448291Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":"2404.06395","doi":"10.48550/arxiv.2404.06395","metadata_source":"pith","pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-07-11T03:07:51.226857Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","venue":"cs.CL","work_id":"f20a4304-bd39-414a-923b-d18322e29258","year":2024},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:9d86641613610c879391f9c606bacab9f6b5c1eb0233e034e68b1a66dd068d0a","observation_id":"9a6f8e3b-48f0-46de-8454-e44d0815df1d","resolution":{"observed_at":"2026-05-25T05:40:24.464134Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A method for solving the convex programming problem with convergence rate O (1/k2)","venue":null,"work_id":"d26239f2-84dc-44f7-9220-4a52cec89b38","year":1983},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:6b4f50047f1789469d3dead59334d6d21899f23ce1c9e7b204745475cc125060","observation_id":"3d0a5eff-72f4-4a3b-a1be-6549605a4382","resolution":{"observed_at":"2026-05-25T11:06:58.314739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An optimal method for stochastic composite optimization","venue":null,"work_id":"a0636bbc-dc83-4946-86bf-68baa4cdbd71","year":2012},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:aa1ca8ade755490fb9dbbb584a1f9ef1f9a7ee1e264f87ece2f8ad8c04b5c49f","observation_id":"f0dc8bfc-599a-4351-bf0a-42873447d8d6","resolution":{"observed_at":"2026-05-25T11:06:58.317721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c55ee492-9cb9-4354-8e48-f88f589a9ffd","year":null},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:e718fe7a4e6585f5316174b505c2fc0ab02f38d10a8a6caa96140072e1920ad5","observation_id":"ae44ae5f-2aed-4fca-892a-34785a321ea0","resolution":{"observed_at":"2026-05-25T11:06:58.306969Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18392","last_updated":"2024-10-17T12:01:15Z","snapshot_observed_at":"2026-07-06T18:21:26.195207Z","submitted_at":"2024-05-28T17:33:54Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","version":3},"cited_work":{"arxiv_id":"2405.18392","doi":"10.48550/arxiv.2405.18392","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.18392","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Hägele, E","venue":null,"work_id":"c6841d36-b590-485b-8412-d23a10afac5f","year":2024},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2405.18392","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:f76490cbbea33adf82fac0648bee467f6df3cdec89297ac1ebf22f7ea1811b46","observation_id":"bc7b8a2f-2565-494d-a659-9a50a5bd435c","resolution":{"observed_at":"2026-05-25T05:40:24.418964Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12082","last_updated":"2025-05-22T09:35:43Z","snapshot_observed_at":"2026-07-06T21:25:37.773959Z","submitted_at":"2025-05-17T16:53:14Z","title":"Model Merging in Pre-training of Large Language Models","version":3},"cited_work":{"arxiv_id":"2505.12082","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.12082","snapshot_observed_at":"2026-07-04T10:49:46.245243Z","title":"arXiv preprint arXiv:2505.12082 , year=","venue":null,"work_id":"a6b02b76-6c31-41bf-9706-2c3470dda4ad","year":2025},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2505.12082","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:e8a72488300cdc4798cb457180bc7255c23c2d2044cf021f637741e115994d92","observation_id":"e7bd2b19-81d5-452c-b607-0ede6828ea68","resolution":{"observed_at":"2026-05-25T05:40:24.455637Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05407","last_updated":"2019-02-25T14:18:11Z","snapshot_observed_at":"2026-07-31T19:09:21.589864Z","submitted_at":"2018-03-14T17:09:27Z","title":"Averaging Weights Leads to Wider Optima and Better Generalization","version":3},"cited_work":{"arxiv_id":"1803.05407","doi":"10.48550/arxiv.1803.05407","metadata_source":"pith","pith_arxiv_id":"1803.05407","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Averaging Weights Leads to Wider Optima and Better Generalization","venue":"cs.LG","work_id":"a7c6bded-245c-4243-8969-f16b6ac407ba","year":2018},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/1803.05407","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:8dda9deb05a85ad69558e43a354badc9d32667a3995a7c79789cfda1116bd2db","observation_id":"734cd0ed-0c2e-45b4-ae39-c37c855cfa57","resolution":{"observed_at":"2026-05-25T05:40:24.497687Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T20:53:38.184761+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T20:53:38.184761+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Accelerating neural network training: An analysis of the AlgoPerf competition","venue":null,"work_id":"dfa5f63b-d0f2-4812-b96a-c6a031fa3af6","year":2025},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:1d65dbb519ee3be2cb572cf906e0df0a3f63e2f269fab0d7a62a45918fcc5a81","observation_id":"97087dc8-858e-40c3-a174-7c77b116ca37","resolution":{"observed_at":"2026-05-25T11:06:58.302155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling laws and compute-optimal training beyond fixed training durations","venue":null,"work_id":"c7a787eb-9bcc-454d-a64a-cf5e377fbcce","year":2024},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:0af85342f1454abe796a671340ecca4c057158b1f60f3d772f5cf4d58e109c30","observation_id":"3781e209-7f0e-404a-abc0-4f0591517a7e","resolution":{"observed_at":"2026-05-25T11:06:58.292337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Through the River: Understanding the Benefit of Schedule-Free Methods for Language Model Training","venue":null,"work_id":"577df41c-36d4-4a70-9d87-a388a27d983e","year":2025},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:76807ce43ad3ea2b6b05ec296506db02e06a09d6b742d2697b5ee83d09655d6e","observation_id":"58681d5e-800d-4efe-922b-9265a976f7a8","resolution":{"observed_at":"2026-05-25T11:06:58.296111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2026.url:https://openreview.net/forum?id=Jw7khYzYzl","venue":null,"work_id":"aff77d2b-8942-4834-9e6c-2dac0500300f","year":2026},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:1883f132470b80a37ba04e58fac5ea3a12d8e2dc65ce67ddd309ec79fe1842fa","observation_id":"a5b054e3-4509-43e1-8ea0-9e677c8bf469","resolution":{"observed_at":"2026-05-25T11:06:58.299248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:c1711aa24546dc72edee04014d5a6ab80abfb6b3be84e7e2012b05b8c7565052","observation_id":"c1ae49cb-865d-4077-ae8d-5c4016a2b38c","resolution":{"observed_at":"2026-05-25T05:40:24.469368Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decoupled Weight Decay Regularization","venue":null,"work_id":"b06d5d34-f074-4510-a30d-1c4e7acb2234","year":2019},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:232faa8570948551d1e1bc1a734c3eced165a3e87390f0cd50b3123b1777483c","observation_id":"dd5b4946-474f-4a44-86ac-54def34d78af","resolution":{"observed_at":"2026-05-25T11:06:58.304630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"github.io/posts/muon/","venue":null,"work_id":"333b1ca1-11d4-475b-bbd7-3c7c3b61978f","year":2026},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:bcbaa0f778c5868436dba24ead88f1ecfe1ba0be97841d2166dfb47382b6e516","observation_id":"d7a3e429-7310-46ae-8dfe-73672a02e50f","resolution":{"observed_at":"2026-05-25T11:06:58.312112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GitHub repository, master branch","venue":null,"work_id":"335632ce-a479-4757-90d5-91a0ab2578e0","year":2024},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:9a381ec3c97b722759f32048505fa5f006548ded6d0171fe34457fc0770a9863","observation_id":"9da63cbe-e866-4e4f-b9ff-377539f30f36","resolution":{"observed_at":"2026-05-25T11:06:58.283791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.11005","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T17:08:43.650075Z","title":"Adamuon: Adaptive muon optimizer.arXiv preprint arXiv:2507.11005","venue":null,"work_id":"574efac8-2f9d-4bb8-96a9-1fbdaf2b87ef","year":2025},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:c2a212cc0611198c086895eef6c6408c143130f8f4c23280c998843b6f3cdfb8","observation_id":"cbf12a49-d647-4416-8000-59c3de7fd028","resolution":{"observed_at":"2026-05-25T05:40:24.311145Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.05491","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T21:35:37.637132Z","title":"Normuon: Making muon more efficient and scalable.arXiv preprint arXiv:2510.05491","venue":null,"work_id":"205004c8-7e64-4233-a0e6-c6782d1c2793","year":2025},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:44155a0280cc521b48b799a66635970def07f0a60bf14b0764ac3e4fc703b530","observation_id":"da4022e0-4eb4-46ff-a5c3-43b3f5f41210","resolution":{"observed_at":"2026-05-25T05:40:24.265559Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.05295","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T21:35:37.653099Z","title":"Dion: Distributed Orthonormalized Updates","venue":null,"work_id":"4ecfbe15-0efd-41f4-a129-82f6a2164d2f","year":2025},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:9830efb3911c95d3ee3a85164d95730aec4ef199d66336b50675c4caa82afeb3","observation_id":"7ad1e7b4-03bb-441d-bdbf-1c5c8a055192","resolution":{"observed_at":"2026-05-25T05:40:24.273862Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0d8604a2-b57c-4037-89fd-3b77f0bac27c","year":null},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:0b458fa1e9759291b4a1ac265aa92da4c33a38e52b8bf3afeb838ef17bc737af","observation_id":"8c0e42a4-0e5f-4e7d-9578-5ac6449d3be8","resolution":{"observed_at":"2026-05-25T11:06:58.280980Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.16928","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T14:29:54.485236Z","title":"arXiv preprint arXiv:2512.16928 , year=","venue":null,"work_id":"06ab448a-e346-485e-8f8b-37394e6aacd4","year":2002},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:bcc60d3855d00fe91e6627420383b423975fff6ccc3d75415e2d96b4d89977e5","observation_id":"d1f9dd4e-689a-4dc3-a1b2-7af7df958880","resolution":{"observed_at":"2026-05-25T05:40:24.255336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.20762","doi":"10.48550/arxiv.2503.20762","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Asgo: Adaptive structured gradient optimization.arXiv preprint arXiv:2503.20762","venue":null,"work_id":"96cc3325-c45a-429a-b585-8fbba970e8f2","year":2025},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:d9296639a7d09c67a8baedca2998d45a981d4e1fbd3b0f35e364feadf594255f","observation_id":"6b4f9160-9379-4a8b-adb5-f3d806c73a03","resolution":{"observed_at":"2026-05-25T05:40:24.260775Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"39a41ef8-083e-41e8-9f72-faa79b15ad78","year":null},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:484cc782b03bd24d25bee58f59dcf3aa59c6de09f99ba34bf83f72ed4ea2adcc","observation_id":"4202fc28-2be3-4ea4-b305-138ef9c2f5c6","resolution":{"observed_at":"2026-05-25T11:06:58.271411Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.28743","last_updated":"2026-04-05T02:15:47Z","snapshot_observed_at":"2026-07-06T22:51:09.377351Z","submitted_at":"2026-03-30T17:51:47Z","title":"Rethinking Language Model Scaling under Transferable Hypersphere Optimization","version":2},"cited_work":{"arxiv_id":"2603.28743","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.28743","snapshot_observed_at":"2026-07-04T20:30:07.808445Z","title":"Rethinking Language Model Scaling under Transferable Hypersphere Optimization","venue":"cs.LG","work_id":"a1af1144-5785-4fa7-bd69-f834d07539a9","year":2026},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2603.28743","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:96688b1b4fc13ace3bf2bdfd6ca4deb49cd695aadc59b0e9ee3a92ec649248c7","observation_id":"c56a5ba2-4dd0-446e-b9c0-8ea1944c0c4b","resolution":{"observed_at":"2026-05-25T05:40:24.236309Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16932","last_updated":"2026-05-04T23:23:45Z","snapshot_observed_at":"2026-07-06T21:28:43.610849Z","submitted_at":"2025-05-22T17:23:14Z","title":"The Polar Express: Optimal Matrix Sign Methods and Their Application to the Muon Algorithm","version":5},"cited_work":{"arxiv_id":"2505.16932","doi":"10.48550/arxiv.2505.16932","metadata_source":"pith","pith_arxiv_id":"2505.16932","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The Polar Express: Optimal Matrix Sign Methods and Their Application to the Muon Algorithm","venue":"cs.LG","work_id":"c822532f-f27e-4958-ad88-a763e23f2d22","year":2025},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2505.16932","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:0e814ad19e181887e4d7a3d4a8960bc933d7c9a5dcb7f63402d08ed43151a7d8","observation_id":"4f70ece4-361b-4344-be98-14b1abe311f1","resolution":{"observed_at":"2026-05-25T05:40:24.241637Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:23.891808+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:23.891808+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.09967","last_updated":"2026-06-05T21:42:21Z","snapshot_observed_at":"2026-08-01T20:47:26.868945Z","submitted_at":"2026-04-11T00:27:40Z","title":"Muon$^2$: Boosting Muon via Adaptive Second-Moment Preconditioning","version":2},"cited_work":{"arxiv_id":"2604.09967","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.09967","snapshot_observed_at":"2026-07-04T14:29:54.506905Z","title":"Muon$^2$: Boosting Muon via Adaptive Second-Moment Preconditioning","venue":"cs.LG","work_id":"bf261e7f-9de9-4e29-9103-cb7fe491fd72","year":2026},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2604.09967","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:5da485293fc85bea76ac812c3208c83275abea1c35701e1be75b96a2fc549fe8","observation_id":"f702449d-0877-4b3d-9b6a-8dfa10dbcd8d","resolution":{"observed_at":"2026-05-25T05:40:24.224200Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.16981","doi":"10.48550/arxiv.2510.16981","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2510.16981 , year=","venue":null,"work_id":"15052c26-b8e7-4957-ac0e-9af367d68fdf","year":2025},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:8b3d7aefefb8ac374e5795184fed2159f708491cf05e3296ac7c00500d49cf46","observation_id":"9f8da9b7-a8ef-4bfd-9ed4-e964f327b8a0","resolution":{"observed_at":"2026-05-25T05:40:24.219072Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.09678","last_updated":"2026-06-22T14:04:22Z","snapshot_observed_at":"2026-08-03T17:31:58.309433Z","submitted_at":"2025-12-10T14:25:45Z","title":"Ky Fan Norms and Beyond: Dual Norms and Combinations for Matrix Optimization","version":2},"cited_work":{"arxiv_id":"2512.09678","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.09678","snapshot_observed_at":"2026-06-30T18:45:00.440513Z","title":"Kravatskiy, I","venue":"math.OC","work_id":"bc633175-6eab-4368-8f9b-be122d9b7d96","year":2025},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2512.09678","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:38f051bdb148140707c96359acf12808724ba02d827536bd748779b9d31a0e97","observation_id":"bfd1da3e-5088-489f-b563-00cc80ae8c64","resolution":{"observed_at":"2026-06-23T04:13:43.394874Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-07-10T21:57:38.615639Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:75036c43f7ff1b72b22aec9cc789d4fff9fccef8222d8160b0530eb12428d5b4","observation_id":"b2bd861a-3e82-474f-a63a-6073cd79519e","resolution":{"observed_at":"2026-05-25T05:40:24.249511Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":"2602.02276","doi":"10.48550/arxiv.2602.02276","metadata_source":"pith","pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Kimi K2.5: Visual Agentic Intelligence","venue":"cs.CL","work_id":"d690be8f-5d53-49b0-b1e7-79668eb8fcdb","year":2026},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:0a27d0889a98457f101a56954d19916ae79e835fd0edc003d1f593ccaae0c897","observation_id":"e67cdeb2-97f3-4a86-8145-090ee9807ad5","resolution":{"observed_at":"2026-05-25T05:40:24.278884Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":"2602.15763","doi":"10.48550/arxiv.2602.15763","metadata_source":"pith","pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-07-10T13:57:07.038585Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","venue":"cs.LG","work_id":"ad29b1a2-bf77-46b3-9ead-fb62b1d2c6fe","year":2026},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:2152ef53030967377b5e93d2c91d678d337e9c676e4bedc8b81d9ef1d730ea32","observation_id":"5b18ae39-66bb-4075-9cf0-367d2ffc1c64","resolution":{"observed_at":"2026-05-25T05:40:24.294930Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.17004","doi":"10.48550/arxiv.2602.17004","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Singh, L","venue":null,"work_id":"6bdf7e9c-f0a1-4d6c-9f0e-1cc11a3c089a","year":2026},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:442bcf0a74638c5b270cad6b45ae35065f174207478b7284bb5b73d00f735c42","observation_id":"f2e13eb9-d30a-4278-ab3e-41a2d0883c94","resolution":{"observed_at":"2026-05-25T05:40:24.305666Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.04454","last_updated":"2018-05-07T15:43:39Z","snapshot_observed_at":"2026-07-30T23:08:51.956017Z","submitted_at":"2017-06-14T12:50:00Z","title":"Empirical Analysis of the Hessian of Over-Parametrized Neural Networks","version":3},"cited_work":{"arxiv_id":"1706.04454","doi":null,"metadata_source":"pith","pith_arxiv_id":"1706.04454","snapshot_observed_at":"2026-07-10T16:57:24.477823Z","title":"Empirical Analysis of the Hessian of Over-Parametrized Neural Networks","venue":"cs.LG","work_id":"c738d2ab-8cde-43fe-b76a-34a4da07689b","year":2017},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/1706.04454","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:4ecb9c8d483f91d20ce2d683cfa774d55f4981ba281512419d9ffdf722f7d0a6","observation_id":"e50a045e-4120-444d-b4fe-524039a2b5bc","resolution":{"observed_at":"2026-05-25T05:40:24.319208Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An Investigation into Neural Net Optimization via Hessian Eigenvalue Density","venue":null,"work_id":"790e1b75-aee2-4d22-84c2-5089aaaa6125","year":2019},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:c4a5e8791b84d98d8d8550f7813935dadde7616af7724f028ed1bf3163859c3c","observation_id":"bdf2fd9b-de55-453f-9c2c-af9ff0834f74","resolution":{"observed_at":"2026-05-25T11:06:58.273521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.04299","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T11:56:56.094916Z","title":"When do spectral gradient updates help in deep learning?arXiv preprint arXiv:2512.04299","venue":null,"work_id":"2b29279f-97b1-446c-a164-5217d6d534c3","year":2025},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:f7790d47201783ffea7f23df594e5f5c43dc32c6c0f524515b58b221ffb4ec7d","observation_id":"7c89e96a-d8b5-4e38-86b5-afd2b87a00df","resolution":{"observed_at":"2026-05-25T05:40:24.413339Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18965","last_updated":"2025-07-23T13:03:41Z","snapshot_observed_at":"2026-07-06T20:28:52.880548Z","submitted_at":"2025-01-31T08:55:56Z","title":"The Surprising Agreement Between Convex Optimization Theory and Learning-Rate Scheduling for Large Model Training","version":2},"cited_work":{"arxiv_id":"2501.18965","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18965","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The surprising agreement between convex optimization theory and learning-rate scheduling for large model training","venue":null,"work_id":"84158493-5e4b-43ba-b788-72c195f36943","year":2025},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2501.18965","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:89a2bc2b2bb3f4c1832036923f5af78a0165ac6bd87fa336f1594b7391c43f07","observation_id":"1b620e58-78fa-470b-81b9-c9e4586f43a6","resolution":{"observed_at":"2026-05-25T05:40:24.438563Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A simple weight decay can improve generalization","venue":null,"work_id":"25041b6e-1403-43fe-b11f-ea0e402ce748","year":1991},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:97d4c3203a4570468974f5d6dee248e72caf468b5453e2d15927d49750e9cf6b","observation_id":"8d8c894c-4621-4d69-a0a5-8d8fcc8d970e","resolution":{"observed_at":"2026-05-25T11:06:58.278425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04415","last_updated":"2024-11-04T23:21:13Z","snapshot_observed_at":"2026-07-06T16:28:55.209047Z","submitted_at":"2023-10-06T17:58:21Z","title":"Why Do We Need Weight Decay in Modern Deep Learning?","version":2},"cited_work":{"arxiv_id":"2310.04415","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.04415","snapshot_observed_at":"2026-07-04T20:30:07.694373Z","title":"arXiv: 2310.04415 [cs.LG].url:https://arxiv.org/abs/2310.04415","venue":null,"work_id":"c97a49ec-f435-4fcd-812a-ac270ff17004","year":2024},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2310.04415","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:15ca61eadeed04dacb5fee22aa91ded4ed42d3746f0b4f4bbe580a95818d2583","observation_id":"db8dc595-2794-4365-a6d7-96653c9c9a58","resolution":{"observed_at":"2026-05-25T05:40:24.519091Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.05620","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T12:06:55.443959Z","title":"Hyperparameter transfer enables consistent gains of matrix-preconditioned optimizers across scales","venue":null,"work_id":"046aa1a9-fd5f-4b43-ad97-505a74d192ca","year":2026},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:eacd0676a2ea441bb10860d4ad0d231870fb15f085395fa060b4ab9537e47f18","observation_id":"0cb985d7-ce27-4841-8b93-9909a7c52a84","resolution":{"observed_at":"2026-05-25T05:40:24.387899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.15816","last_updated":"2026-05-10T06:58:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T09:43:37Z","title":"On the Convergence of Muon and Beyond","version":5},"cited_work":{"arxiv_id":"2509.15816","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.15816","snapshot_observed_at":"2026-07-04T07:29:38.596450Z","title":"On the Convergence of Muon and Beyond","venue":"cs.LG","work_id":"4a43859c-1056-4934-bc0b-1d3e33bbc5b0","year":2025},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2509.15816","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:b00112ed3b12a2bea9ef4211cbfb933bf742258363ca71f350813abf81a0b916","observation_id":"1386eb37-7e9c-45ba-b3cf-1f36c73c8643","resolution":{"observed_at":"2026-05-25T05:40:24.401466Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23737","last_updated":"2026-07-28T01:40:23Z","snapshot_observed_at":"2026-07-31T23:54:11.554863Z","submitted_at":"2025-05-29T17:58:01Z","title":"On the Convergence Analysis of Muon","version":3},"cited_work":{"arxiv_id":"2505.23737","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23737","snapshot_observed_at":"2026-07-04T18:40:03.190709Z","title":"On the Convergence Analysis of Muon","venue":"stat.ML","work_id":"fe8817f3-ca08-4ed5-a8fd-c2bfdaf1a459","year":2025},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2505.23737","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:0a4d23a86629e0f46057814c5095abbb1925f0dba00adf5514f9b16953329387","observation_id":"d9dde0a3-d930-47c9-ae2e-fba44b67a9f4","resolution":{"observed_at":"2026-05-25T05:40:24.345524Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01598","last_updated":"2026-06-08T02:38:54Z","snapshot_observed_at":"2026-07-06T21:51:04.907326Z","submitted_at":"2025-07-02T11:03:13Z","title":"Convergence Bound and Critical Batch Size of Muon Optimizer","version":5},"cited_work":{"arxiv_id":"2507.01598","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01598","snapshot_observed_at":"2026-07-02T07:06:44.938841Z","title":"arXiv preprint arXiv:2507.01598 , year=","venue":"cs.LG","work_id":"6aa967c2-8099-4cdc-ade3-e9445e3cf5d4","year":2025},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2507.01598","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:3ec8f05508cf6b78a4b4cb80488c7d6aca5bd9bf4860a2f4cc61a0bfae645480","observation_id":"b00c8c1e-d3be-4c56-a083-653c7efde4b1","resolution":{"observed_at":"2026-06-09T03:07:01.590146Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02900","last_updated":"2025-06-01T18:46:31Z","snapshot_observed_at":"2026-07-31T00:12:42.892302Z","submitted_at":"2025-02-05T05:44:22Z","title":"A Note on the Convergence of Muon","version":2},"cited_work":{"arxiv_id":"2502.02900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02900","snapshot_observed_at":"2026-07-01T14:55:48.649763Z","title":"Li and M","venue":null,"work_id":"be3f1424-323d-44e4-9ebc-c38289176866","year":2025},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2502.02900","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:8a38bc73bca99ff825e11e940d199f9a33e3152383f2f9cf67f6d8fc73d3a313","observation_id":"de0e3aa4-45dc-4d3e-8fa1-4584cce08d28","resolution":{"observed_at":"2026-05-25T05:40:24.354022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20325","last_updated":"2024-12-06T14:09:22Z","snapshot_observed_at":"2026-08-03T03:18:47.425243Z","submitted_at":"2024-09-30T14:26:12Z","title":"Old Optimizer, New Norm: An Anthology","version":2},"cited_work":{"arxiv_id":"2409.20325","doi":"10.48550/arxiv.2409.20325","metadata_source":"pith","pith_arxiv_id":"2409.20325","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Old Optimizer, New Norm: An Anthology","venue":"cs.LG","work_id":"c0089db6-7349-44fd-b103-0d7b36142bab","year":2024},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2409.20325","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:92c60db74f26063a521e02dd44182a00e4a1e8877844f05ef27531edcf3d8967","observation_id":"3ee0d189-62ad-4671-aa00-b4f1980b6b93","resolution":{"observed_at":"2026-05-25T05:40:24.336072Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07529","last_updated":"2025-06-06T13:42:19Z","snapshot_observed_at":"2026-08-03T03:50:14.086851Z","submitted_at":"2025-02-11T13:10:34Z","title":"Training Deep Learning Models with Norm-Constrained LMOs","version":2},"cited_work":{"arxiv_id":"2502.07529","doi":"10.48550/arxiv.2502.07529","metadata_source":"pith","pith_arxiv_id":"2502.07529","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Training Deep Learning Models with Norm-Constrained LMOs","venue":"cs.LG","work_id":"4f1b774a-8ada-4d79-a90b-520511fce5d0","year":2025},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2502.07529","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:f77d09df3d599381219c9889dbe2c527fb71e558f2dae89afadaa20c03a43920","observation_id":"8267c817-5880-460a-9aa3-dc452ab96d33","resolution":{"observed_at":"2026-05-25T05:40:24.361216Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Symbolic discovery of optimization algorithms","venue":null,"work_id":"b1aec7b8-d80c-413a-a59b-eb4ef8acb042","year":2023},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:82234c24fb720427f86a713de9922553fbb669606a55d6dcbfaa56f7fca6e241","observation_id":"093566bb-d9d4-4404-afee-5be8aee48a0a","resolution":{"observed_at":"2026-05-25T11:06:58.275836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.09568","last_updated":"2018-03-02T00:12:58Z","snapshot_observed_at":"2026-07-06T06:25:29.112809Z","submitted_at":"2018-02-26T19:36:41Z","title":"Shampoo: Preconditioned Stochastic Tensor Optimization","version":2},"cited_work":{"arxiv_id":"1802.09568","doi":"10.48550/arxiv.1802.09568","metadata_source":"pith","pith_arxiv_id":"1802.09568","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Shampoo: Preconditioned Stochastic Tensor Optimization","venue":"cs.LG","work_id":"85339699-854e-4bf1-aa39-0d8b72be6def","year":2018},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/1802.09568","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:130925e52331ad51558abbef0e052531eaca3fb27a02db4d2cc7b88a61afae2f","observation_id":"93238a18-f7a6-4540-9b12-60593d0f5c68","resolution":{"observed_at":"2026-05-25T05:40:24.527641Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-07-06T05:46:07.424788Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":"1706.02677","doi":"10.48550/arxiv.1706.02677","metadata_source":"pith","pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","venue":"cs.CV","work_id":"f3dc32a4-cf81-467b-8ff4-3b2f21d3bf1f","year":2017},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:e1778f295341d54401d4ac344116076e0580448974bd9dfcfb2816f8953450ba","observation_id":"af06c929-b330-4528-b2ba-34324b6a7670","resolution":{"observed_at":"2026-05-25T05:40:24.284758Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:09.485311+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:09.485311+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Why warmup the learning rate? underlying mechanisms and improvements","venue":null,"work_id":"d1f5cca2-0260-42d4-bad3-9e4cf857c802","year":2024},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:3491991ae886d608018763b3e7fa940298459d3b4d927a8cec8fe44610e0e36e","observation_id":"7649af41-a85f-44e5-a7d0-dbc786496e79","resolution":{"observed_at":"2026-05-25T11:06:58.289424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning-rate-free learning by d-adaptation","venue":null,"work_id":"454d5bd1-1a21-4c2c-b2ff-7f8ee8a6c855","year":2023},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:46af08273722057415b4d29161e89f28f36cac5abca3a6839022d903d16e4789","observation_id":"3597113d-4245-4936-aff3-fa33bbb30e4c","resolution":{"observed_at":"2026-05-25T11:06:58.309669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":"1e30b616-046a-4d1b-addd-67766985e714","year":2017},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:46b56d64709400d7585c462e285399e4bdc48b14b5687262ea7a8f6ae0a77955","observation_id":"07ba298f-8ec4-40ac-bca2-03702ff427be","resolution":{"observed_at":"2026-05-25T11:06:58.264580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GShard: Scaling giant models with conditional computation and automatic sharding","venue":null,"work_id":"dcb5c3b5-cf91-4194-b15b-454479865c19","year":2021},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:2dc494805861738f429eb8798f04acc82a479a188f25ea1e2f7731f529ca7d7f","observation_id":"d667cc57-783f-4636-ac3f-6211c7dfdcdd","resolution":{"observed_at":"2026-05-25T11:06:58.267214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Switch Transformers: scaling to trillion parameter models with simple and efficient sparsity","venue":null,"work_id":"0129b169-500e-4f63-a4f6-c1c037b53171","year":2022},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:102ab71075c5fb0cd58c22c06de762bd66900c56a50a95631d731fb180a54b22","observation_id":"c52a1439-7518-4f38-8aa4-55ee3979ecff","resolution":{"observed_at":"2026-05-25T11:06:58.259436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05350","last_updated":"2017-06-16T17:08:08Z","snapshot_observed_at":"2026-07-06T05:47:10.770104Z","submitted_at":"2017-06-16T17:08:08Z","title":"L2 Regularization versus Batch and Weight Normalization","version":1},"cited_work":{"arxiv_id":"1706.05350","doi":null,"metadata_source":"pith","pith_arxiv_id":"1706.05350","snapshot_observed_at":"2026-07-04T20:30:07.604801Z","title":"L2 Regularization versus Batch and Weight Normalization","venue":"cs.LG","work_id":"17e14df7-cc67-4fa7-b09c-4bc22ea9e76a","year":2017},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/1706.05350","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:d6f707c90bf6b951b2426b769cd50b50b82e9be636a4ea519517bc14a3a9fc32","observation_id":"e2df2b38-aae1-4530-962d-b1c83bf6e800","resolution":{"observed_at":"2026-05-25T05:40:24.369953Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02285","last_updated":"2025-06-09T22:08:17Z","snapshot_observed_at":"2026-07-06T21:35:27.380132Z","submitted_at":"2025-06-02T21:51:04Z","title":"Why Gradients Rapidly Increase Near the End of Training","version":2},"cited_work":{"arxiv_id":"2506.02285","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02285","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Why gradients rapidly increase near the end of training.arXiv preprint arXiv: 2506.02285","venue":null,"work_id":"d7d91978-0bbd-407c-b5ea-208029246d0d","year":2025},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2506.02285","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:13ea49c4fa9365425e4eedfbcc4e40e1b4669cb714364b7b6ce70b7fa0caa0e4","observation_id":"41ab2342-e1d9-4e23-96d5-104b291b08d0","resolution":{"observed_at":"2026-05-25T05:40:24.375625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:3167f3b38dbf3d582cf02a733aa26eea85ae8b86e38e109417e79243195ce3ae","observation_id":"76de1a34-8ab0-4056-b083-46b6444a6dfc","resolution":{"observed_at":"2026-05-25T05:40:24.380560Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":"2104.09864","doi":"10.48550/arxiv.2104.09864","metadata_source":"pith","pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-07-11T01:27:45.562618Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","venue":"cs.CL","work_id":"4e5eee26-cd04-4c7a-988f-3e6d1a1f0eb9","year":2021},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:19a4049590c11fbd9393299d0934e5f9f763d61e3fd08749ac96d061924058f8","observation_id":"be9dc4e6-b669-4878-8b39-0408b168cd49","resolution":{"observed_at":"2026-05-25T05:40:24.405967Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:49:47.452101+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:49:47.452101+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07467","last_updated":"2019-10-16T16:44:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-16T16:44:22Z","title":"Root Mean Square Layer Normalization","version":1},"cited_work":{"arxiv_id":"1910.07467","doi":"10.48550/arxiv.1910.07467","metadata_source":"pith","pith_arxiv_id":"1910.07467","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Root Mean Square Layer Normalization","venue":"cs.LG","work_id":"2e813694-442c-4650-ba76-478100469518","year":2019},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/1910.07467","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:e8d832d5672dcee66a6c792fe2a8336671c57ecdf2e201e1b510e1d942eb7d5f","observation_id":"702288e3-12f0-4650-bcf9-229a2de7090a","resolution":{"observed_at":"2026-05-25T05:40:24.323889Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03804","last_updated":"2024-02-06T08:45:51Z","snapshot_observed_at":"2026-08-02T09:16:44.753323Z","submitted_at":"2024-02-06T08:45:51Z","title":"ReLU$^2$ Wins: Discovering Efficient Activation Functions for Sparse LLMs","version":1},"cited_work":{"arxiv_id":"2402.03804","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.03804","snapshot_observed_at":"2026-07-02T19:17:17.632979Z","title":"ReLU 2 wins: Discovering efficient activation functions for sparse llms","venue":null,"work_id":"313c45fb-6bb6-4766-92e0-3d4e946c5e53","year":2024},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2402.03804","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:20c9ad8d9698d1516050ae551bc8ca54e492c0e383c55da720a3169be6a6e6c8","observation_id":"b92b3a43-0820-419f-af66-e9f00abc0dc5","resolution":{"observed_at":"2026-05-25T05:40:24.331701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3ec68c4a-b267-4141-8408-bddc2cb114d9","year":2022},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:aa651b8ce3edfb76e4ea37a6d4ee0c5383da71b886d136f74c4d880a0ca6c070","observation_id":"00610a37-d084-49bc-8032-ffbe8daaebbc","resolution":{"observed_at":"2026-05-25T11:00:42.090072Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024.url:https://github","venue":null,"work_id":"9c125b9d-c435-4a5d-9c89-2e2f8b58b76e","year":2024},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:8ed701354bba70d2751bad561a40f873adc674c0ee1a8924b3cdbef756cde2cc","observation_id":"1aa4e422-a58a-4f3d-aff9-67b8f9290aa9","resolution":{"observed_at":"2026-05-25T11:00:42.093213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1483da96-fcac-4a52-82a0-6f726bcb5d70","year":null},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:945e9d69249273ff69df57a1ed4eba0fe31729edb56b44b5f9003e84fc448116","observation_id":"1066c9f0-f270-4d08-8889-9421d6dc335c","resolution":{"observed_at":"2026-05-25T11:00:42.086846Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-02T15:25:02.551919Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":"2406.17557","doi":"10.48550/arxiv.2406.17557","metadata_source":"pith","pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-07-10T14:57:14.494809Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","venue":"cs.CL","work_id":"1ac90585-1330-4f90-8836-6382fa63c4eb","year":2024},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:69f82b4582f6448c0689c099f60edfab01b2063fc85a35dcac865290eccda35a","observation_id":"d9b1ee6d-add6-4bb5-be52-bc8337f1852f","resolution":{"observed_at":"2026-05-25T05:40:24.365491Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"09aea560-20a3-4be7-8e12-41333de88279","year":2019},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:c11e290c18279e3ef1f67a3d1b09ab1b227f7db84ff28115a698376d23beb4d0","observation_id":"2b035606-8fee-4a37-a626-930f3ded1fc6","resolution":{"observed_at":"2026-05-25T11:00:42.080212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2021.306139","doi":"10.1109/mm.2021.3061394","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"NVIDIA A100 Tensor Core GPU: Performance and Innovation","venue":null,"work_id":"05191062-6b26-4f92-b0a6-c07f4e1f345d","year":2021},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:3a26f742e7e4fe4f7e04af91c31cd73e685046a80854b4be184a96c22a5bb518","observation_id":"b4022916-51ae-42d7-a89d-ecb63214b796","resolution":{"observed_at":"2026-05-25T05:40:23.239671Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T15:54:36.589228+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T15:54:36.589228+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0665.364036","doi":"10.1145/3620665.3640360","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"PyTorch 2: Faster Machine Learning Through Dynamic Python Bytecode Transforma- tion and Graph Compilation","venue":null,"work_id":"abd261ad-4aca-4ea3-8090-344914daba35","year":2024},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:29430b6bcdf2ed39af211594284e38d9a4d610de4a3782e9b5e36e00fb9eb99d","observation_id":"3b386363-0cd0-4515-8db0-d0b689d21da4","resolution":{"observed_at":"2026-05-25T05:40:23.245462Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.01878","last_updated":"2019-09-26T06:53:59Z","snapshot_observed_at":"2026-07-06T08:12:32.266805Z","submitted_at":"2019-08-05T21:56:41Z","title":"How Does Learning Rate Decay Help Modern Neural Networks?","version":2},"cited_work":{"arxiv_id":"1908.01878","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1908.01878","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Anytime Training with Schedule-Free Spectral Optimization","venue":null,"work_id":"026b8b15-298f-404b-a94f-781cda43102e","year":2019},"citing_paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:16.958574Z"},"links":{"cited_paper":"/paper/1908.01878","citing_paper":"/paper/2605.23061"},"observation_digest":"sha256:fc7266deea6ff4373641e9a62c05194431d7362d50c624bd941fcedcaa90160f","observation_id":"dfd38cb2-6973-46bd-adf8-f44cc189dfc8","resolution":{"observed_at":"2026-05-25T05:40:24.300674Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.23061","last_updated":"2026-05-21T21:50:22Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T04:10:09.683333Z","submitted_at":"2026-05-21T21:50:22Z","title":"Anytime Training with Schedule-Free Spectral Optimization"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":2,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":7,"verified_exact":53,"verified_fuzzy":22},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 2 inbound Pith citation observations for arXiv:2605.23061."}