{"as_of":"2026-08-05T03:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:163eb7e9ea76ce28b61f743613e26d5f04594de7a702037b42969251ca08e236","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":33,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:14:11.425305Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":"2509.02046","doi":"10.48550/arxiv.2509.02046","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046","venue":"ArXiv.org","work_id":"692b6526-174d-4275-b06f-8afe06e28a6c","year":2025},"citing_paper":{"arxiv_id":"2510.10777","last_updated":"2026-05-16T11:31:52Z","snapshot_observed_at":"2026-07-06T22:32:27.698678Z","submitted_at":"2025-10-12T19:39:41Z","title":"Preconditioned Norms: A Unified Framework for Steepest Descent, Quasi-Newton and Adaptive Methods","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T21:05:49.844436Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2510.10777"},"observation_digest":"sha256:b08eabaac250f0c5763f25fcd37b1f369b7236c867c0c2718044fb16ca474845","observation_id":"f38538cf-f7e0-436e-b8e9-b6e9313e9272","resolution":{"observed_at":"2026-05-21T21:10:38.720512Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-03T18:37:49.641148Z","title":"Fan- tastic Pretraining Optimizers and Where to Find Them, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04632","last_updated":"2026-07-06T09:24:33Z","snapshot_observed_at":"2026-08-03T18:37:48.859151Z","submitted_at":"2025-12-04T10:06:22Z","title":"Turbo-Muon: Almost-Orthogonal Pre-Conditioning for Fast Muon Updates","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T18:37:49.641148Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2512.04632"},"observation_digest":"sha256:7ce010652a2b1803e68e4764be44c429595d189502a472c69ecd2ba9b0695032","observation_id":"964e456e-177a-4e3b-bc09-f0b9049f41fb","resolution":{"observed_at":"2026-08-03T18:37:49.641148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-03T04:14:19.794420Z","title":", Hall, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05725","last_updated":"2026-06-03T16:40:26Z","snapshot_observed_at":"2026-08-03T04:14:09.367178Z","submitted_at":"2026-02-05T14:49:40Z","title":"Muon in Associative Memory Learning: Training Dynamics and Scaling Laws","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-03T04:14:19.794420Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2602.05725"},"observation_digest":"sha256:9064b44fe0eea1f6e4678e677a85c96082640c52214544f244a2ed8e5c8e36b6","observation_id":"3187522e-4ef4-4844-bb9d-9a5227304be8","resolution":{"observed_at":"2026-08-03T04:14:19.794420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-03T03:56:43.064248Z","title":"Fantastic pretraining optimizers and where to find them","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-03T03:56:33.742201Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:43.064248Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:00b3a9371eb68cd7d92238be787c8224441d6d9d5005d5dd9a23f305a8375232","observation_id":"1cda9634-30c0-49fb-bbc4-4c47b6d58783","resolution":{"observed_at":"2026-08-03T03:56:43.064248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":"2509.02046","doi":"10.48550/arxiv.2509.02046","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046","venue":"ArXiv.org","work_id":"692b6526-174d-4275-b06f-8afe06e28a6c","year":2025},"citing_paper":{"arxiv_id":"2602.22437","last_updated":"2026-04-21T21:24:42Z","snapshot_observed_at":"2026-07-06T22:47:06.893212Z","submitted_at":"2026-02-25T21:55:43Z","title":"veScale-FSDP: Flexible and High-Performance FSDP at Scale","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T19:03:22.142671Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2602.22437"},"observation_digest":"sha256:608a51c99eb1ffff166ab6880034def99d5125f0f9dce688f07ddfc238b83e2d","observation_id":"eae161c7-baa0-42d0-bf11-6d220841f47d","resolution":{"observed_at":"2026-05-15T19:06:30.851781Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":"2509.02046","doi":"10.48550/arxiv.2509.02046","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046","venue":"ArXiv.org","work_id":"692b6526-174d-4275-b06f-8afe06e28a6c","year":2025},"citing_paper":{"arxiv_id":"2603.10067","last_updated":"2026-05-21T20:35:00Z","snapshot_observed_at":"2026-07-06T22:48:35.345421Z","submitted_at":"2026-03-10T02:12:24Z","title":"HTMuon: Improving Muon via Heavy-Tailed Spectral Correction","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-25T06:50:29.893126Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2603.10067"},"observation_digest":"sha256:3952107f0e99429ad4c9e1587b9bcacd369ef94084e3fc2a7176fe8a2a17493f","observation_id":"45c9cbeb-8e58-40d2-a287-70f50c676984","resolution":{"observed_at":"2026-05-25T06:55:26.412629Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":"2509.02046","doi":"10.48550/arxiv.2509.02046","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046","venue":"ArXiv.org","work_id":"692b6526-174d-4275-b06f-8afe06e28a6c","year":2025},"citing_paper":{"arxiv_id":"2603.20527","last_updated":"2026-05-13T10:41:39Z","snapshot_observed_at":"2026-08-03T01:51:27.958885Z","submitted_at":"2026-03-20T21:55:28Z","title":"RMNP: Row-Momentum Normalized Preconditioning for Scalable Matrix-Based Optimization","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T07:49:39.417566Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2603.20527"},"observation_digest":"sha256:97f2361ab9ffc029535f6ad05a5f51ad89d9b6ffc742ae1b12b1238ce9fb719c","observation_id":"0423938f-6997-4215-8d7a-8b4f96ee6e75","resolution":{"observed_at":"2026-05-15T07:49:50.822903Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":"2509.02046","doi":"10.48550/arxiv.2509.02046","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046","venue":"ArXiv.org","work_id":"692b6526-174d-4275-b06f-8afe06e28a6c","year":2025},"citing_paper":{"arxiv_id":"2603.26554","last_updated":"2026-04-28T07:36:37Z","snapshot_observed_at":"2026-07-06T22:50:46.243903Z","submitted_at":"2026-03-27T16:13:18Z","title":"Sharp Capacity Scaling of Spectral Optimizers in Learning Associative Memory","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-14T23:37:33.106390Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2603.26554"},"observation_digest":"sha256:801a72c0ece4357a01cd30c747eae02ca7c35eef8b2abce3e57100884f660279","observation_id":"1f5344e2-3042-47f1-a1c2-303c255b71b2","resolution":{"observed_at":"2026-05-14T23:38:16.348622Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":"2509.02046","doi":"10.48550/arxiv.2509.02046","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046","venue":"ArXiv.org","work_id":"692b6526-174d-4275-b06f-8afe06e28a6c","year":2025},"citing_paper":{"arxiv_id":"2604.09258","last_updated":"2026-05-27T08:05:02Z","snapshot_observed_at":"2026-07-12T23:23:17.075790Z","submitted_at":"2026-04-10T12:17:18Z","title":"Nexus: Same Pretraining Loss, Better Downstream Generalization via Common Minima","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T17:53:39.356675Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2604.09258"},"observation_digest":"sha256:4173267112fe051c4de02c24a8132c9bba7f713e5931280d5d018d87b46c5605","observation_id":"82352a83-1657-48a1-ae2c-5a141f6d954d","resolution":{"observed_at":"2026-05-11T05:55:57.149494Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":"2509.02046","doi":"10.48550/arxiv.2509.02046","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046","venue":"ArXiv.org","work_id":"692b6526-174d-4275-b06f-8afe06e28a6c","year":2025},"citing_paper":{"arxiv_id":"2604.27077","last_updated":"2026-05-01T03:33:05Z","snapshot_observed_at":"2026-07-06T23:12:38.453388Z","submitted_at":"2026-04-29T18:11:42Z","title":"Learning Rate Transfer in Normalized Transformers","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-07T09:01:45.365126Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2604.27077"},"observation_digest":"sha256:bbb0f8ccf169dcb56d56cfd0ecd7e3765715279e5afa31be769b3bc723511e9d","observation_id":"976464af-4b08-4e2e-818d-ef83aef632dc","resolution":{"observed_at":"2026-05-12T09:51:28.109887Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":"2509.02046","doi":"10.48550/arxiv.2509.02046","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046","venue":"ArXiv.org","work_id":"692b6526-174d-4275-b06f-8afe06e28a6c","year":2025},"citing_paper":{"arxiv_id":"2605.03769","last_updated":"2026-05-05T14:00:27Z","snapshot_observed_at":"2026-07-06T23:16:40.201701Z","submitted_at":"2026-05-05T14:00:27Z","title":"Nora: Normalized Orthogonal Row Alignment for Scalable Matrix Optimizer","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-07T16:42:34.498806Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2605.03769"},"observation_digest":"sha256:f8b06e6ecab2474ee0fa09e853ab537812fbb658c61383bfae388f4d92f4a0a1","observation_id":"667184e4-2aa4-4ca9-945d-e97cf1d7bc88","resolution":{"observed_at":"2026-05-11T23:36:18.174334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":"2509.02046","doi":"10.48550/arxiv.2509.02046","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046","venue":"ArXiv.org","work_id":"692b6526-174d-4275-b06f-8afe06e28a6c","year":2025},"citing_paper":{"arxiv_id":"2605.06615","last_updated":"2026-05-07T17:32:09Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:32:09Z","title":"When and Why SignSGD Outperforms SGD: A Theoretical Study Based on $\\ell_1$-norm Lower Bounds","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-08T12:14:28.866499Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2605.06615"},"observation_digest":"sha256:13093d0e37569ba1947f2a8db3ad8350d2e78e9a76bf25825b1dfd6e99439498","observation_id":"62576796-335e-471c-bb0b-376f8ad12a17","resolution":{"observed_at":"2026-05-11T19:21:07.633144Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":"2509.02046","doi":"10.48550/arxiv.2509.02046","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046","venue":"ArXiv.org","work_id":"692b6526-174d-4275-b06f-8afe06e28a6c","year":2025},"citing_paper":{"arxiv_id":"2605.06654","last_updated":"2026-05-07T17:57:02Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:57:02Z","title":"Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-08T12:00:49.127471Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2605.06654"},"observation_digest":"sha256:59f3671409e2d5c78269f90dbe36674d20996bdd2c9ca50812321ce3fceb39f2","observation_id":"fbb0ff62-ebc5-4ca2-8e0d-a4c89742f877","resolution":{"observed_at":"2026-05-11T19:26:08.470520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":"2509.02046","doi":"10.48550/arxiv.2509.02046","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046","venue":"ArXiv.org","work_id":"692b6526-174d-4275-b06f-8afe06e28a6c","year":2025},"citing_paper":{"arxiv_id":"2605.08678","last_updated":"2026-07-06T13:36:13Z","snapshot_observed_at":"2026-07-31T14:41:52.251938Z","submitted_at":"2026-05-09T04:29:46Z","title":"MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI","version":1},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-05-12T01:13:35.990078Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2605.08678"},"observation_digest":"sha256:b8b9580c36797b525850037f925d6c015204d8ff9e8d027e5f6f548c008d4c7b","observation_id":"b5ce6606-3afd-4753-8fbe-36c999d936d4","resolution":{"observed_at":"2026-05-12T01:16:13.971114Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":"2509.02046","doi":"10.48550/arxiv.2509.02046","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046","venue":"ArXiv.org","work_id":"692b6526-174d-4275-b06f-8afe06e28a6c","year":2025},"citing_paper":{"arxiv_id":"2605.08678","last_updated":"2026-07-06T13:36:13Z","snapshot_observed_at":"2026-07-31T14:41:52.251938Z","submitted_at":"2026-05-09T04:29:46Z","title":"MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI","version":2},"reference_index":111,"source":"pdf_text","source_observed_at":"2026-06-30T23:12:57.154537Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2605.08678"},"observation_digest":"sha256:bf219b7daa4bb79b86484feead50146369409ac7597c9007c560048ef49c6779","observation_id":"c7aaea17-60d5-4bbb-a83d-bfc264e11e66","resolution":{"observed_at":"2026-06-30T23:15:07.177366Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-07-12T17:14:49.310598Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.08678","last_updated":"2026-07-06T13:36:13Z","snapshot_observed_at":"2026-07-31T14:41:52.251938Z","submitted_at":"2026-05-09T04:29:46Z","title":"MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI","version":3},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-07-12T17:14:49.310598Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2605.08678"},"observation_digest":"sha256:a6d5f12cef9a34f0a7d3401a38d1738e657102d0f25570e10b1e1f658c4960b5","observation_id":"83300933-3b3f-4df1-9f4f-f735584b1a98","resolution":{"observed_at":"2026-07-12T17:14:49.310598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":"2509.02046","doi":"10.48550/arxiv.2509.02046","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046","venue":"ArXiv.org","work_id":"692b6526-174d-4275-b06f-8afe06e28a6c","year":2025},"citing_paper":{"arxiv_id":"2605.09238","last_updated":"2026-05-10T00:39:13Z","snapshot_observed_at":"2026-08-02T15:17:04.657553Z","submitted_at":"2026-05-10T00:39:13Z","title":"Intrinsic Muon: Spectral Optimization on Riemannian Matrix Manifolds","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-12T05:07:39.558349Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2605.09238"},"observation_digest":"sha256:f2342a30e4363146d4cf05f10071bdcfd1c33c215c67f384d1db602e9a1f5c60","observation_id":"d1edfce4-3e4b-4d1c-8c6e-0eb732e10983","resolution":{"observed_at":"2026-05-12T05:36:26.240024Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":"2509.02046","doi":"10.48550/arxiv.2509.02046","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046","venue":"ArXiv.org","work_id":"692b6526-174d-4275-b06f-8afe06e28a6c","year":2025},"citing_paper":{"arxiv_id":"2605.12316","last_updated":"2026-05-12T16:01:29Z","snapshot_observed_at":"2026-07-06T23:24:03.984179Z","submitted_at":"2026-05-12T16:01:29Z","title":"Autoregressive Learning in Joint KL: Sharp Oracle Bounds and Lower Bounds","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-13T06:55:33.934110Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2605.12316"},"observation_digest":"sha256:f66288701b77ba90ac4ae482756deecac3d8b76b3f16e0b618d12933dd07a921","observation_id":"e115f5b4-becb-48f0-acdc-f7a5f41557a1","resolution":{"observed_at":"2026-05-13T06:57:27.817835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":"2509.02046","doi":"10.48550/arxiv.2509.02046","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046","venue":"ArXiv.org","work_id":"692b6526-174d-4275-b06f-8afe06e28a6c","year":2025},"citing_paper":{"arxiv_id":"2605.22644","last_updated":"2026-05-21T15:50:40Z","snapshot_observed_at":"2026-08-02T21:41:54.474589Z","submitted_at":"2026-05-21T15:50:40Z","title":"Why SGD is not Brownian Motion: A New Perspective on Stochastic Dynamics","version":1},"reference_index":193,"source":"arxiv_source","source_observed_at":"2026-05-22T08:06:52.309619Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2605.22644"},"observation_digest":"sha256:f0734b4803f9d5f0f1e5b8120e9aec49940f0b4db117ee43cfd2ccd851ee2e42","observation_id":"b457b631-d7cc-4b75-8145-dab4e41cbdb1","resolution":{"observed_at":"2026-05-22T08:11:17.334293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":"2509.02046","doi":"10.48550/arxiv.2509.02046","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046","venue":"ArXiv.org","work_id":"692b6526-174d-4275-b06f-8afe06e28a6c","year":2025},"citing_paper":{"arxiv_id":"2605.28585","last_updated":"2026-05-27T15:09:02Z","snapshot_observed_at":"2026-07-06T23:38:09.179597Z","submitted_at":"2026-05-27T15:09:02Z","title":"Outer-Momentum Restarting in High-Dimensional Two-Phase Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T13:31:23.664332Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2605.28585"},"observation_digest":"sha256:4accaa460830657eeb3b7bfcfcbafcc0bba535e7c091d84daf2f9efb0a51ef70","observation_id":"d0f2ed9f-c84e-42de-956b-b61d2f203592","resolution":{"observed_at":"2026-06-29T13:33:27.476640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":"2509.02046","doi":"10.48550/arxiv.2509.02046","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046","venue":"ArXiv.org","work_id":"692b6526-174d-4275-b06f-8afe06e28a6c","year":2025},"citing_paper":{"arxiv_id":"2605.31371","last_updated":"2026-05-29T14:41:36Z","snapshot_observed_at":"2026-08-02T20:37:42.071643Z","submitted_at":"2026-05-29T14:41:36Z","title":"Softsign: Smooth Sign in Your Optimizer For Better Parameter Heterogeneity Handling","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-28T22:51:38.488754Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2605.31371"},"observation_digest":"sha256:018452613aa89d573cd7a9b2443fd020c5602a02e8fae288085670430361e29f","observation_id":"d2eb29d1-de31-4c07-b3b5-2c583f1487ae","resolution":{"observed_at":"2026-06-28T22:52:44.833271Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":"2509.02046","doi":"10.48550/arxiv.2509.02046","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046","venue":"ArXiv.org","work_id":"692b6526-174d-4275-b06f-8afe06e28a6c","year":2025},"citing_paper":{"arxiv_id":"2606.03899","last_updated":"2026-06-03T02:06:07Z","snapshot_observed_at":"2026-08-01T15:38:47.150046Z","submitted_at":"2026-06-02T16:54:38Z","title":"Denoise First, Orthogonalize Later: Understanding Momentum in Muon via Spectral Filtering","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-28T11:24:38.292078Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2606.03899"},"observation_digest":"sha256:d04dbfd028da52770eb24d826811c086e5a264f69528ffe6cc97fb2639d75666","observation_id":"d05cb868-6074-46e3-9e81-f8ae3f2a6616","resolution":{"observed_at":"2026-07-02T01:56:27.790713Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":"2509.02046","doi":"10.48550/arxiv.2509.02046","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046","venue":"ArXiv.org","work_id":"692b6526-174d-4275-b06f-8afe06e28a6c","year":2025},"citing_paper":{"arxiv_id":"2606.04058","last_updated":"2026-06-05T12:50:11Z","snapshot_observed_at":"2026-07-06T23:44:14.261541Z","submitted_at":"2026-06-02T11:31:21Z","title":"Spectral Scaling Laws of Muon","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T11:19:05.939340Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2606.04058"},"observation_digest":"sha256:a0e3add7186384a749c82f6a58900f6a5e8c44de5b697c24ebd7298384491cf2","observation_id":"94d13898-bea1-4079-be73-c505814531f1","resolution":{"observed_at":"2026-07-02T02:06:26.373672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":"2509.02046","doi":"10.48550/arxiv.2509.02046","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046","venue":"ArXiv.org","work_id":"692b6526-174d-4275-b06f-8afe06e28a6c","year":2025},"citing_paper":{"arxiv_id":"2606.04662","last_updated":"2026-06-03T09:40:30Z","snapshot_observed_at":"2026-07-06T23:44:42.700120Z","submitted_at":"2026-06-03T09:40:30Z","title":"Why Muon Outperforms Adam: A Curvature Perspective","version":1},"reference_index":193,"source":"arxiv_source","source_observed_at":"2026-06-28T07:04:21.012269Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2606.04662"},"observation_digest":"sha256:84584650168e57df5721d63e505eaf2314f6018b07997123c554589e7bc8c44f","observation_id":"c55b2ee8-6336-4457-bbaa-a0082a444df8","resolution":{"observed_at":"2026-07-02T07:06:44.956876Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":"2509.02046","doi":"10.48550/arxiv.2509.02046","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046","venue":"ArXiv.org","work_id":"692b6526-174d-4275-b06f-8afe06e28a6c","year":2025},"citing_paper":{"arxiv_id":"2606.06470","last_updated":"2026-06-04T17:55:11Z","snapshot_observed_at":"2026-08-02T15:39:17.149916Z","submitted_at":"2026-06-04T17:55:11Z","title":"PC Layer: Polynomial Weight Preconditioning for Improving LLM Pre-Training","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-06-28T02:15:02.317724Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2606.06470"},"observation_digest":"sha256:11d4f0ddae69c11c3b16cbc121408e2f2201542a4db7ebfc79b86c90db9cd779","observation_id":"315181d6-8688-4f0d-8d49-f5a4015455a4","resolution":{"observed_at":"2026-07-02T12:16:57.322210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":"2509.02046","doi":"10.48550/arxiv.2509.02046","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046","venue":"ArXiv.org","work_id":"692b6526-174d-4275-b06f-8afe06e28a6c","year":2025},"citing_paper":{"arxiv_id":"2606.11387","last_updated":"2026-06-09T19:10:54Z","snapshot_observed_at":"2026-07-06T23:50:30.023802Z","submitted_at":"2026-06-09T19:10:54Z","title":"Small Experiments, Cheaper Decisions: A Case Study in Staged Promotion for Micro-Pretraining","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T13:20:43.753744Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2606.11387"},"observation_digest":"sha256:6f0bdb41afd13860fcd35dca1d586939fad7abf253ceee17127bf562a718a220","observation_id":"0f6ff847-ce4b-42c1-ab40-20cae83a4c92","resolution":{"observed_at":"2026-07-03T05:17:40.215468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":"2509.02046","doi":"10.48550/arxiv.2509.02046","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046","venue":"ArXiv.org","work_id":"692b6526-174d-4275-b06f-8afe06e28a6c","year":2025},"citing_paper":{"arxiv_id":"2606.23676","last_updated":"2026-06-22T17:58:52Z","snapshot_observed_at":"2026-08-02T19:09:38.605644Z","submitted_at":"2026-06-22T17:58:52Z","title":"Open Problem: Is AdamW Effective Under Heavy-Tailed Noise?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T09:08:41.993925Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2606.23676"},"observation_digest":"sha256:0e6ef17464c2dd145955b68dfac854960aeaad8674d5e3ba005e470c5b6b6fa5","observation_id":"41bc17bf-7394-426d-8a02-71951dd78a56","resolution":{"observed_at":"2026-07-04T10:09:44.613383Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-07-11T22:10:49.683444Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04033","last_updated":"2026-07-04T21:27:05Z","snapshot_observed_at":"2026-08-05T03:17:46.176654Z","submitted_at":"2026-07-04T21:27:05Z","title":"OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers","version":1},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-07-11T22:10:49.683444Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2607.04033"},"observation_digest":"sha256:2145ee7bbbd9c5717a63f4c10e6ce78c8c3b59c7af274e93298245df8bc95c9a","observation_id":"7e68ca9e-a1e0-4405-a021-8e296fbd3b85","resolution":{"observed_at":"2026-07-11T22:10:49.683444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-01T17:32:36.114376Z","title":"Wen et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17620","last_updated":"2026-07-20T07:16:31Z","snapshot_observed_at":"2026-08-03T11:10:32.792905Z","submitted_at":"2026-07-20T07:16:31Z","title":"PoLoRA: A Preconditioned Orthogonalized LoRA Optimizer","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T17:32:36.114376Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2607.17620"},"observation_digest":"sha256:398240257650d37985fd37074cb271d71d1e5ec067215923bb8f8ac52bb67ea0","observation_id":"6be500e9-9444-4337-8825-62c5431bb87a","resolution":{"observed_at":"2026-08-01T17:32:36.114376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-01T12:51:59.644271Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19331","last_updated":"2026-07-21T17:51:36Z","snapshot_observed_at":"2026-08-04T10:05:55.120862Z","submitted_at":"2026-07-21T17:51:36Z","title":"ISO: An RLVR-Native Optimization Stack","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T12:51:59.644271Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2607.19331"},"observation_digest":"sha256:7fbb192d7510e8e78fa942ce4bdeaca5c6a5192d4c202f8f2f484c61bce67470","observation_id":"3f7eb4a2-f1b8-49dd-b36e-69ef81faf30f","resolution":{"observed_at":"2026-08-01T12:51:59.644271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-02T12:30:38.010996Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20486","last_updated":"2026-06-02T15:21:53Z","snapshot_observed_at":"2026-08-04T12:41:14.831060Z","submitted_at":"2026-06-02T15:21:53Z","title":"OPTScientist: Multi-Agent Discovery of Typed Optimizer Programs for Transformer Pretraining","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T12:30:38.010996Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2607.20486"},"observation_digest":"sha256:88d83e161d21acf5b74bc14d23bf21585209f8d70fff1d6fb318a3a9ee28b080","observation_id":"b463f58c-5e27-4376-9c2e-65ce27c0606e","resolution":{"observed_at":"2026-08-02T12:30:38.010996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-04T23:14:11.425305Z","title":"Fantastic pretraining optimizers and where to find them.arXiv preprint arXiv:2509.02046, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01672","last_updated":"2026-08-03T04:06:06Z","snapshot_observed_at":"2026-08-05T03:41:27.201821Z","submitted_at":"2026-08-03T04:06:06Z","title":"Learning What to Remember: Test-Time Training via Context Distillation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T23:14:11.425305Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2608.01672"},"observation_digest":"sha256:b3015b3774e87f2137cc6873060bd1dfc91f5e838ed01a8020b985e0e0542139","observation_id":"90465926-40c6-49b7-91bd-65939b77e029","resolution":{"observed_at":"2026-08-04T23:14:11.425305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02046","snapshot_observed_at":"2026-08-04T06:04:06.059355Z","title":"arXiv preprint arXiv:2509.02046 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02502","last_updated":"2026-08-03T17:04:43Z","snapshot_observed_at":"2026-08-05T03:46:24.034853Z","submitted_at":"2026-08-03T17:04:43Z","title":"CMuon: Accelerating and Stabilizing Diffusion Transformer Training via Chunked Momentum Orthogonalization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T06:04:06.059355Z"},"links":{"cited_paper":"/paper/2509.02046","citing_paper":"/paper/2608.02502"},"observation_digest":"sha256:9af9e1c004a4339080c3ffb9ccc36b027b21b2e807924dc533e842898d655b1c","observation_id":"a804afeb-c13b-4e0a-bfb5-af328c78be09","resolution":{"observed_at":"2026-08-04T06:04:06.059355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.02046/citation-record","integrity":"/paper/2509.02046/integrity","json":"/paper/2509.02046/citation-record.json","paper":"/paper/2509.02046"},"outbound":[],"paper":{"arxiv_id":"2509.02046","last_updated":"2025-09-04T19:22:04Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T20:37:51.914753Z","submitted_at":"2025-09-02T07:43:22Z","title":"Fantastic Pretraining Optimizers and Where to Find Them"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 33 inbound Pith citation observations for arXiv:2509.02046."}