{"as_of":"2026-08-09T06:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:40dc7df90b2d6c7c1d43d60c101e3a77df8dddaebb7666a089e2ae7b4b0ddce7","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T12:40:42.772228Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T15:16:58.221358Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T10:51:21.208174Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"cited_work":{"arxiv_id":"2502.07488","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07488","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A method of solving a convex programming problem with convergence rate O( 1 k2 ).Sov","venue":null,"work_id":"470d901f-e17b-4165-a4bb-4354ed180c42","year":1983},"citing_paper":{"arxiv_id":"2604.12968","last_updated":"2026-04-14T17:01:36Z","snapshot_observed_at":"2026-07-06T23:01:05.634599Z","submitted_at":"2026-04-14T17:01:36Z","title":"Evolution of Optimization Methods: Algorithms, Scenarios, and Evaluations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T15:16:58.221358Z"},"links":{"cited_paper":"/paper/2502.07488","citing_paper":"/paper/2604.12968"},"observation_digest":"sha256:cf19c1ab3cdbf08c408c01f704f98e1cef8648d1ba35bac52bd3ce764dad000b","observation_id":"e1060d59-b93e-4c5d-ab10-06d97084637f","resolution":{"observed_at":"2026-05-11T10:51:21.226714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.07488/citation-record","integrity":"/paper/2502.07488/integrity","json":"/paper/2502.07488/citation-record.json","paper":"/paper/2502.07488"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:43.200455Z","title":"Fisher information and natural gradient learning in random deep networks","venue":null,"work_id":"9748861f-db51-466b-9f46-8c8883012651","year":2019},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.138133Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:b797aa9e8f0cc0047f9630a1010646968fcdabfe3b0ba9fcf0ab5a49fe3d56fa","observation_id":"9ff3673c-00bf-43f4-9a38-8e1ba1a324fa","resolution":{"observed_at":"2026-08-08T12:40:43.204735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.09018","last_updated":"2021-03-05T06:29:48Z","snapshot_observed_at":"2026-08-03T21:55:15.856477Z","submitted_at":"2020-02-20T20:51:33Z","title":"Scalable Second Order Optimization for Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.09018","snapshot_observed_at":"2026-08-08T12:40:42.155942Z","title":"Scalable second order optimization for deep learning","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.155942Z"},"links":{"cited_paper":"/paper/2002.09018","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:73c92313743eb9f11b14cdcb8ca8182007325abf9acf70db4fbade0b9906c623","observation_id":"a1faf0f7-6720-4769-9149-368f6fb422e5","resolution":{"observed_at":"2026-08-08T12:40:42.155942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:43.188665Z","title":"Numerical optimization: theoretical and practical aspects","venue":null,"work_id":"5955f51e-04d9-44f2-b1b1-bf1ceb64d653","year":2006},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.166592Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:2a2c8cf22340a7e78047cca2503ff95b825d2e7ccb54bf0c9918b248afafc630","observation_id":"0b42b222-d8a5-4361-90a6-d3e3bbef40fb","resolution":{"observed_at":"2026-08-08T12:40:43.193082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:43.177902Z","title":"Practical gauss-newton optimisation for deep learning","venue":null,"work_id":"9cfb4dda-46e2-4dcd-9775-39374a75265d","year":2017},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.181235Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:aaf13cfb87484d0f34d2246f3ab8123be2ed14e28ba32382c878e8ce4d9ab460","observation_id":"19311ef6-1f96-40d6-8143-6e36827dd755","resolution":{"observed_at":"2026-08-08T12:40:43.181798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05898","last_updated":"2025-07-01T15:59:19Z","snapshot_observed_at":"2026-07-06T16:29:55.892584Z","submitted_at":"2023-10-09T17:41:29Z","title":"Lion Secretly Solves Constrained Optimization: As Lyapunov Predicts","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05898","snapshot_observed_at":"2026-08-08T12:40:42.189563Z","title":"Lion secretly solves constrained optimization: As lyapunov predicts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.189563Z"},"links":{"cited_paper":"/paper/2310.05898","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:7b595e0dafdd76f26b840c87dc5ce4191e7aefed286eef011f3179e37312d7d0","observation_id":"d80d7340-773c-4fc8-947f-5f75f5656915","resolution":{"observed_at":"2026-08-08T12:40:42.189563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:43.166981Z","title":"Symbolic discovery of optimization algorithms","venue":null,"work_id":"6b078016-0e8f-404d-a484-89a3cc62df19","year":2024},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.201534Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:c5d0d02f2b859562b28c626ad43a9ba8704777a36a4760ca37cac229b6fc85c2","observation_id":"6574f7c3-4993-4272-a8ee-6f89730b2b15","resolution":{"observed_at":"2026-08-08T12:40:43.171270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:43.157925Z","title":null,"venue":null,"work_id":"004937a3-26dc-4108-a724-1c153b1422b8","year":2020},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.208031Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:28ccd1fd682db04972b2188e7186a5fa46273552aef01915325785504c69c236","observation_id":"4ceb3334-28c6-41de-98e4-2de2786b8804","resolution":{"observed_at":"2026-08-08T12:40:43.160693Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:42.218356Z","title":"Adaptive subgradient methods for online learning and stochastic optimization","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.218356Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:fc0e5b6682d266b92334c6dd70fdac38586cd0de79fd4dc5066d3ce2051f69f1","observation_id":"9c457a4a-7eaa-41c9-983f-a551320b8fd9","resolution":{"observed_at":"2026-08-08T12:40:42.218356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:42.228124Z","title":"Model-agnostic meta-learning for fast adaptation of deep networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.228124Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:9b8f4d898dc95132552d58ef1435b73bab0d064b4699b24356588c9767f966b2","observation_id":"4d74f84b-e6f9-47f4-a236-c160e529e279","resolution":{"observed_at":"2026-08-08T12:40:42.228124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:42.233646Z","title":"Practical methods of optimization","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.233646Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:a15c61d8c43e59e061fc0d76e20b858a3e89a9f562177edd71d45e77c0443b8e","observation_id":"739f93e1-af6b-446d-b3c2-9cd88cdc9b72","resolution":{"observed_at":"2026-08-08T12:40:42.233646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:43.129704Z","title":"Global convergence of stochastic gradient hamiltonian monte carlo for nonconvex stochastic optimization: Nonasymptotic performance bounds and momentum-based acceleration","venue":null,"work_id":"50119879-bc5b-4262-9736-fe95d3fd0970","year":2022},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.239916Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:c5a8953a07e2a28ace89f9c808266a70021e0335962683eba4c49af0085cd44b","observation_id":"db6573a3-3b95-4023-89ee-e5a2e404548b","resolution":{"observed_at":"2026-08-08T12:40:43.134162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:43.118675Z","title":"Fast approximate natural gradient descent in a kronecker factored eigenbasis","venue":null,"work_id":"b6d47cf3-6ef9-4fae-90f6-e42b42ce50a4","year":2018},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.243228Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:79f3fec0ca9e3ea56c4a99b0fb9d0c1be77e391aee66292ec0475d6f8bda1a3d","observation_id":"ee8bbd5f-4502-4309-8150-a4e8a838e64e","resolution":{"observed_at":"2026-08-08T12:40:43.122673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:43.107325Z","title":"Low-rank gradient approximation for memory-efficient on-device training of deep neural network","venue":null,"work_id":"608c9524-da2f-45be-9174-3c70cabc2da7","year":2020},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.246592Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:ae4b4bd72b0ef826fa685a48354df28411fa455843759f9eca4bd02e0376c1c1","observation_id":"d6aa1a4c-2a00-4a35-947a-52939f3a1752","resolution":{"observed_at":"2026-08-08T12:40:43.111751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:42.249746Z","title":"A kronecker-factored approximate fisher matrix for convolution layers","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.249746Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:01a7dc802391415a5e899ab3fb2ee84fb0a52c4440538db5371c1fa112cd4086","observation_id":"f1c07a84-fd80-4865-88ff-db80c54f2a29","resolution":{"observed_at":"2026-08-08T12:40:42.249746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:42.252968Z","title":"Shampoo: Preconditioned stochastic tensor optimization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.252968Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:98900f630c5c72ca2b724ddf61bf9eaa661e03dff6923880b5613e443b2ac457","observation_id":"4362436c-8008-4cb4-a035-3faa035aafaa","resolution":{"observed_at":"2026-08-08T12:40:42.252968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.04754","last_updated":"2018-12-12T00:36:17Z","snapshot_observed_at":"2026-07-06T07:20:39.525340Z","submitted_at":"2018-12-12T00:36:17Z","title":"Gradient Descent Happens in a Tiny Subspace","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.04754","snapshot_observed_at":"2026-08-08T12:40:42.256046Z","title":"Gradient descent happens in a tiny subspace","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.256046Z"},"links":{"cited_paper":"/paper/1812.04754","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:79f146e432863e15550520a38ddf0614d412cfe2498132069d98d2a3e06ca71a","observation_id":"efc383d0-48fd-45d1-9082-178b65955821","resolution":{"observed_at":"2026-08-08T12:40:42.256046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-08T12:40:42.259693Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.259693Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:accc397a059c3bf4652b35645654d5c07b6891c12f7685af5ec4f3ae9338a2a1","observation_id":"cbd4949f-d459-4d3f-b64a-27ad3c22c975","resolution":{"observed_at":"2026-08-08T12:40:42.259693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.02527","last_updated":"2016-10-08T13:25:15Z","snapshot_observed_at":"2026-07-06T05:13:51.685562Z","submitted_at":"2016-10-08T13:25:15Z","title":"Federated Optimization: Distributed Machine Learning for On-Device Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.02527","snapshot_observed_at":"2026-08-08T12:40:42.263049Z","title":"Federated optimization: Distributed machine learning for on-device intelligence","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.263049Z"},"links":{"cited_paper":"/paper/1610.02527","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:756b6dd17134c107add76e3d59c34a1ba23c0877f0fe257b58c08332786c753c","observation_id":"4a56218b-9d7a-4914-8271-0d1a1ef6e4bc","resolution":{"observed_at":"2026-08-08T12:40:42.263049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19449","last_updated":"2024-07-12T05:10:32Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:47:52Z","title":"Heavy-Tailed Class Imbalance and Why Adam Outperforms Gradient Descent on Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19449","snapshot_observed_at":"2026-08-08T12:40:42.267822Z","title":"Heavy-tailed class imbalance and why adam outperforms gradient descent on language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.267822Z"},"links":{"cited_paper":"/paper/2402.19449","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:5012d02784e535f5af1f948a510b20978be24859f38810e4f7b830d9a18cede8","observation_id":"4ee2ef16-3de8-498f-9667-616dc150ad73","resolution":{"observed_at":"2026-08-08T12:40:42.267822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:43.083028Z","title":"Federated learning: Challenges, methods, and future directions","venue":null,"work_id":"e97eb1f4-545a-4780-814a-6999ab14b565","year":2020},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.271382Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:d9ec78cfe25a31fb958ea43a5db8034ea3476bcdbcb2f3715a1675173c661120","observation_id":"d301ac9e-e0c3-4471-8e02-27667e5696b4","resolution":{"observed_at":"2026-08-08T12:40:43.087643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12857","last_updated":"2024-08-23T05:54:53Z","snapshot_observed_at":"2026-08-02T03:25:18.261713Z","submitted_at":"2024-08-23T05:54:53Z","title":"Memory-Efficient LLM Training with Online Subspace Descent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12857","snapshot_observed_at":"2026-08-08T12:40:42.274506Z","title":"Memory-efficient llm training with online subspace descent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.274506Z"},"links":{"cited_paper":"/paper/2408.12857","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:ffc5ad907ddc37e40ec55d7d4dc1b10875e09bff81f22bac5cbba24168fd315f","observation_id":"0e4a53f3-10b6-493e-b57e-f85a8a3f113d","resolution":{"observed_at":"2026-08-08T12:40:42.274506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14342","last_updated":"2024-03-05T17:07:16Z","snapshot_observed_at":"2026-08-08T09:25:28.224090Z","submitted_at":"2023-05-23T17:59:21Z","title":"Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14342","snapshot_observed_at":"2026-08-08T12:40:42.278139Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.278139Z"},"links":{"cited_paper":"/paper/2305.14342","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:5ceebc299beb7895378444a6d690f8b757fbade4e6f773012e4862d22f513e56","observation_id":"7e82254b-2dae-417a-a908-44bf23178cdc","resolution":{"observed_at":"2026-08-08T12:40:42.278139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:43.074463Z","title":"Rotate your networks: Better weight consolidation and less catastrophic forgetting","venue":null,"work_id":"195f7779-a3d3-4305-8403-a3d19c0ccb92","year":2018},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.281195Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:494753ab35938704a896626218d8237b31e1337411f38b02ac0d5d4d913ed7e5","observation_id":"3e7889d9-cf31-4f79-99d8-4259ffa823c1","resolution":{"observed_at":"2026-08-08T12:40:43.077676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-08T12:40:42.284368Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.284368Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:8c4317aa5e85d6e5c0f48ef4499e97bea060dd549d99d728bcff2b8cd2398897","observation_id":"029ceef8-ab5d-4aca-b05b-4e2f4b180344","resolution":{"observed_at":"2026-08-08T12:40:42.284368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.05042","last_updated":"2018-09-13T16:21:11Z","snapshot_observed_at":"2026-07-06T07:02:02.624968Z","submitted_at":"2018-09-13T16:21:11Z","title":"Hamiltonian Descent Methods","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.05042","snapshot_observed_at":"2026-08-08T12:40:42.287659Z","title":"Hamiltonian descent methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.287659Z"},"links":{"cited_paper":"/paper/1809.05042","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:03d735e75db0924b85c15b517066d46884ab013e25aa1367c8662c00bf6400d3","observation_id":"e8cf7dd5-e2d9-4a41-a976-cdaca4afda18","resolution":{"observed_at":"2026-08-08T12:40:42.287659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:42.312933Z","title":"New insights and perspectives on the natural gradient method","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.312933Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:39d66c0ea89333ea82f6aabd7ff4533d1e3ad05eb9e0703bc439bda6e8657920","observation_id":"eef32fcf-6c65-4a70-8af7-aff3bea8de8e","resolution":{"observed_at":"2026-08-08T12:40:42.312933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:43.060572Z","title":"Optimizing neural networks with kronecker-factored approximate curvature","venue":null,"work_id":"4fa3e906-bb82-4f79-b9a4-282e58da6216","year":2015},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.347622Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:c23f0e091af2aadc2baf30ac6e804ff44e8769cd2a8647768d649a5705a705e6","observation_id":"e76b30be-105c-4f14-baba-1295bb6c8e89","resolution":{"observed_at":"2026-08-08T12:40:43.063560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09958","last_updated":"2024-10-17T06:33:05Z","snapshot_observed_at":"2026-07-06T18:30:59.857334Z","submitted_at":"2024-06-14T12:05:17Z","title":"Memory-Efficient Optimization with Factorized Hamiltonian Descent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09958","snapshot_observed_at":"2026-08-08T12:40:42.374967Z","title":"H-fac: Memory-efficient optimization with factorized hamiltonian descent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.374967Z"},"links":{"cited_paper":"/paper/2406.09958","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:bae62ebc26c7c3f3a5c42367a1b82b76352f49bab0b80fa66f3fb6d043f343f5","observation_id":"9bce9ba0-b666-4026-8659-30882c7e084f","resolution":{"observed_at":"2026-08-08T12:40:42.374967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:42.402836Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.402836Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:30f63500f47139e78917e0d82cdabe97f6baa03a487460f8d534f663d7b30cb1","observation_id":"ebfacd26-ae79-436e-bd40-bb24d510028c","resolution":{"observed_at":"2026-08-08T12:40:42.402836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09237","last_updated":"2019-04-19T16:21:38Z","snapshot_observed_at":"2026-08-03T03:50:23.110540Z","submitted_at":"2019-04-19T16:21:38Z","title":"On the Convergence of Adam and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09237","snapshot_observed_at":"2026-08-08T12:40:42.419046Z","title":"On the convergence of adam and beyond","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.419046Z"},"links":{"cited_paper":"/paper/1904.09237","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:1c52cfd92b2e261db5037a63c7b558f75ba8921c10d102904b1fb75f9f8a0cf7","observation_id":"4c273979-9323-4434-b003-6b635919f17e","resolution":{"observed_at":"2026-08-08T12:40:42.419046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-08T12:40:42.449148Z","title":"Glu variants improve transformer","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.449148Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:be9db9031a448d306e2a174d614c19a0e8fba9c5beedb11475965dbe6f1b557e","observation_id":"14d8ddb4-6d87-478f-9b8b-32a33b1b6277","resolution":{"observed_at":"2026-08-08T12:40:42.449148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:42.485495Z","title":"Adafactor: Adaptive learning rates with sublinear memory cost","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.485495Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:ecae59e182cef3d9e949ea40ea4beb4347cd65dfb0d0d93bc17dd178e1a79f97","observation_id":"76ef8fd9-bd9d-4880-a84b-7cf82267a834","resolution":{"observed_at":"2026-08-08T12:40:42.485495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.00018","last_updated":"2019-11-29T16:56:02Z","snapshot_observed_at":"2026-07-06T08:40:59.491813Z","submitted_at":"2019-11-29T16:56:02Z","title":"On the Heavy-Tailed Theory of Stochastic Gradient Descent for Deep Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.00018","snapshot_observed_at":"2026-08-08T12:40:42.523157Z","title":"u rb \\\"u zbalaban, Thanh Huy Nguyen, Ga \\","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.523157Z"},"links":{"cited_paper":"/paper/1912.00018","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:9bb7b14ecd50a7d6d9eb84c8e5d5c13b396c4de433c03a73ffd6de72c496b7f0","observation_id":"c03ac2ed-81f4-4cef-8001-8964a1fe084f","resolution":{"observed_at":"2026-08-08T12:40:42.523157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.12176","last_updated":"2021-01-28T18:32:14Z","snapshot_observed_at":"2026-08-04T15:33:31.839842Z","submitted_at":"2021-01-28T18:32:14Z","title":"On the Origin of Implicit Regularization in Stochastic Gradient Descent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.12176","snapshot_observed_at":"2026-08-08T12:40:42.527482Z","title":"On the origin of implicit regularization in stochastic gradient descent","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.527482Z"},"links":{"cited_paper":"/paper/2101.12176","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:c44530d6ac238e64b341f975a7ef4fe415a419eeb40b224d578e65fdc06fdf18","observation_id":"07613736-b5c4-4731-872c-95b963c63c15","resolution":{"observed_at":"2026-08-08T12:40:42.527482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:42.531440Z","title":"Rethinking the inception architecture for computer vision","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.531440Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:95ae6173d1fd960e18ba04d23a4187ff2a1ac79d486797b3ae88c5d1a7e7bc05","observation_id":"aa28a64b-0392-4235-a35e-cf3d0223a4f9","resolution":{"observed_at":"2026-08-08T12:40:42.531440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:43.035245Z","title":"Recent advances in stochastic gradient descent in deep learning","venue":null,"work_id":"7a258120-37c5-4077-8de3-d668c6c7b209","year":2023},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.535692Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:1d882e4c3242ebd884800c9d5f4e49ca64aa8fae96d53ef0b4b5f2585fe699ef","observation_id":"da615b9c-8a5f-450f-ac68-904309ce080b","resolution":{"observed_at":"2026-08-08T12:40:43.038273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-08T12:40:42.539056Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.539056Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:6995189f49023cba798660d2338393429c732b803982f1ba54f900ab595df95a","observation_id":"7b21e59c-053e-42b9-99a5-bfdbe53db156","resolution":{"observed_at":"2026-08-08T12:40:42.539056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11321","last_updated":"2025-01-31T18:52:42Z","snapshot_observed_at":"2026-07-06T19:16:51.512681Z","submitted_at":"2024-09-17T16:18:05Z","title":"SOAP: Improving and Stabilizing Shampoo using Adam","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11321","snapshot_observed_at":"2026-08-08T12:40:42.542090Z","title":"Soap: Improving and stabilizing shampoo using adam","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.542090Z"},"links":{"cited_paper":"/paper/2409.11321","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:c0d8236c9d4ff0ee601b89d9d3387c9f48b07676f221b08577299486172358ea","observation_id":"85f06c53-e8cb-48e6-8f05-71f606f0d17c","resolution":{"observed_at":"2026-08-08T12:40:42.542090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:42.594954Z","title":"Root mean square layer normalization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.594954Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:c00ecb475ba976be76a04fe7b342f6075795faf2322d200e5bd4a5bb79fc8a67","observation_id":"c1c76ea2-26c3-4e6e-a6a4-a345fe1028d1","resolution":{"observed_at":"2026-08-08T12:40:42.594954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.09412","last_updated":"2018-04-27T21:39:25Z","snapshot_observed_at":"2026-08-08T10:28:19.597631Z","submitted_at":"2017-10-25T18:30:49Z","title":"mixup: Beyond Empirical Risk Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.09412","snapshot_observed_at":"2026-08-08T12:40:42.712127Z","title":"mixup: Beyond empirical risk minimization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.712127Z"},"links":{"cited_paper":"/paper/1710.09412","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:a82421a3a8ebff5d33c17238c374d821a5aefc7901d7a3e121abc3c538052f8f","observation_id":"c919e508-7103-45e9-9caa-f3bf0e7be8d6","resolution":{"observed_at":"2026-08-08T12:40:42.712127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:43.020320Z","title":"Why are adaptive methods good for attention models? Advances in Neural Information Processing Systems, 33: 0 15383--15393, 2020","venue":null,"work_id":"b733cb1d-de5f-4e4d-bc07-d2833345b78c","year":2020},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.756600Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:b92bb2b33f709b348c9f5bd6e24fa991e7fa7fe7319d4b70f41c0715868cc590","observation_id":"c6255f01-01fc-4fc8-804e-e9dc9e45100b","resolution":{"observed_at":"2026-08-08T12:40:43.024078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:43.008885Z","title":"Adam can converge without any modification on update rules","venue":null,"work_id":"29e51e30-af0f-4ea0-b24b-c937b277ea70","year":2022},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.759926Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:463543b0d3f1e95b0c4f6082b58804ff3aaaf3e8d48d5683f87a4baafc5ac212","observation_id":"f8377d3a-7a91-4b77-8ca3-1083b32cc39e","resolution":{"observed_at":"2026-08-08T12:40:43.013528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16788","last_updated":"2024-10-21T08:27:23Z","snapshot_observed_at":"2026-07-06T17:35:41.168780Z","submitted_at":"2024-02-26T18:01:41Z","title":"Why Transformers Need Adam: A Hessian Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16788","snapshot_observed_at":"2026-08-08T12:40:42.763594Z","title":"Why transformers need adam: A hessian perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.763594Z"},"links":{"cited_paper":"/paper/2402.16788","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:96102278e8f005b3030ed9bc5267508c42310cdb4a72d8084fe0a1fbcaacc0f0","observation_id":"7a7411e0-c16f-4ab8-84f3-1b891eecdaa3","resolution":{"observed_at":"2026-08-08T12:40:42.763594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03507","last_updated":"2024-06-02T21:24:12Z","snapshot_observed_at":"2026-07-06T17:40:15.746482Z","submitted_at":"2024-03-06T07:29:57Z","title":"GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03507","snapshot_observed_at":"2026-08-08T12:40:42.767627Z","title":"Galore: Memory-efficient llm training by gradient low-rank projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.767627Z"},"links":{"cited_paper":"/paper/2403.03507","citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:4b26641cd89075861f01612867bd6eb74ade238ae389417874cb9690e1fd33cc","observation_id":"5d7ab80c-32a2-4b23-b766-31a4adc02603","resolution":{"observed_at":"2026-08-08T12:40:42.767627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:40:42.996128Z","title":"Towards theoretically understanding why sgd generalizes better than adam in deep learning","venue":null,"work_id":"6570e85a-f365-40cb-a7db-157c74fd5f9c","year":2020},"citing_paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T12:40:42.772228Z"},"links":{"citing_paper":"/paper/2502.07488"},"observation_digest":"sha256:dbb047f8d47a0605005a7e6799a96bcb182152269c86aa025e24432e6580efc7","observation_id":"48ae89c5-412a-4f97-b9fe-72f49e1e412f","resolution":{"observed_at":"2026-08-08T12:40:43.001783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.07488","last_updated":"2025-02-11T11:48:04Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T12:32:01.619680Z","submitted_at":"2025-02-11T11:48:04Z","title":"Improving Adaptive Moment Optimization via Preconditioner Diagonalization"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2502.07488."}