{"as_of":"2026-08-16T17:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ca789d115ab3f5688c452aa564b842f4f022a4df912108c8593b23230f56e944","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T11:46:47.840408Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T08:27:40.373666Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T22:25:39.545387Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07752","snapshot_observed_at":"2026-07-11T22:10:49.683444Z","title":"Towards efficient optimizer design for llm via structured fisher approximation with a low-rank extension.arXiv preprint arXiv:2502.07752, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04033","last_updated":"2026-07-04T21:27:05Z","snapshot_observed_at":"2026-08-07T05:07:10.107694Z","submitted_at":"2026-07-04T21:27:05Z","title":"OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T22:10:49.683444Z"},"links":{"cited_paper":"/paper/2502.07752","citing_paper":"/paper/2607.04033"},"observation_digest":"sha256:0a07066014f2ccfc2b1eb0b1effea27c304cb4f0e17fa4b3eda8a4a859315b74","observation_id":"91f4ecc9-1ff4-4058-9bf0-0ff00be0822d","resolution":{"observed_at":"2026-07-11T22:10:49.683444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"cited_work":{"arxiv_id":"2502.07752","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.07752","snapshot_observed_at":"2026-07-08T22:25:39.545387Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","venue":"cs.LG","work_id":"313ad0d8-539f-448a-8f6b-e4933022502a","year":2025},"citing_paper":{"arxiv_id":"2607.05872","last_updated":"2026-07-19T20:06:25Z","snapshot_observed_at":"2026-08-12T18:36:29.695540Z","submitted_at":"2026-07-07T06:06:04Z","title":"No Subspace to Track: Non-Identifiability and Optimizer State in Low-Rank Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-08T22:16:44.668076Z"},"links":{"cited_paper":"/paper/2502.07752","citing_paper":"/paper/2607.05872"},"observation_digest":"sha256:f0775101d40272cd6367c84ccf03605efef97198d9a3867e0e5650f22ea7838e","observation_id":"88a4455d-ebb9-4db0-a1a4-4857364a2afe","resolution":{"observed_at":"2026-07-08T22:25:39.546940Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07752","snapshot_observed_at":"2026-08-02T08:27:40.373666Z","title":"Lei Guo, Lennart Ljung, and Pierre Priouret","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05872","last_updated":"2026-07-19T20:06:25Z","snapshot_observed_at":"2026-08-12T18:36:29.695540Z","submitted_at":"2026-07-07T06:06:04Z","title":"No Subspace to Track: Non-Identifiability and Optimizer State in Low-Rank Training","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T08:27:40.373666Z"},"links":{"cited_paper":"/paper/2502.07752","citing_paper":"/paper/2607.05872"},"observation_digest":"sha256:92b6d5981d78498013aa0ff3930781d4d3a9d6b10b38f596f3f3001afe274926","observation_id":"cf227b65-8840-4ae3-a742-e515ac419a16","resolution":{"observed_at":"2026-08-02T08:27:40.373666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.07752/citation-record","integrity":"/paper/2502.07752/integrity","json":"/paper/2502.07752/citation-record.json","paper":"/paper/2502.07752"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2002.09018","last_updated":"2021-03-05T06:29:48Z","snapshot_observed_at":"2026-08-15T11:50:44.160848Z","submitted_at":"2020-02-20T20:51:33Z","title":"Scalable Second Order Optimization for Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.09018","snapshot_observed_at":"2026-08-08T11:46:47.441001Z","title":"Scalable second order optimization for deep learning","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.441001Z"},"links":{"cited_paper":"/paper/2002.09018","citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:a8a11b0461493809e63104574690c1b14e505f771965b49290337adffbfe899c","observation_id":"5bfff0f7-79e4-4529-936b-889f94da49b4","resolution":{"observed_at":"2026-08-08T11:46:47.441001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:46:48.471933Z","title":"M1 0 0 0 M2 0 0 0 M3 # Example of Diagv(·) This will stack the vector element into a pure diagonal matrix: Diagv([a11, a22, a33]T ) =","venue":null,"work_id":"770e3433-dc09-4517-b37a-6e7a464cfbf1","year":2024},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.802256Z"},"links":{"citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:586313e0f6884a5d40c3f64848054b29d620c059bfb8c042d4a8183024b0797a","observation_id":"7c25bd3b-2481-4d21-8029-2ef4fa51b299","resolution":{"observed_at":"2026-08-08T11:46:48.475556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:46:48.397606Z","title":"From the Theorem D.1, the iterative procedure for Q can be simply obtained by taking the diagonals of M: Q = Diag E GSGT ∥S∥2 F","venue":null,"work_id":"254f17b8-9907-437d-8e88-0528e6e4efdc","year":2018},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.822095Z"},"links":{"citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:f1700e1094a076af17f08a65589a7491b060d741ac67e9139561b5b06542dd64","observation_id":"d0ed36c7-5554-4911-9910-5b40f9a75dab","resolution":{"observed_at":"2026-08-08T11:46:48.401760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:46:48.346811Z","title":"Effects of last layer One crucial setup difference during evaluation for low-rank methods is whether the last layer is trained by full-rank Adam or not","venue":null,"work_id":"2ada022f-a759-405d-b1bc-dbdc647aa8ea","year":2000},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.840408Z"},"links":{"citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:f67a2108f3e3689ee8e409134f360331631327c4d2a2d95479f32442d6d812f9","observation_id":"41d59989-3507-4b07-a1f4-167591649010","resolution":{"observed_at":"2026-08-08T11:46:48.351953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-08T11:46:47.457800Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.457800Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:496cdf26362bb2a352b40b3b7463695e35aa04003fd3920130c1bfcc674c290d","observation_id":"6d6d2a75-85dc-41f1-b244-cfc84dcdd9f9","resolution":{"observed_at":"2026-08-08T11:46:47.457800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12807","last_updated":"2024-09-03T21:00:39Z","snapshot_observed_at":"2026-08-16T16:55:00.619546Z","submitted_at":"2024-05-21T13:58:17Z","title":"FAdam: Adam is a natural gradient optimizer using diagonal empirical Fisher information","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12807","snapshot_observed_at":"2026-08-08T11:46:47.479823Z","title":"Fadam: Adam is a natural gradient optimizer using diagonal empirical fisher information","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.479823Z"},"links":{"cited_paper":"/paper/2405.12807","citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:c13d3990474b788ce02363cc156d34393cc30a4201de4bd505011fef6dc4ddba","observation_id":"3f0ec22f-5055-46d2-a09d-78f7a9910efd","resolution":{"observed_at":"2026-08-08T11:46:47.479823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7028.8289","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:46:47.923926Z","title":"For 8-bit optimizers, we assume weights are stored in BF16, but optimizer states use FP8","venue":null,"work_id":"35b35781-4a74-497f-af7a-2b12c8fe48c5","year":2000},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.836779Z"},"links":{"citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:f2254afe275f2b10aaea840819a41abe897acfeaf36f4a294daf1162ecd6bbea","observation_id":"27822886-f0b7-4bb6-b64a-620ff692c6cc","resolution":{"observed_at":"2026-08-08T11:46:47.934780Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:46:48.360173Z","title":null,"venue":null,"work_id":"51cfd600-269c-46b1-9160-4fadc5d4f65e","year":2001},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.833300Z"},"links":{"citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:4a8c8b6adf5e3b83409d9c0463e7d40382ae10c57fdb3bf0c14366465d45dd23","observation_id":"1847dc01-59e5-4b35-9f69-8e0a19be6459","resolution":{"observed_at":"2026-08-08T11:46:48.364266Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-08T11:46:47.747483Z","title":"Sgdr: Stochastic gradient descent with warm restarts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.747483Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:14e2b237feb726e6c940ac81dabf892ba0674052f2c52f20790c314a9dcfa0b7","observation_id":"af1dfbbe-8afb-4c20-93c2-cca4ee01e73c","resolution":{"observed_at":"2026-08-08T11:46:47.747483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17748","last_updated":"2024-06-25T17:34:51Z","snapshot_observed_at":"2026-08-16T13:39:40.716171Z","submitted_at":"2024-06-25T17:34:51Z","title":"A New Perspective on Shampoo's Preconditioner","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17748","snapshot_observed_at":"2026-08-08T11:46:47.755604Z","title":"A new perspective on shampoo’s preconditioner","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.755604Z"},"links":{"cited_paper":"/paper/2406.17748","citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:3d50dd631cbbd1dec138797935cee109c3b5574515dfb3cd2b058fbcf827ef86","observation_id":"34d89f11-b35a-49a3-a208-31cb801b1f64","resolution":{"observed_at":"2026-08-08T11:46:47.755604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04553","last_updated":"2024-02-07T03:18:00Z","snapshot_observed_at":"2026-08-16T14:20:46.038315Z","submitted_at":"2024-02-07T03:18:00Z","title":"Curvature-Informed SGD via General Purpose Lie-Group Preconditioners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04553","snapshot_observed_at":"2026-08-08T11:46:47.759576Z","title":"Curvature-informed sgd via general purpose lie-group precondi- tioners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.759576Z"},"links":{"cited_paper":"/paper/2402.04553","citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:7d6bbf7c1737cc54086bab1deb87907495a39ca248d1385344688391ffe30eab","observation_id":"07dcae0d-99ef-421d-9a27-abaf2e1bb770","resolution":{"observed_at":"2026-08-08T11:46:47.759576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14739","last_updated":"2025-02-06T05:57:37Z","snapshot_observed_at":"2026-08-16T13:50:07.194198Z","submitted_at":"2024-05-23T16:04:42Z","title":"Maintaining Structural Integrity in Parameter Spaces for Parameter Efficient Fine-tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14739","snapshot_observed_at":"2026-08-08T11:46:47.763401Z","title":"Flora: Low-rank core space for n-dimension","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.763401Z"},"links":{"cited_paper":"/paper/2405.14739","citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:c7025bcf0ee6baa0e8761c421cdd514ac94d930147fbf800b8672368e03107c6","observation_id":"1ee16ce6-d40b-4be5-b189-fa3c6654258f","resolution":{"observed_at":"2026-08-08T11:46:47.763401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:46:48.482671Z","title":"Connection of diagonal hessian estimates to natural gradients in stochastic optimization","venue":null,"work_id":"8d4d8ffd-4f75-491b-bc4f-0dcb5b1280d7","year":2021},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.767173Z"},"links":{"citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:2757fc0d5fe8a7f8d1f8240b60e449a55fa1a4237abd81ee933a720de1a793bb","observation_id":"87834fae-442a-46ee-884f-0294812c3003","resolution":{"observed_at":"2026-08-08T11:46:48.486121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.00578","last_updated":"2021-02-15T04:51:42Z","snapshot_observed_at":"2026-08-05T16:14:35.629841Z","submitted_at":"2020-10-01T17:51:49Z","title":"Understanding Self-supervised Learning with Dual Deep Networks","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.00578","snapshot_observed_at":"2026-08-08T11:46:47.771026Z","title":"Understanding self-supervised learning with dual deep networks","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.771026Z"},"links":{"cited_paper":"/paper/2010.00578","citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:3de5988a0ea91b647e8b58327760076f578d4c980a4e1ece2c9e00d0870e8981","observation_id":"b3c55a12-7f0f-436f-bc2d-a67a591c09dd","resolution":{"observed_at":"2026-08-08T11:46:47.771026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11321","last_updated":"2025-01-31T18:52:42Z","snapshot_observed_at":"2026-08-15T04:58:58.957938Z","submitted_at":"2024-09-17T16:18:05Z","title":"SOAP: Improving and Stabilizing Shampoo using Adam","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11321","snapshot_observed_at":"2026-08-08T11:46:47.778814Z","title":"Soap: Improving and stabilizing shampoo using adam","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.778814Z"},"links":{"cited_paper":"/paper/2409.11321","citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:9a724ffae7acead81ee2bdb1493eb4d23a812ab099f04ac8a73033213ce586f1","observation_id":"6bd0fe42-d56c-4794-83c5-42f239b0fc19","resolution":{"observed_at":"2026-08-08T11:46:47.778814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11768","last_updated":"2024-12-17T09:30:44Z","snapshot_observed_at":"2026-08-15T23:37:44.810913Z","submitted_at":"2024-12-16T13:41:37Z","title":"No More Adam: Learning Rate Scaling at Initialization is All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11768","snapshot_observed_at":"2026-08-08T11:46:47.782800Z","title":"Zhirong Yang and Jorma Laaksonen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.782800Z"},"links":{"cited_paper":"/paper/2412.11768","citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:986a36f5810a179a09f420ec00538c3c944c917970611109c96ca5e334a66375","observation_id":"938f875f-cad8-42ce-916b-ecc6ec5e8f30","resolution":{"observed_at":"2026-08-08T11:46:47.782800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.00962","last_updated":"2020-01-03T06:53:00Z","snapshot_observed_at":"2026-08-16T03:15:11.732149Z","submitted_at":"2019-04-01T16:53:35Z","title":"Large Batch Optimization for Deep Learning: Training BERT in 76 minutes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.00962","snapshot_observed_at":"2026-08-08T11:46:47.790437Z","title":"Large batch optimization for deep learning: Training bert in 76 minutes","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.790437Z"},"links":{"cited_paper":"/paper/1904.00962","citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:8fc045cbf1f641d92ef88ced1187ebfec34539e79263d7f5a9b54e2d6dbb1630","observation_id":"3b7c6b6a-edde-44c1-ba10-87bc84748d90","resolution":{"observed_at":"2026-08-08T11:46:47.790437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16793","last_updated":"2025-02-24T11:29:08Z","snapshot_observed_at":"2026-08-16T13:40:03.769145Z","submitted_at":"2024-06-24T16:56:41Z","title":"Adam-mini: Use Fewer Learning Rates To Gain More","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16793","snapshot_observed_at":"2026-08-08T11:46:47.795211Z","title":"Adam-mini: Use fewer learning rates to gain more","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.795211Z"},"links":{"cited_paper":"/paper/2406.16793","citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:1b677bf47e8cc3d0246193dd5ff142b0c088fda461e74d453304881af3dd7a55","observation_id":"87ec5990-80e3-4c54-abd5-0c85ea4bf764","resolution":{"observed_at":"2026-08-08T11:46:47.795211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03507","last_updated":"2024-06-02T21:24:12Z","snapshot_observed_at":"2026-08-15T01:25:39.422061Z","submitted_at":"2024-03-06T07:29:57Z","title":"GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03507","snapshot_observed_at":"2026-08-08T11:46:47.799002Z","title":"Galore: Memory-efficient llm training by gradient low-rank projection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.799002Z"},"links":{"cited_paper":"/paper/2403.03507","citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:d734591c5624bbd4ee4da0195156487f4075e68d2e190c816e85e9cde91c110e","observation_id":"41446892-5841-44ff-806f-c9e190c9a2f9","resolution":{"observed_at":"2026-08-08T11:46:47.799002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:46:48.460744Z","title":"for t = 1,","venue":null,"work_id":"0956717f-8354-4bc9-9fa0-441570d45eb3","year":2024},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.805888Z"},"links":{"citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:795a614a984081a4190460169051590d55c38e14c505adacc13ccc8aa6117f65","observation_id":"681d9b23-720e-479d-9aa9-2a74eff61afc","resolution":{"observed_at":"2026-08-08T11:46:48.464545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:46:48.448465Z","title":"Note that our paper assumes Vec(·) is stacking columns of matrix whereas Gupta et al","venue":null,"work_id":"9f2caf23-c13c-43ea-acfe-8d49d8028a54","year":2018},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.808909Z"},"links":{"citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:6bcb0d0fd67772abc542042b203e54d456e1071564aa26249e7433fd0ff22a47","observation_id":"9b1a17ee-3f19-456a-a908-df93999b7bc1","resolution":{"observed_at":"2026-08-08T11:46:48.452711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:46:48.435954Z","title":null,"venue":null,"work_id":"98cc2146-968d-4fbc-a541-f81e1c654a78","year":2024},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.811783Z"},"links":{"citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:83cc93911765f5f52545e56761a1d712f727c845e802302ebe6cd234d53cc865","observation_id":"2da2c5cc-9156-4851-b16c-d659a268811b","resolution":{"observed_at":"2026-08-08T11:46:48.439953Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:46:48.423836Z","title":"In practice, SW AN proposes to compute the(GGT )− 1 2 using Newton-Schulz iterations","venue":null,"work_id":"3751a8fe-e2a1-4e3d-9fdd-d5c1ed1eafef","year":2019},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.814682Z"},"links":{"citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:4b026da4b0b5b2f9ac889160343f89caa72d33f3bf0678af6bc20833c449169e","observation_id":"49c3e7fc-8115-4ce3-b3b4-7f35fb270d6c","resolution":{"observed_at":"2026-08-08T11:46:48.427956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:46:48.410687Z","title":"At the same time, GaLore [Zhao et al., 2024a] popularizes the use of low-rank optimizers, which demonstrates on-par performance compared to full-rank Adam training","venue":null,"work_id":"a2d20aad-cda4-4851-8fa6-a4f43a37a1c8","year":2020},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.818309Z"},"links":{"citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:cf5834e9bf2833fe986eb14aee809ec9d4792323ab6dc0b89fc7f31b0a1a6efa","observation_id":"2e1d9700-dd5f-4773-8de0-7500648dca74","resolution":{"observed_at":"2026-08-08T11:46:48.415008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:46:48.384967Z","title":"Then, the normalization step of Lamb and Lars can be viewed as a 1-sample approximation to FIM* under the structure considered in Sec","venue":null,"work_id":"9be4f388-0dbf-4a5a-918d-e7b4f48a41ce","year":2024},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.825916Z"},"links":{"citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:e416c90bf4df7082b3577c9239997eace17d1fa90ec4704fe9490343fa145736","observation_id":"d3e11205-1153-40ae-b572-72d1e534efd7","resolution":{"observed_at":"2026-08-08T11:46:48.389263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:46:48.372430Z","title":"U T U T c G ⊙2# =[U , Uc] U T G U T c G vuutE","venue":null,"work_id":"d68f068e-cb77-40fa-9c69-a292ceb22eff","year":2018},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.829466Z"},"links":{"citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:26633748099dd89c095018b13a6d98762a63c67f3c19109c640c7f176130c714","observation_id":"262c1a26-ccc7-45a0-80ed-caa8d5b905e6","resolution":{"observed_at":"2026-08-08T11:46:48.376523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-08-14T20:41:41.185318Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-08T11:46:47.786590Z","title":"Large batch training of convolutional networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.786590Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:1f72ae5abcac83599a7b500004b66616f829c6b20670c2b195f5bf5feb1961a0","observation_id":"26634398-10a7-4e11-8a13-13b53a4aaa42","resolution":{"observed_at":"2026-08-08T11:46:47.786590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.10285","last_updated":"2022-10-14T09:21:48Z","snapshot_observed_at":"2026-08-16T17:26:06.940929Z","submitted_at":"2022-01-25T12:56:17Z","title":"Efficient Approximations of the Fisher Matrix in Neural Networks using Kronecker Product Singular Value Decomposition","version":6},"cited_work":{"arxiv_id":"2201.10285","doi":null,"metadata_source":"pith","pith_arxiv_id":"2201.10285","snapshot_observed_at":"2026-08-08T11:46:48.230378Z","title":"Efficient Approximations of the Fisher Matrix in Neural Networks using Kronecker Product Singular Value Decomposition","venue":"cs.NE","work_id":"3ebe46bc-be2c-474b-b475-2b769b7e28cc","year":2022},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.587382Z"},"links":{"cited_paper":"/paper/2201.10285","citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:69d69ba4fbc2683e54f1a46af8492834a4eb4736df280a2daac403ebf87ad26b","observation_id":"8d0ec684-065f-49f1-905a-3d8e8d99d594","resolution":{"observed_at":"2026-08-08T11:46:48.234529Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-08-15T15:12:45.559733Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13148","snapshot_observed_at":"2026-08-08T11:46:47.751693Z","title":"Swan: Preprocessing sgd enables adam-level performance on llm training with significant memory reduction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.751693Z"},"links":{"cited_paper":"/paper/2412.13148","citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:d50f3cb55bfb8f82ba9ab9e3228661858f873f3d9823c5a05241e5255ae760da","observation_id":"860c6b52-a841-4eaf-9efe-f4947bd814be","resolution":{"observed_at":"2026-08-08T11:46:47.751693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.10232","last_updated":"2018-12-25T00:10:24Z","snapshot_observed_at":"2026-08-14T18:23:02.286825Z","submitted_at":"2018-09-26T21:04:23Z","title":"Preconditioner on Matrix Lie Group for SGD","version":2},"cited_work":{"arxiv_id":"1809.10232","doi":null,"metadata_source":"pith","pith_arxiv_id":"1809.10232","snapshot_observed_at":"2026-08-08T11:46:48.213902Z","title":"Preconditioner on Matrix Lie Group for SGD","venue":"stat.ML","work_id":"e9fbcc92-2e28-4e05-b911-7ef86e163eaa","year":2018},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.629321Z"},"links":{"cited_paper":"/paper/1809.10232","citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:d4918637b745e122493594125f21e0f851bc8da4ce4bcb95b41b941ebb8bd4ed","observation_id":"91c9ad27-332d-4c82-812c-716d28f52cc3","resolution":{"observed_at":"2026-08-08T11:46:48.218281Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T11:46:47.446203Z","title":"Fira: Can we achieve full-rank training of llms under low-rank constraint? arXiv preprint arXiv:2410.01623, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.446203Z"},"links":{"citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:e24e17b890ec815da2d8f2401d4ab8da141116073d78ee7280a37fb3c8605373","observation_id":"df762821-163a-4888-8ce3-1a2c866041c0","resolution":{"observed_at":"2026-08-08T11:46:47.446203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.05446","last_updated":"2020-06-16T00:58:12Z","snapshot_observed_at":"2026-08-14T21:03:09.218636Z","submitted_at":"2019-10-11T23:51:09Z","title":"On Empirical Comparisons of Optimizers for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.05446","snapshot_observed_at":"2026-08-08T11:46:47.449567Z","title":"On empirical comparisons of optimizers for deep learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.449567Z"},"links":{"cited_paper":"/paper/1910.05446","citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:c5fa2d1807b15a37443de5bee412a0fbc4a5bc2c17f39ae02c52a84af30fd714","observation_id":"f55c5c32-f0e7-4f6e-9262-f79e92191c9b","resolution":{"observed_at":"2026-08-08T11:46:47.449567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-08T11:46:47.775109Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.775109Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:eca545617e23668c4bb4108c36c146604f3e45ca6836a2219220424a5e2b4067","observation_id":"1cb85550-a248-4f7a-b11c-f9226b101e92","resolution":{"observed_at":"2026-08-08T11:46:47.775109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T11:46:47.453851Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.453851Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:a8616e63a8eccd69bcd9e1c16ed1a17064042eb05c849acf7583c43e55d8fc57","observation_id":"d031e4fd-ea87-48a9-a5c7-62fcc633626b","resolution":{"observed_at":"2026-08-08T11:46:47.453851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03496","last_updated":"2024-10-04T18:49:17Z","snapshot_observed_at":"2026-08-16T14:21:15.240097Z","submitted_at":"2024-02-05T20:15:19Z","title":"Can We Remove the Square-Root in Adaptive Gradient Methods? A Second-Order Perspective","version":10},"cited_work":{"arxiv_id":"2402.03496","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03496","snapshot_observed_at":"2026-08-08T11:46:48.196141Z","title":"Can We Remove the Square-Root in Adaptive Gradient Methods? A Second-Order Perspective","venue":"cs.LG","work_id":"d412d6ae-5455-422b-8e10-bd29ba3b7dba","year":2024},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.689130Z"},"links":{"cited_paper":"/paper/2402.03496","citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:22f68298b2ae6d60a35342fe54dccda81c1718bd006a254249dc6bb89e07798d","observation_id":"98d71768-a389-41a1-9b93-9794e8b2545b","resolution":{"observed_at":"2026-08-08T11:46:48.200943Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-08T11:46:47.554330Z","title":"Diederik P Kingma","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T11:46:47.554330Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2502.07752"},"observation_digest":"sha256:7333944e350d2160285a5c632655d76b4729787d273fdb32a9f21d1dfa7d9bee","observation_id":"dc51d578-f541-4b7b-8309-3d1ace46c9da","resolution":{"observed_at":"2026-08-08T11:46:47.554330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.07752","last_updated":"2025-02-20T18:48:58Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T22:25:07.493744Z","submitted_at":"2025-02-11T18:27:19Z","title":"Towards Efficient Optimizer Design for LLM via Structured Fisher Approximation with a Low-Rank Extension"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":4,"verified_fuzzy":10},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 3 inbound Pith citation observations for arXiv:2502.07752."}