{"as_of":"2026-08-07T09:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:75f09a98dc37042c8baa8df7f9ac990f293e96074066e3a5f2287058902db29b","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:35:40.252196Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.08091/citation-record","integrity":"/paper/2507.08091/integrity","json":"/paper/2507.08091/citation-record.json","paper":"/paper/2507.08091"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.841845Z","title":"Memory efficient adaptive optimization","venue":null,"work_id":"c4e67402-4036-43d4-a04d-6e684257e2e2","year":2019},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.092595Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:ae4dfb36fdbc15d50b78728b1533edab200614754dc033fd3f84f3e84461fc33","observation_id":"3d091fdb-94ec-4d6e-8c7c-3f6b9ada94e2","resolution":{"observed_at":"2026-08-06T18:35:40.844330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.095813Z","title":"Lower bounds for non-convex stochastic optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.095813Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:f41e46a00aa4df3dcccfb1597670df7f93f76967a276e7f3f2fcf0e6d9955fa6","observation_id":"b532b623-71d0-40f4-b010-b66bc957a580","resolution":{"observed_at":"2026-08-06T18:35:40.095813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-03T01:16:50.130450Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-08-06T18:35:40.098289Z","title":"Modular duality in deep learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.098289Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:c9fb2163b91d0b6fd00756c96182d68e18b759d1752d6129797f190d41c857a2","observation_id":"3fe12a6e-83c1-43dd-9681-700cffe0ce6e","resolution":{"observed_at":"2026-08-06T18:35:40.098289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20325","last_updated":"2024-12-06T14:09:22Z","snapshot_observed_at":"2026-08-03T03:18:47.425243Z","submitted_at":"2024-09-30T14:26:12Z","title":"Old Optimizer, New Norm: An Anthology","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20325","snapshot_observed_at":"2026-08-06T18:35:40.101337Z","title":"Old optimizer, new norm: An anthology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.101337Z"},"links":{"cited_paper":"/paper/2409.20325","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:2d16f8adc0e29a4b7f10486aadec916d0b6440c7862ff2bd7fa04d5388aeb017","observation_id":"ce0bfadf-c388-47e9-b543-633023dd2d42","resolution":{"observed_at":"2026-08-06T18:35:40.101337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.830089Z","title":"signsgd: Compressed optimisation for non-convex problems","venue":null,"work_id":"e9360a72-8ccc-4b19-826d-a1deb084d9b1","year":2018},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.104099Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:03f94a27bb83d42c48696b05fa00017576cb7e7f2f04dc7d6e376c90c1439d3e","observation_id":"ca466eb8-9b8a-426e-aba8-48cdb118eb72","resolution":{"observed_at":"2026-08-06T18:35:40.832449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05187","last_updated":"2023-04-11T12:45:52Z","snapshot_observed_at":"2026-07-06T15:14:24.794122Z","submitted_at":"2023-04-11T12:45:52Z","title":"Automatic Gradient Descent: Deep Learning without Hyperparameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05187","snapshot_observed_at":"2026-08-06T18:35:40.106492Z","title":"Automatic gradient descent: Deep learning without hyperparameters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.106492Z"},"links":{"cited_paper":"/paper/2304.05187","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:ad5e6fedab2d13c1f071f206c05234d9226b83a029f55a7467380ca539923655","observation_id":"bbb69756-4f58-421b-9dca-bf1f25d5c1a4","resolution":{"observed_at":"2026-08-06T18:35:40.106492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.822347Z","title":"Symbolic discovery of optimization algorithms","venue":null,"work_id":"b0036d8c-b993-4e7d-8e8b-1072e05e5d2c","year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.109327Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:3ee592460e12aa41a015502c65df729c1aae9c69ffdce95c02376badfa9c2a4f","observation_id":"01992ade-7bfc-4cf9-bad7-33c5713dd188","resolution":{"observed_at":"2026-08-06T18:35:40.825256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-06T18:35:40.111493Z","title":"8-bit optimizers via block-wise quantization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.111493Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:540cbc30faf07fd848f872faf3c80443ccdfa37ea75a7877a8086ee0563841ad","observation_id":"37add5ea-1f3f-4a0b-8e0b-d16bbe160b7b","resolution":{"observed_at":"2026-08-06T18:35:40.111493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.114360Z","title":"Qlora: Efficient finetuning of quantized llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.114360Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:b688096feb0e63704504028c1feb1e1185706478bfd00a811fde2892b796836c","observation_id":"1e8c6ba0-3238-45b3-965b-ea5cae56aedf","resolution":{"observed_at":"2026-08-06T18:35:40.114360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.117442Z","title":"Adaptive subgradient methods for online learning and stochastic optimization","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.117442Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:211636dcc8bc8e0f002605e1e6ab7eae699d7712a9fc934b2da5f0f12d68907b","observation_id":"92ea956e-c64b-40a3-8cc9-9336f072b503","resolution":{"observed_at":"2026-08-06T18:35:40.117442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.805786Z","title":"Combining axes preconditioners through kronecker approximation for deep learning","venue":null,"work_id":"aa1430a7-b72a-4f44-9400-8a34a8b6ab20","year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.119531Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:fafa4b358912b01f365c06b2b2eaaaf4048bf45cede17178b36e2b7b7630d97a","observation_id":"fba15dfa-01fe-458d-bf68-7558f6d01345","resolution":{"observed_at":"2026-08-06T18:35:40.808185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.798289Z","title":"Sketchy: Memory-efficient adaptive regularization with frequent directions","venue":null,"work_id":"8573fc76-c15c-438d-a3fa-d1d089a2a6f3","year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.121654Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:9cc827e7425b4eb2a442f6151da36a552c00a88d002ad431a2b1aa4af215ea89","observation_id":"d8b1410a-a235-4978-bcc1-8cd76cb2083a","resolution":{"observed_at":"2026-08-06T18:35:40.800933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.790371Z","title":"Fast approximate natural gradient descent in a kronecker factored eigenbasis","venue":null,"work_id":"4e1ed06a-3e67-4792-aa9a-a33eca9ced79","year":2018},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.123726Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:7d910f3ec0c9c4c4d064ea11bf68432e2bb78665d48a90268ce59aff543352d8","observation_id":"f3523b01-4493-4be9-9ec8-8377958da5fd","resolution":{"observed_at":"2026-08-06T18:35:40.792974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.783071Z","title":"Improving neural network training in low dimensional random bases","venue":null,"work_id":"bb38cc9b-dfd8-4661-8ed7-3705697827ed","year":2020},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.125769Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:f59e4309ba13fadfb40cf7bd5e76e3fa2210f4316d46dd16a112c2520b178989","observation_id":"43c30931-6709-46ec-ba7b-63fdf9549231","resolution":{"observed_at":"2026-08-06T18:35:40.785399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.775399Z","title":"A kronecker-factored approximate fisher matrix for convolution layers","venue":null,"work_id":"262bf342-07e3-4b29-b1aa-a3abc68a5c29","year":2016},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.127897Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:76ea871330c3513c354d8d646ad842a2229bcf511331b08a191b3ace01ae6a69","observation_id":"46d2730b-4bb7-4c8c-83c8-1e7073e1420b","resolution":{"observed_at":"2026-08-06T18:35:40.777756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08446","last_updated":"2025-02-11T18:59:26Z","snapshot_observed_at":"2026-08-06T16:31:19.141189Z","submitted_at":"2024-06-12T17:37:09Z","title":"OLMES: A Standard for Language Model Evaluations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08446","snapshot_observed_at":"2026-08-06T18:35:40.130029Z","title":"Olmes: A standard for language model evaluations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.130029Z"},"links":{"cited_paper":"/paper/2406.08446","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:0858390c489fead9565a03730b7884716c1fc55e7424c8b2f44d4e10f8e2c952","observation_id":"d2334a67-9cef-41e9-bad2-19cb0492beaa","resolution":{"observed_at":"2026-08-06T18:35:40.130029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.768403Z","title":"Shampoo: Preconditioned stochastic tensor optimization","venue":null,"work_id":"dec3b086-57e7-4db2-a4c0-4177d86a7ae6","year":2018},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.132495Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:ada1015e01b916baabf656ec5f93738cfc069b2aa6ecca59a7028dbda9f75265","observation_id":"cc7931f7-ca09-446e-b00e-37a06f26928d","resolution":{"observed_at":"2026-08-06T18:35:40.770861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.04754","last_updated":"2018-12-12T00:36:17Z","snapshot_observed_at":"2026-07-06T07:20:39.525340Z","submitted_at":"2018-12-12T00:36:17Z","title":"Gradient Descent Happens in a Tiny Subspace","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.04754","snapshot_observed_at":"2026-08-06T18:35:40.134826Z","title":"Gradient descent happens in a tiny subspace","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.134826Z"},"links":{"cited_paper":"/paper/1812.04754","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:0bf01f87e81f860e8ab7e49e8e6fbb163abfea176dbb563d7c2ded034e2d1506","observation_id":"71536acc-4a68-4f4f-bfcb-ea96cc205e28","resolution":{"observed_at":"2026-08-06T18:35:40.134826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03293","last_updated":"2024-06-12T22:17:37Z","snapshot_observed_at":"2026-08-05T09:55:40.815776Z","submitted_at":"2024-02-05T18:50:39Z","title":"Flora: Low-Rank Adapters Are Secretly Gradient Compressors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03293","snapshot_observed_at":"2026-08-06T18:35:40.137244Z","title":"Flora: Low-rank adapters are secretly gradient compressors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.137244Z"},"links":{"cited_paper":"/paper/2402.03293","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:b92a95031b2746f71e87b482dc54ee145f4226fd8cf4c9713f4f6a4d418db4f2","observation_id":"7d13c518-a176-44f3-a921-2569a2abe3a7","resolution":{"observed_at":"2026-08-06T18:35:40.137244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.761260Z","title":"Topics in matrix analysis","venue":null,"work_id":"e64eec70-2f98-4a41-a9df-667b9a95ae76","year":1994},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.139626Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:3407eaa504ba599ff04e4c9efc0f9a7275ca2c449963c1e2e154341a97f967fe","observation_id":"bd10f289-2c68-460e-b447-ed4f2b5479b8","resolution":{"observed_at":"2026-08-06T18:35:40.763802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.141663Z","title":"Parameter-efficient transfer learning for nlp","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.141663Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:494be25e810c5b421fd825a33f6c7d6aba0bac540b04b2fc4467e6628848a2c1","observation_id":"a823097d-4846-4f24-9830-cd0abd3df947","resolution":{"observed_at":"2026-08-06T18:35:40.141663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T18:35:40.143830Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.143830Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:4f8e9d20c8dc684521c28085094db7ff608d56d3c1e0747b8967cc3c2442a657","observation_id":"81fac90f-2158-41c7-b5b7-fdaa8185c668","resolution":{"observed_at":"2026-08-06T18:35:40.143830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.748739Z","title":"modded-nanogpt: Speedrunning the nanogpt baseline, 2024 a","venue":null,"work_id":"62b70d73-adf2-498f-a17d-7912e9f35ff0","year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.146130Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:42c2a166524157d05e27f51d66d43b1eb6c62a4fda94da971cba5a44a430d41d","observation_id":"305cc2a1-a26b-4291-9bf4-8fd0fb450d06","resolution":{"observed_at":"2026-08-06T18:35:40.751685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.740553Z","title":"Muon: An optimizer for hidden layers in neural networks, 2024 b","venue":null,"work_id":"e2900391-7e3b-421d-9c7b-b34dfd469e04","year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.148307Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:c3baa019a390ba9af3e7cb1db6d10779a0f6667d4f487cc1423a8855ebd9c457","observation_id":"86df6ef4-909a-4fda-b1dd-0e25d75367f4","resolution":{"observed_at":"2026-08-06T18:35:40.743734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03732","last_updated":"2023-11-28T03:23:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-28T03:23:20Z","title":"A Rank Stabilization Scaling Factor for Fine-Tuning with LoRA","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03732","snapshot_observed_at":"2026-08-06T18:35:40.150396Z","title":"A rank stabilization scaling factor for fine-tuning with lora","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.150396Z"},"links":{"cited_paper":"/paper/2312.03732","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:5de5758124925c0c5333a62a0f0edaf385a5815d19c7f993ab06f3e76ce489a0","observation_id":"705f936e-4b9c-4cdc-84c2-2819e351c7c1","resolution":{"observed_at":"2026-08-06T18:35:40.150396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T18:35:40.153241Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.153241Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:b52edb1ab60ae3ea037d50a9b2c8e3a52931551d4eed98f2c9e4fe7958b2d718","observation_id":"b05009ba-c43f-40bb-8ca5-f9d0c7d3d80f","resolution":{"observed_at":"2026-08-06T18:35:40.153241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15015","last_updated":"2025-02-20T20:11:54Z","snapshot_observed_at":"2026-07-06T20:40:06.124191Z","submitted_at":"2025-02-20T20:11:54Z","title":"Accelerating Neural Network Training: An Analysis of the AlgoPerf Competition","version":1},"cited_work":{"arxiv_id":"2502.15015","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.15015","snapshot_observed_at":"2026-08-06T18:35:40.574170Z","title":"Accelerating Neural Network Training: An Analysis of the AlgoPerf Competition","venue":"cs.LG","work_id":"ee90f9e0-0be6-4c62-8275-4aa8111abcb8","year":2025},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.155578Z"},"links":{"cited_paper":"/paper/2502.15015","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:3f93026b5f4cc7db3dbed70f1c6c3598a01482337f28c5f48f64a37fbc477a07","observation_id":"70e53d3a-442f-4abb-aa35-4c9f769be0fb","resolution":{"observed_at":"2026-08-06T18:35:40.577672Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.733322Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":"92e01713-6e6e-4062-a868-5d1942b1302f","year":2015},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.157919Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:ad7c7bc27b92a5b4965e099552b0616d0936d3e1e247cd8ef44c4e5389a7921e","observation_id":"58235faa-8bb5-44c0-b417-5c000c6c6e7f","resolution":{"observed_at":"2026-08-06T18:35:40.735655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11454","last_updated":"2024-01-16T18:59:22Z","snapshot_observed_at":"2026-07-06T16:34:38.718198Z","submitted_at":"2023-10-17T17:59:46Z","title":"VeRA: Vector-based Random Matrix Adaptation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11454","snapshot_observed_at":"2026-08-06T18:35:40.160096Z","title":"Vera: Vector-based random matrix adaptation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.160096Z"},"links":{"cited_paper":"/paper/2310.11454","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:d389f80db148a3a11cb9cbe3ad4503b023d00542fd08999e48b7e722caab72fe","observation_id":"5c145465-698e-4d14-940f-d61f01f4069e","resolution":{"observed_at":"2026-08-06T18:35:40.160096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-07-06T19:55:37.400185Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-06T18:35:40.162460Z","title":"T \" ulu 3: Pushing frontiers in open language model post-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.162460Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:f94ef02ea1423f4f66915fc5a2912f94585cf05ae7daec883d2445e04feab2a7","observation_id":"b72f3667-9544-45d7-a43d-53d61327f79e","resolution":{"observed_at":"2026-08-06T18:35:40.162460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.726068Z","title":"Scalable optimization in the modular norm","venue":null,"work_id":"894cb028-649b-4153-8f7d-46eafab15b55","year":2025},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.165018Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:5b901b25bb9dcc1a0d8f63d8b91d9e5974f0a699a24f0ee61a5eb83fc608df81","observation_id":"33ae95ce-59c6-4ccc-a4b7-14e26ed11296","resolution":{"observed_at":"2026-08-06T18:35:40.728448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08691","last_updated":"2021-09-02T17:34:41Z","snapshot_observed_at":"2026-08-06T15:24:34.790850Z","submitted_at":"2021-04-18T03:19:26Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08691","snapshot_observed_at":"2026-08-06T18:35:40.167207Z","title":"The power of scale for parameter-efficient prompt tuning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.167207Z"},"links":{"cited_paper":"/paper/2104.08691","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:58c1839de270865e559f3b30b7cffd5ed7afaf517663670ef6a71276c83f9705","observation_id":"48215550-78b8-43a5-ba07-9e7dadf5e798","resolution":{"observed_at":"2026-08-06T18:35:40.167207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.718711Z","title":"Memory efficient optimizers with 4-bit states","venue":null,"work_id":"bd8140ee-ce0a-4ac2-89d3-b1133771a3c2","year":2023},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.169646Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:12841c75ebd8c6944e051a951505fa11a446f8580cdb478c45c6e022a85851b9","observation_id":"7b5e13d4-b336-4951-b0b3-e6aac2eafcf5","resolution":{"observed_at":"2026-08-06T18:35:40.721169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00190","last_updated":"2021-01-01T08:00:36Z","snapshot_observed_at":"2026-07-06T10:29:18.734092Z","submitted_at":"2021-01-01T08:00:36Z","title":"Prefix-Tuning: Optimizing Continuous Prompts for Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00190","snapshot_observed_at":"2026-08-06T18:35:40.171944Z","title":"Prefix-tuning: Optimizing continuous prompts for generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.171944Z"},"links":{"cited_paper":"/paper/2101.00190","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:dfeaf246727b39b632c491de65dc59062236651455ac205765db68c318634c77","observation_id":"cd7943ca-2435-4c8e-9273-49dbd1343839","resolution":{"observed_at":"2026-08-06T18:35:40.171944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.711248Z","title":"Relora: High-rank training through low-rank updates","venue":null,"work_id":"04e684b3-f7e4-4973-9028-40a2bd99fd33","year":2023},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.174393Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:7ecc37bc8714c32544981a2603d0ce74e620ed03e7ffc34610b40417294cf86d","observation_id":"805a5003-36a7-43bb-bef0-dc9b00e5268b","resolution":{"observed_at":"2026-08-06T18:35:40.713960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.176629Z","title":"On the limited memory bfgs method for large scale optimization","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.176629Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:13e8fb3426f2c1bc2e181a01d1df2393fced4ea68a470aefc46772bb9be8682e","observation_id":"2c3af3d2-a44b-4111-bd5e-3e79e5bc9429","resolution":{"observed_at":"2026-08-06T18:35:40.176629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-06T18:35:40.178866Z","title":"Muon is scalable for llm training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.178866Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:b1d6da4112ed44f5428684808833bdc9385c22f1e9c02357188a8470fa025a43","observation_id":"5bd23c7b-b0fa-4202-ba6c-cbb38d1c8ce9","resolution":{"observed_at":"2026-08-06T18:35:40.178866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09353","last_updated":"2024-07-09T05:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-14T17:59:34Z","title":"DoRA: Weight-Decomposed Low-Rank Adaptation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09353","snapshot_observed_at":"2026-08-06T18:35:40.181226Z","title":"Dora: Weight-decomposed low-rank adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.181226Z"},"links":{"cited_paper":"/paper/2402.09353","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:0cc6e6fc085d51b33f856532769bbbd58be6347407d56c58510b4839e46836ad","observation_id":"8e34f1bb-6d34-4aaa-b435-50c22f551eb7","resolution":{"observed_at":"2026-08-06T18:35:40.181226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T18:35:40.183763Z","title":"Fixing weight decay regularization in adam","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.183763Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:88937cfb43810f8136eddc2aff769eb3870ad8d6b7b4361620b9a354bf7e2cf9","observation_id":"bdd016c8-8623-473e-b4f0-d65feca6e5fd","resolution":{"observed_at":"2026-08-06T18:35:40.183763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02827","last_updated":"2024-11-15T04:17:35Z","snapshot_observed_at":"2026-07-06T17:55:12.784422Z","submitted_at":"2024-04-03T15:59:42Z","title":"BAdam: A Memory Efficient Full Parameter Optimization Method for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02827","snapshot_observed_at":"2026-08-06T18:35:40.186047Z","title":"Badam: A memory efficient full parameter training method for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.186047Z"},"links":{"cited_paper":"/paper/2404.02827","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:3f3b9c77a681c4344f9b7fdedb58ced1a1945e3ffa7b2bf39b9c57c6288225c4","observation_id":"41f8934f-c0ca-4531-9d2b-174c4e6cfcac","resolution":{"observed_at":"2026-08-06T18:35:40.186047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02047","last_updated":"2023-08-07T06:21:31Z","snapshot_observed_at":"2026-07-06T15:50:26.113234Z","submitted_at":"2023-07-05T06:05:36Z","title":"CAME: Confidence-guided Adaptive Memory Efficient Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02047","snapshot_observed_at":"2026-08-06T18:35:40.188746Z","title":"Came: Confidence-guided adaptive memory efficient optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.188746Z"},"links":{"cited_paper":"/paper/2307.02047","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:bc8b620eb20949f1d0906f48ce98243953abb85523c130b85e3eae64c4971cc1","observation_id":"bbe63c38-2c25-47b1-a48b-e8cd765c3073","resolution":{"observed_at":"2026-08-06T18:35:40.188746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10195","last_updated":"2024-06-06T13:22:25Z","snapshot_observed_at":"2026-07-06T16:33:34.184498Z","submitted_at":"2023-10-16T09:04:28Z","title":"AdaLomo: Low-memory Optimization with Adaptive Learning Rate","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10195","snapshot_observed_at":"2026-08-06T18:35:40.191264Z","title":"Adalomo: Low-memory optimization with adaptive learning rate","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.191264Z"},"links":{"cited_paper":"/paper/2310.10195","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:05e8046f82bdb4ed5c910615fdbc3ce0d9e0202bb6d9e40ddc1f5f0ecacc55b9","observation_id":"5758d07c-1abf-450f-9b2b-0ada3efa269a","resolution":{"observed_at":"2026-08-06T18:35:40.191264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09782","last_updated":"2024-06-06T13:22:26Z","snapshot_observed_at":"2026-07-06T15:43:27.458645Z","submitted_at":"2023-06-16T11:37:15Z","title":"Full Parameter Fine-tuning for Large Language Models with Limited Resources","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09782","snapshot_observed_at":"2026-08-06T18:35:40.193728Z","title":"Full parameter fine-tuning for large language models with limited resources","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.193728Z"},"links":{"cited_paper":"/paper/2306.09782","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:5104c1c2c64d2adddad1ada3f5979dec023582ccb1b22067630bf2447f3d956c","observation_id":"aa8b78af-79f6-4412-8c45-a7c3df309054","resolution":{"observed_at":"2026-08-06T18:35:40.193728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-07-06T20:08:43.596697Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13148","snapshot_observed_at":"2026-08-06T18:35:40.196266Z","title":"Swan: Preprocessing sgd enables adam-level performance on llm training with significant memory reduction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.196266Z"},"links":{"cited_paper":"/paper/2412.13148","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:8399b79ec3591be5a0f21d30a98169c6b4a56040ad5a96d3c254799626e36831","observation_id":"b33f2a32-f26b-4cab-bc92-e0b243e5deb4","resolution":{"observed_at":"2026-08-06T18:35:40.196266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.199023Z","title":"New insights and perspectives on the natural gradient method","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.199023Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:b342b955a08f59148b6f85c6dee7f4747567bbce1306394737372f09416cc3f6","observation_id":"1ecbedd0-ba15-4420-b2ea-843301b4e023","resolution":{"observed_at":"2026-08-06T18:35:40.199023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.201548Z","title":"Optimizing neural networks with kronecker-factored approximate curvature","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.201548Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:91a9c0acc0b511b4310b31f2f6d0500fbd1f6d0d1a28212034b86eb36b430a57","observation_id":"535a1cff-93fd-4595-b5dc-57ac99e1d34f","resolution":{"observed_at":"2026-08-06T18:35:40.201548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15593","last_updated":"2024-11-05T15:15:13Z","snapshot_observed_at":"2026-07-06T18:19:21.735356Z","submitted_at":"2024-05-24T14:25:23Z","title":"MicroAdam: Accurate Adaptive Optimization with Low Space Overhead and Provable Convergence","version":2},"cited_work":{"arxiv_id":"2405.15593","doi":"10.48550/arxiv.2405.15593","metadata_source":"pith","pith_arxiv_id":"2405.15593","snapshot_observed_at":"2026-08-07T06:16:28.064256Z","title":"MicroAdam: Accurate Adaptive Optimization with Low Space Overhead and Provable Convergence","venue":"cs.LG","work_id":"f0177c3b-ed55-4659-95ab-ec94aad16410","year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.203626Z"},"links":{"cited_paper":"/paper/2405.15593","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:087b28e5150657987d508e8969c0338e9e6e6f840b262eef357d42f7aa060968","observation_id":"d96bc255-68ef-4318-8d27-7152607d0cfa","resolution":{"observed_at":"2026-08-06T18:35:40.279717Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17748","last_updated":"2024-06-25T17:34:51Z","snapshot_observed_at":"2026-08-04T06:25:41.174652Z","submitted_at":"2024-06-25T17:34:51Z","title":"A New Perspective on Shampoo's Preconditioner","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17748","snapshot_observed_at":"2026-08-06T18:35:40.206232Z","title":"A new perspective on shampoo's preconditioner","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.206232Z"},"links":{"cited_paper":"/paper/2406.17748","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:8ae4eefa47ffbb30aeaef5ab531e0d53af136839a04bc65e0d663f84028ed2d5","observation_id":"3f9068b4-d42c-48fe-8539-1770cd4965d8","resolution":{"observed_at":"2026-08-06T18:35:40.206232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.208989Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.208989Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:ee01d3cc0531e8ca558b87ea20880b05b5829eb3268cda42d9388973e4a73ede","observation_id":"1efd01c2-0826-46a9-bcfa-d986b1cb4467","resolution":{"observed_at":"2026-08-06T18:35:40.208989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.685883Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale","venue":null,"work_id":"b3680e44-5b5a-4f10-bff5-478e2b10b72e","year":2025},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.211977Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:b3f909be9f7c1e82c358f71237f07510653bc79fc29428caaafe6bed00929148","observation_id":"6f316196-de61-474c-baa8-f2798e19a7d8","resolution":{"observed_at":"2026-08-06T18:35:40.688519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.214420Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.214420Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:cec36e4c9e03e9218f92285804566275ce4512c15cc2e66c99151e55b1dda55c","observation_id":"af92c5c3-9423-4e42-906b-a077d1a73022","resolution":{"observed_at":"2026-08-06T18:35:40.214420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.216796Z","title":"Adarankgrad: Adaptive gradient-rank and moments for memory-efficient llms training and fine-tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.216796Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:b2ed3aac66ded42d5b15b21a5b7a01bb44057982e0730c6f3a8b482ebc474a1a","observation_id":"9adae0d8-c7be-4909-8e96-53e62d9dc309","resolution":{"observed_at":"2026-08-06T18:35:40.216796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.674016Z","title":"Ldadam: Adaptive optimization from low-dimensional gradient statistics","venue":null,"work_id":"50865f83-2438-4c74-8cec-bb1e853608b9","year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.219217Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:0a0af98fd9e0f165cc8f382a0df8818f45eb9f2026e07831effe95dbb3b8ba90","observation_id":"7e249672-1596-48c3-943e-0e72ef748e99","resolution":{"observed_at":"2026-08-06T18:35:40.676755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06742","last_updated":"2025-02-10T18:09:53Z","snapshot_observed_at":"2026-07-06T20:34:11.407726Z","submitted_at":"2025-02-10T18:09:53Z","title":"Gradient Multi-Normalization for Stateless and Scalable LLM Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06742","snapshot_observed_at":"2026-08-06T18:35:40.221296Z","title":"Gradient multi-normalization for stateless and scalable llm training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.221296Z"},"links":{"cited_paper":"/paper/2502.06742","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:4f6e80109f97adadbf0a8def7ee9312fc80e71b9466dcbc1b896cf2bc38b08f3","observation_id":"b23d3601-7f59-4904-8d2e-0039c1fa3197","resolution":{"observed_at":"2026-08-06T18:35:40.221296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.223758Z","title":"Adafactor: Adaptive learning rates with sublinear memory cost","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.223758Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:de36d53b66a915d46ba3a72a39f8fcf488dba6f4cf9ca3925d14bcd804c53d84","observation_id":"34e4caf4-1165-4a4f-9045-929d96a595e8","resolution":{"observed_at":"2026-08-06T18:35:40.223758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.662362Z","title":"Tieleman and G","venue":null,"work_id":"afe001a0-0137-4f0c-a405-be48fd783052","year":2012},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.225792Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:8b1d327c0d219989f10a4ee0f4a9af35b88b3d1709f5fbf2dcdec1e5418b3b8b","observation_id":"841a71e7-81fb-4fbb-85f4-c201c60929ff","resolution":{"observed_at":"2026-08-06T18:35:40.664744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.654699Z","title":"Practical low-rank communication compression in decentralized deep learning","venue":null,"work_id":"eb101da9-2a3a-41db-88f5-c76f5e862972","year":2020},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.227937Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:c7f38a655003e0702aa90dc314b8d30c9c89251989b9bc6bd70c13d1d6d09513","observation_id":"110f4a2b-637f-488c-ae65-3bfc5ac28b6f","resolution":{"observed_at":"2026-08-06T18:35:40.657442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11321","last_updated":"2025-01-31T18:52:42Z","snapshot_observed_at":"2026-07-06T19:16:51.512681Z","submitted_at":"2024-09-17T16:18:05Z","title":"SOAP: Improving and Stabilizing Shampoo using Adam","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11321","snapshot_observed_at":"2026-08-06T18:35:40.230139Z","title":"Soap: Improving and stabilizing shampoo using adam","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.230139Z"},"links":{"cited_paper":"/paper/2409.11321","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:ed760497c9281ccbc3dcda8f7e34c33c0c6cedfc8fd6d8e1bfbcfc8bf06c636d","observation_id":"c37c9c3d-7ce6-4a10-95b5-e88c51857c64","resolution":{"observed_at":"2026-08-06T18:35:40.230139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07461","last_updated":"2019-02-22T23:53:34Z","snapshot_observed_at":"2026-07-06T06:34:26.609892Z","submitted_at":"2018-04-20T06:35:04Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07461","snapshot_observed_at":"2026-08-06T18:35:40.232517Z","title":"Glue: A multi-task benchmark and analysis platform for natural language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.232517Z"},"links":{"cited_paper":"/paper/1804.07461","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:43c1178ef0be3746124e5d7fe4e96469c0fbdacff52a5897f38f46bb7e66dff6","observation_id":"47ef6f09-ff35-46fa-80a5-2adbad33c61f","resolution":{"observed_at":"2026-08-06T18:35:40.232517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.234934Z","title":"How far can camels go? exploring the state of instruction tuning on open resources","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.234934Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:e3aa859119860bbd65438958c75e384080f0c280f546acfb935bbe55657e762f","observation_id":"70c1579f-dfb6-489b-ae7b-dac080c96305","resolution":{"observed_at":"2026-08-06T18:35:40.234934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17813","last_updated":"2024-05-14T00:10:33Z","snapshot_observed_at":"2026-07-06T16:39:16.652626Z","submitted_at":"2023-10-26T23:17:39Z","title":"A Spectral Condition for Feature Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17813","snapshot_observed_at":"2026-08-06T18:35:40.237394Z","title":"A spectral condition for feature learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.237394Z"},"links":{"cited_paper":"/paper/2310.17813","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:29de226c0ae07abfb9a6086d7f98c568d0aa09f1b70776ec0c8557239be3798e","observation_id":"0d750cd9-6d15-4d64-8b9f-3f5302b61e32","resolution":{"observed_at":"2026-08-06T18:35:40.237394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.239930Z","title":"Bitfit: Simple parameter-efficient fine-tuning for transformer-based masked language-models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.239930Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:42db7436b075f549f683bfac57611be6e3efd4cfe3c3efe9501accf5336e9269","observation_id":"44fa1c87-6636-4c72-b2e2-b83704a4c2f4","resolution":{"observed_at":"2026-08-06T18:35:40.239930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.10512","last_updated":"2023-12-20T20:56:14Z","snapshot_observed_at":"2026-07-06T15:05:16.471478Z","submitted_at":"2023-03-18T22:36:25Z","title":"AdaLoRA: Adaptive Budget Allocation for Parameter-Efficient Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.10512","snapshot_observed_at":"2026-08-06T18:35:40.242074Z","title":"Adalora: Adaptive budget allocation for parameter-efficient fine-tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.242074Z"},"links":{"cited_paper":"/paper/2303.10512","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:3f8815f4fceae429aa31f6b794013a4950edcfec1fa51969ae9e2447566c7f4a","observation_id":"f90f451e-8e67-4718-ab89-7507bd97bf7f","resolution":{"observed_at":"2026-08-06T18:35:40.242074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03507","last_updated":"2024-06-02T21:24:12Z","snapshot_observed_at":"2026-07-06T17:40:15.746482Z","submitted_at":"2024-03-06T07:29:57Z","title":"GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03507","snapshot_observed_at":"2026-08-06T18:35:40.244756Z","title":"Galore: Memory-efficient llm training by gradient low-rank projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.244756Z"},"links":{"cited_paper":"/paper/2403.03507","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:7cd36007226d13a5eb9531348820781ebeca1bcccd4a1b1ad716c41c025186a7","observation_id":"ce95a6af-a70d-440f-91d7-1eabe494034a","resolution":{"observed_at":"2026-08-06T18:35:40.244756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14958","last_updated":"2024-03-22T05:23:31Z","snapshot_observed_at":"2026-07-06T17:48:51.281758Z","submitted_at":"2024-03-22T05:23:31Z","title":"Adapprox: Adaptive Approximation in Adam Optimization via Randomized Low-Rank Matrices","version":1},"cited_work":{"arxiv_id":"2403.14958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.14958","snapshot_observed_at":"2026-08-06T18:35:40.304676Z","title":"Adapprox: Adaptive Approximation in Adam Optimization via Randomized Low-Rank Matrices","venue":"cs.LG","work_id":"3074e8f4-0e4c-4805-932d-a4740f3250fc","year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.247371Z"},"links":{"cited_paper":"/paper/2403.14958","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:e1a167597decf4075953e75968281e397e8b366b35afbe89e1505ffeeed90d75","observation_id":"0b28fa6a-0895-48f6-8cb4-0bdc270963a8","resolution":{"observed_at":"2026-08-06T18:35:40.307682Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05270","last_updated":"2025-02-17T08:27:58Z","snapshot_observed_at":"2026-08-06T09:09:00.082930Z","submitted_at":"2024-12-06T18:55:34Z","title":"APOLLO: SGD-like Memory, AdamW-level Performance","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05270","snapshot_observed_at":"2026-08-06T18:35:40.249822Z","title":"Apollo: Sgd-like memory, adamw-level performance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.249822Z"},"links":{"cited_paper":"/paper/2412.05270","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:fda6e6aaa9d614dea80b44223c2936d61bc6b35f7861a87f60d4559e1bbbee11","observation_id":"008ee817-5a97-436a-97d1-a07d2e8019f7","resolution":{"observed_at":"2026-08-06T18:35:40.249822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:35:40.252196Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.252196Z"},"links":{"citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:697dd0ea3c23dc7eacfecbaa3d208f8826068d886dd18cbeb1f211abb41bf92d","observation_id":"9b521a52-776b-4ec0-9b32-ea53ebece1f2","resolution":{"observed_at":"2026-08-06T18:35:40.252196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":3,"verified_fuzzy":20},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2507.08091."}