{"as_of":"2026-08-09T11:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3f0c1d4a088afb94bd260b28de1159e79db868ed82fa3bbd378164c6fb9e1789","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T13:31:42.126884Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:06:15.845262Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T14:52:41.305916Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07222","snapshot_observed_at":"2026-08-07T05:06:15.845262Z","title":"A memory efficient ran- domized subspace optimization method for training large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09034","last_updated":"2025-06-30T03:33:12Z","snapshot_observed_at":"2026-08-07T04:54:31.477265Z","submitted_at":"2025-06-10T17:56:53Z","title":"FZOO: Fast Zeroth-Order Optimizer for Fine-Tuning Large Language Models towards Adam-Scale Speed","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:15.845262Z"},"links":{"cited_paper":"/paper/2502.07222","citing_paper":"/paper/2506.09034"},"observation_digest":"sha256:1fdabe0b84e550ac0691405e7fb8b5718a1433e8084e56a4bb72476e96e92c99","observation_id":"975a7038-cd34-481d-aa55-a59dd83bf1a5","resolution":{"observed_at":"2026-08-07T05:06:15.845262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"cited_work":{"arxiv_id":"2502.07222","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07222","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A memory efficient randomized subspace optimization method for training large language models.arXiv preprint arXiv:2502.07222","venue":null,"work_id":"4dfa65ca-840b-4e63-a721-f948f0de1b1d","year":2025},"citing_paper":{"arxiv_id":"2509.18993","last_updated":"2026-05-13T13:30:21Z","snapshot_observed_at":"2026-08-02T18:52:22.902766Z","submitted_at":"2025-09-23T13:43:02Z","title":"CR-Net: Scaling Parameter-Efficient Training with Cross-Layer Low-Rank Structure","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T14:51:30.312509Z"},"links":{"cited_paper":"/paper/2502.07222","citing_paper":"/paper/2509.18993"},"observation_digest":"sha256:af95075a675f6d7bcc6d3c0a21888b5198af6d270b120965bcf091f27e0e8c53","observation_id":"d48eac71-acc1-4a57-a145-b1334f1674a9","resolution":{"observed_at":"2026-05-18T14:52:41.310077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"cited_work":{"arxiv_id":"2502.07222","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07222","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A memory efficient randomized subspace optimization method for training large language models.arXiv preprint arXiv:2502.07222","venue":null,"work_id":"4dfa65ca-840b-4e63-a721-f948f0de1b1d","year":2025},"citing_paper":{"arxiv_id":"2512.12131","last_updated":"2026-05-11T19:05:27Z","snapshot_observed_at":"2026-08-02T10:02:28.902022Z","submitted_at":"2025-12-13T01:50:18Z","title":"BOOST: BOttleneck-Optimized Scalable Training Framework for Low-Rank Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T23:19:02.358348Z"},"links":{"cited_paper":"/paper/2502.07222","citing_paper":"/paper/2512.12131"},"observation_digest":"sha256:5079509485849268dc8072207e23a3f7eee2e52b76a795c9b45dee2d123e1f1e","observation_id":"b9b5e486-9ed5-43bd-9601-4a81e8f559c6","resolution":{"observed_at":"2026-05-16T23:21:21.624728Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"cited_work":{"arxiv_id":"2502.07222","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07222","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A memory efficient randomized subspace optimization method for training large language models.arXiv preprint arXiv:2502.07222","venue":null,"work_id":"4dfa65ca-840b-4e63-a721-f948f0de1b1d","year":2025},"citing_paper":{"arxiv_id":"2605.00650","last_updated":"2026-05-01T13:31:35Z","snapshot_observed_at":"2026-07-06T23:14:01.852096Z","submitted_at":"2026-05-01T13:31:35Z","title":"AdaMeZO: Adam-style Zeroth-Order Optimizer for LLM Fine-tuning Without Maintaining the Moments","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-09T19:50:50.653184Z"},"links":{"cited_paper":"/paper/2502.07222","citing_paper":"/paper/2605.00650"},"observation_digest":"sha256:df8f34fe6180fb55bfcef153eae4f00d11a028f8edfda32f5024489b0041238e","observation_id":"fe18d896-397a-46a8-b4d8-f4cd285c224a","resolution":{"observed_at":"2026-05-11T15:31:07.546357Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"cited_work":{"arxiv_id":"2502.07222","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07222","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A memory efficient randomized subspace optimization method for training large language models.arXiv preprint arXiv:2502.07222","venue":null,"work_id":"4dfa65ca-840b-4e63-a721-f948f0de1b1d","year":2025},"citing_paper":{"arxiv_id":"2605.10288","last_updated":"2026-05-12T10:19:03Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T09:50:10Z","title":"BROS: Bias-Corrected Randomized Subspaces for Memory-Efficient Single-Loop Bilevel Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T04:47:04.868735Z"},"links":{"cited_paper":"/paper/2502.07222","citing_paper":"/paper/2605.10288"},"observation_digest":"sha256:b387ff7d0074c5f4d009ce4d4071c8b0335ab476f230ae234986944a7e705a5d","observation_id":"ec5d3761-5ce8-44bf-84cd-c91704fedc2a","resolution":{"observed_at":"2026-05-12T05:56:26.672855Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"cited_work":{"arxiv_id":"2502.07222","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07222","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A memory efficient randomized subspace optimization method for training large language models.arXiv preprint arXiv:2502.07222","venue":null,"work_id":"4dfa65ca-840b-4e63-a721-f948f0de1b1d","year":2025},"citing_paper":{"arxiv_id":"2605.10288","last_updated":"2026-05-12T10:19:03Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T09:50:10Z","title":"BROS: Bias-Corrected Randomized Subspaces for Memory-Efficient Single-Loop Bilevel Optimization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T06:20:42.781613Z"},"links":{"cited_paper":"/paper/2502.07222","citing_paper":"/paper/2605.10288"},"observation_digest":"sha256:6f9e4d03d748322ddf407d155e6bdf7e2a4b69850908645f4429649c0cf7caa9","observation_id":"15be2455-b720-4779-9d82-bceece556a22","resolution":{"observed_at":"2026-05-13T06:22:23.334369Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.07222/citation-record","integrity":"/paper/2502.07222/integrity","json":"/paper/2502.07222/citation-record.json","paper":"/paper/2502.07222"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-08T13:31:42.007786Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T13:31:42.007786Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2502.07222"},"observation_digest":"sha256:9edd046735ef5f9b2dff58fa00aefa7f07846f6de3701db3fcb2bc54c037adc1","observation_id":"c43fe9cd-617f-4505-ac56-f4d5740570ed","resolution":{"observed_at":"2026-08-08T13:31:42.007786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-08T13:31:42.038311Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T13:31:42.038311Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2502.07222"},"observation_digest":"sha256:99fc1ec6c3a19720d2f211885fc2172fa3d3157e16e6889ea7b3159bd631c275","observation_id":"e0be1fcc-0bdd-44f7-b901-b882f8008b00","resolution":{"observed_at":"2026-08-08T13:31:42.038311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04151","last_updated":"2024-01-08T14:26:49Z","snapshot_observed_at":"2026-08-09T08:32:45.570035Z","submitted_at":"2024-01-08T14:26:49Z","title":"Chain of LoRA: Efficient Fine-tuning of Language Models via Residual Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04151","snapshot_observed_at":"2026-08-08T13:31:42.043331Z","title":"Chain of lora: Efficient fine-tuning of language models via residual learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T13:31:42.043331Z"},"links":{"cited_paper":"/paper/2401.04151","citing_paper":"/paper/2502.07222"},"observation_digest":"sha256:82351f05605dc87c098f32165fbdd53adcbbf508ecd86e7e93f4b575f6a142ba","observation_id":"1e1eff25-4cd1-4051-8c2d-52f462d793c4","resolution":{"observed_at":"2026-08-08T13:31:42.043331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11289","last_updated":"2025-06-04T06:11:50Z","snapshot_observed_at":"2026-08-08T08:32:10.511805Z","submitted_at":"2024-10-15T05:16:32Z","title":"Subspace Optimization for Large Language Models with Convergence Guarantees","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11289","snapshot_observed_at":"2026-08-08T13:31:42.048006Z","title":"Subspace optimization for large language models with convergence guarantees","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T13:31:42.048006Z"},"links":{"cited_paper":"/paper/2410.11289","citing_paper":"/paper/2502.07222"},"observation_digest":"sha256:33a7c68473104b2c1382716cb02ca11d41ce95ceb3bb3faf91abc612ee821eb6","observation_id":"723f37ca-d918-4659-b148-8b7389db98c5","resolution":{"observed_at":"2026-08-08T13:31:42.048006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03293","last_updated":"2024-06-12T22:17:37Z","snapshot_observed_at":"2026-08-05T09:55:40.815776Z","submitted_at":"2024-02-05T18:50:39Z","title":"Flora: Low-Rank Adapters Are Secretly Gradient Compressors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03293","snapshot_observed_at":"2026-08-08T13:31:42.052527Z","title":"Flora: Low-rank adapters are secretly gradient compressors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T13:31:42.052527Z"},"links":{"cited_paper":"/paper/2402.03293","citing_paper":"/paper/2502.07222"},"observation_digest":"sha256:d89c0e267730a1e060c61a3d53e007c8e2e11d0cb32e897f1c45c4f7063c2f4b","observation_id":"c1dd313c-bc00-4608-967b-bcdeee29589f","resolution":{"observed_at":"2026-08-08T13:31:42.052527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07698","last_updated":"2024-10-10T08:10:53Z","snapshot_observed_at":"2026-08-09T07:30:02.056594Z","submitted_at":"2024-10-10T08:10:53Z","title":"Enhancing Zeroth-order Fine-tuning for Language Models with Low-rank Structures","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07698","snapshot_observed_at":"2026-08-08T13:31:42.057316Z","title":"Enhancing zeroth-order fine-tuning for language models with low-rank structures","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T13:31:42.057316Z"},"links":{"cited_paper":"/paper/2410.07698","citing_paper":"/paper/2502.07222"},"observation_digest":"sha256:11e4a17f7b51a6c68deab0ae64454bcc2f4c93f216fa75b8462185ea224b41c4","observation_id":"3416b57f-a747-44e1-aa4f-53cd5a854338","resolution":{"observed_at":"2026-08-08T13:31:42.057316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09673","last_updated":"2024-09-20T21:21:56Z","snapshot_observed_at":"2026-08-04T07:20:49.662052Z","submitted_at":"2024-05-15T19:27:45Z","title":"LoRA Learns Less and Forgets Less","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09673","snapshot_observed_at":"2026-08-08T13:31:42.061884Z","title":"Lora learns less and forgets less","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T13:31:42.061884Z"},"links":{"cited_paper":"/paper/2405.09673","citing_paper":"/paper/2502.07222"},"observation_digest":"sha256:c0ed166349c7cde90a41300da26fb0a39c51bb7bcdef7b9e0d2f6545b57a6a5e","observation_id":"9ba0fd91-1273-4f46-8c25-048b37646563","resolution":{"observed_at":"2026-08-08T13:31:42.061884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12857","last_updated":"2024-08-23T05:54:53Z","snapshot_observed_at":"2026-08-02T03:25:18.261713Z","submitted_at":"2024-08-23T05:54:53Z","title":"Memory-Efficient LLM Training with Online Subspace Descent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12857","snapshot_observed_at":"2026-08-08T13:31:42.066484Z","title":"Memory-efficient llm training with online subspace descent","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T13:31:42.066484Z"},"links":{"cited_paper":"/paper/2408.12857","citing_paper":"/paper/2502.07222"},"observation_digest":"sha256:c4cc36fc64d2e4a53891cd317549e58ea4287271fc9eaf6c6fe4326ac848999b","observation_id":"962db0d4-9782-4af4-8935-6fcb5d559388","resolution":{"observed_at":"2026-08-08T13:31:42.066484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:31:42.070965Z","title":"Fira: Can we achieve full-rank training of llms under low-rank constraint? arXiv preprint arXiv:2410.01623, 2024b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T13:31:42.070965Z"},"links":{"citing_paper":"/paper/2502.07222"},"observation_digest":"sha256:052c5c2d7c4b490ee62ea79f33380765bf2efafba9ffe782dd442967db02cf9d","observation_id":"7257a49f-7d7f-4d3f-bb85-442a9660787d","resolution":{"observed_at":"2026-08-08T13:31:42.070965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07237","last_updated":"2026-04-27T13:03:55Z","snapshot_observed_at":"2026-07-06T20:20:14.452585Z","submitted_at":"2025-01-13T11:35:09Z","title":"GWT: Scalable Optimizer State Compression for Large Language Model Training","version":5},"cited_work":{"arxiv_id":"2501.07237","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.07237","snapshot_observed_at":"2026-08-08T13:31:42.276951Z","title":"GWT: Scalable Optimizer State Compression for Large Language Model Training","venue":"cs.LG","work_id":"56ae07a1-e916-4473-b7ab-f08611c44171","year":2025},"citing_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T13:31:42.080116Z"},"links":{"cited_paper":"/paper/2501.07237","citing_paper":"/paper/2502.07222"},"observation_digest":"sha256:79884dcbf3a8e502fed781a02607bc1b5ecff3d5bac097fd828722e778be0908","observation_id":"a7221865-1152-4da2-a76c-69f946720f23","resolution":{"observed_at":"2026-08-08T13:31:42.282331Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15173","last_updated":"2025-02-18T13:45:50Z","snapshot_observed_at":"2026-07-06T17:34:28.430476Z","submitted_at":"2024-02-23T08:11:55Z","title":"Second-Order Fine-Tuning without Pain for LLMs:A Hessian Informed Zeroth-Order Optimizer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15173","snapshot_observed_at":"2026-08-08T13:31:42.089462Z","title":"Second-order fine-tuning without pain for llms: A hessian informed zeroth-order optimizer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T13:31:42.089462Z"},"links":{"cited_paper":"/paper/2402.15173","citing_paper":"/paper/2502.07222"},"observation_digest":"sha256:55262031e7d74e40f06c14b536e30d4773d6861dec780139405572c8270770c2","observation_id":"5512ac83-5cbc-40c7-8f4b-cfb6d32aa5ec","resolution":{"observed_at":"2026-08-08T13:31:42.089462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06174","last_updated":"2016-04-22T19:21:36Z","snapshot_observed_at":"2026-08-08T09:03:25.135475Z","submitted_at":"2016-04-21T04:15:27Z","title":"Training Deep Nets with Sublinear Memory Cost","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.06174","snapshot_observed_at":"2026-08-08T13:31:42.094129Z","title":"Training deep nets with sublinear memory cost","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T13:31:42.094129Z"},"links":{"cited_paper":"/paper/1604.06174","citing_paper":"/paper/2502.07222"},"observation_digest":"sha256:c7ba8e35c915308713d6d63759220e61278c55b6879089c5adb8f6cf84af09b0","observation_id":"51eb4ee5-6276-4bf5-93c6-39a0e6e05ef5","resolution":{"observed_at":"2026-08-08T13:31:42.094129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:31:42.697919Z","title":"{Zero-offload}: Democratizing {billion-scale} model training","venue":null,"work_id":"c6272062-e303-49ec-b9fc-9898e44a4640","year":2021},"citing_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T13:31:42.103753Z"},"links":{"citing_paper":"/paper/2502.07222"},"observation_digest":"sha256:9b6c4ce2978a46634700991b1e46dba8846f3126fc2f472d63b63759e7f8b5f5","observation_id":"8999f02c-d660-4eb4-96f3-afa40bc85f4f","resolution":{"observed_at":"2026-08-08T13:31:42.702554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.14840","last_updated":"2025-04-04T20:13:36Z","snapshot_observed_at":"2026-07-06T11:05:04.853545Z","submitted_at":"2021-04-30T08:50:24Z","title":"Unified Convergence Analysis for Adaptive Optimization with Moving Average Estimator","version":7},"cited_work":{"arxiv_id":"2104.14840","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.14840","snapshot_observed_at":"2026-08-08T13:31:42.195525Z","title":"Unified Convergence Analysis for Adaptive Optimization with Moving Average Estimator","venue":"math.OC","work_id":"38bd8047-ae20-408c-85e7-e413b0217bef","year":2021},"citing_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T13:31:42.112866Z"},"links":{"cited_paper":"/paper/2104.14840","citing_paper":"/paper/2502.07222"},"observation_digest":"sha256:c7ea8ca6a74c8fc363d079304fb76c6743ea20c51627d505c6452e4f77a0f144","observation_id":"b2700321-27a8-44be-bb10-b64b6f316864","resolution":{"observed_at":"2026-08-08T13:31:42.202894Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-08T13:31:42.117526Z","title":"Roberta: A robustly optimized bert pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T13:31:42.117526Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2502.07222"},"observation_digest":"sha256:f03556fc45122a50e52c3800a8285370712bc596de2fcdd58b6e2e2288ef4180","observation_id":"0e2b3cf8-96b4-49c7-9de4-517f0a01e3aa","resolution":{"observed_at":"2026-08-08T13:31:42.117526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:31:42.668051Z","title":"We also report the memory overhead and total training time for each method","venue":null,"work_id":"7ad748ec-63b8-4ad1-9d78-ea8666b7f18b","year":null},"citing_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T13:31:42.126884Z"},"links":{"citing_paper":"/paper/2502.07222"},"observation_digest":"sha256:c002a3622a0e328bdfd99d0cb26b8ee31cadb3aa6325cdd76dc407a6e1033bb2","observation_id":"dc7a6963-77c3-4ea5-9329-d7b9aa275ed5","resolution":{"observed_at":"2026-08-08T13:31:42.672786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-08T13:31:42.028545Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-08T13:31:42.028545Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2502.07222"},"observation_digest":"sha256:8c1cb207b7c5acb0b1f98e0b984d626c4295018452e65a61b82f3b8d26d8eca5","observation_id":"7d117e1a-e632-4350-889c-e33cbc2f503e","resolution":{"observed_at":"2026-08-08T13:31:42.028545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14314","last_updated":"2023-05-23T17:50:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T17:50:33Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14314","snapshot_observed_at":"2026-08-08T13:31:42.098753Z","title":"Qlora: efficient finetuning of quantized llms (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-08T13:31:42.098753Z"},"links":{"cited_paper":"/paper/2305.14314","citing_paper":"/paper/2502.07222"},"observation_digest":"sha256:072471e3f5ca3a92abf6715982e353fa9f91237dc8957181cd62f17abf4f3dd3","observation_id":"7dbf2f18-468c-4ae3-9814-34798345d6b9","resolution":{"observed_at":"2026-08-08T13:31:42.098753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03507","last_updated":"2024-06-02T21:24:12Z","snapshot_observed_at":"2026-07-06T17:40:15.746482Z","submitted_at":"2024-03-06T07:29:57Z","title":"GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03507","snapshot_observed_at":"2026-08-08T13:31:42.033460Z","title":"Galore: Memory-efficient llm training by gradient low-rank projection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-08T13:31:42.033460Z"},"links":{"cited_paper":"/paper/2403.03507","citing_paper":"/paper/2502.07222"},"observation_digest":"sha256:4602b30f3f175c73f6ea1dd832f1d029f4f0969a246a50c60097239b3fd1fb70","observation_id":"81b546d6-cd09-41b1-b43e-8fe64df9ee27","resolution":{"observed_at":"2026-08-08T13:31:42.033460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16029","last_updated":"2024-10-21T14:05:06Z","snapshot_observed_at":"2026-08-08T08:03:32.385510Z","submitted_at":"2024-10-21T14:05:06Z","title":"Natural GaLore: Accelerating GaLore for memory-efficient LLM Training and Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16029","snapshot_observed_at":"2026-08-08T13:31:42.075566Z","title":"Natural galore: Accelerating galore for memory-efficient llm training and fine-tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-08T13:31:42.075566Z"},"links":{"cited_paper":"/paper/2410.16029","citing_paper":"/paper/2502.07222"},"observation_digest":"sha256:622068f6086f68778749a5b9820e287347af86e534e35352092920e04c5cbfa8","observation_id":"a964815e-6c11-4934-8371-7c97acad7c5c","resolution":{"observed_at":"2026-08-08T13:31:42.075566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07461","last_updated":"2019-02-22T23:53:34Z","snapshot_observed_at":"2026-07-06T06:34:26.609892Z","submitted_at":"2018-04-20T06:35:04Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07461","snapshot_observed_at":"2026-08-08T13:31:42.122265Z","title":"Glue: A multi-task benchmark and analysis platform for natural language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-08T13:31:42.122265Z"},"links":{"cited_paper":"/paper/1804.07461","citing_paper":"/paper/2502.07222"},"observation_digest":"sha256:c4399aea4c73d3d857bba01286435e3eebe08f80345689a9694e1b716d1190b3","observation_id":"3347d7e8-4a3d-48c4-92ac-90dd0a3a50dd","resolution":{"observed_at":"2026-08-08T13:31:42.122265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T13:31:42.013680Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-08T13:31:42.013680Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.07222"},"observation_digest":"sha256:cd95ee90f49083560a8ffa4d48ba6072e6f92c178e11610499fcbf8a278ccee6","observation_id":"d0cd6cf5-8f8b-4b11-99ce-5024066cf95e","resolution":{"observed_at":"2026-08-08T13:31:42.013680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T13:31:42.682771Z","title":"G10: Enabling an efficient unified gpu memory and storage architecture with smart tensor migrations","venue":null,"work_id":"a9aefede-9076-44df-8c64-441f8ef45d4d","year":2010},"citing_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T13:31:42.108417Z"},"links":{"citing_paper":"/paper/2502.07222"},"observation_digest":"sha256:94cdeb36f7dac58336f4a29ee850783736177d75f86196f3153f09c220b49bdf","observation_id":"cfea90d6-d746-4ff9-877f-9862585cee59","resolution":{"observed_at":"2026-08-08T13:31:42.688081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T13:31:42.018811Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T13:31:42.018811Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.07222"},"observation_digest":"sha256:5f9ecae8eb18332aeebecab7ce9ddb1a5e84cc5d95b30185c82cbaae614aa3c1","observation_id":"fe92f3d9-0eb2-4e29-bbda-735c56a10869","resolution":{"observed_at":"2026-08-08T13:31:42.018811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-08T13:31:42.023758Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T13:31:42.023758Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2502.07222"},"observation_digest":"sha256:50c605c33f42df1e3f46a6f44eec395760a889dce55e445dde604029105f4da4","observation_id":"c68f13ae-ebba-426c-98f6-6fdfa3823743","resolution":{"observed_at":"2026-08-08T13:31:42.023758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08080","last_updated":"2024-04-11T18:35:49Z","snapshot_observed_at":"2026-07-06T17:59:04.250437Z","submitted_at":"2024-04-11T18:35:49Z","title":"Variance-reduced Zeroth-Order Methods for Fine-Tuning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08080","snapshot_observed_at":"2026-08-08T13:31:42.084774Z","title":"Variance-reduced zeroth-order methods for fine-tuning language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-08T13:31:42.084774Z"},"links":{"cited_paper":"/paper/2404.08080","citing_paper":"/paper/2502.07222"},"observation_digest":"sha256:1efc6ea9750d2d9552ceaa90a9306c21ad08ddcb77e821ef88a97c7aa7c89070","observation_id":"762db2e0-86aa-46b6-9993-bec36b85da3a","resolution":{"observed_at":"2026-08-08T13:31:42.084774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.07222","last_updated":"2025-02-11T03:32:10Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T13:23:06.239630Z","submitted_at":"2025-02-11T03:32:10Z","title":"A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":2,"verified_fuzzy":3},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 6 inbound Pith citation observations for arXiv:2502.07222."}