{"as_of":"2026-08-07T18:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3ffb3e49a7410065c64fbaf1532c9f55b07a45fe08636af3f48ab38fcf6afa11","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:06:27.858773Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T22:10:49.683444Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T13:24:53.191510Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"cited_work":{"arxiv_id":"2505.22922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22922","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Glentis, J","venue":null,"work_id":"c6850665-eab6-441b-af72-73065e30c6b3","year":null},"citing_paper":{"arxiv_id":"2506.16659","last_updated":"2026-05-20T23:37:18Z","snapshot_observed_at":"2026-07-06T21:45:02.192166Z","submitted_at":"2025-06-20T00:10:35Z","title":"Memory-Efficient LLM Pretraining via Minimalist Optimizer Design","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T13:23:55.233840Z"},"links":{"cited_paper":"/paper/2505.22922","citing_paper":"/paper/2506.16659"},"observation_digest":"sha256:10726155fe70fed6a352279887db2994b9af1f9538cb23dbfd0b55628d32825a","observation_id":"c96ffdcd-e6c1-45c5-b1ce-5b8491a3b64b","resolution":{"observed_at":"2026-05-22T13:24:53.193892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22922","snapshot_observed_at":"2026-07-11T22:10:49.683444Z","title":"Scalable parameter and memory efficient pretraining for llm: Recent algorithmic advances and benchmarking.arXiv preprint arXiv:2505.22922, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04033","last_updated":"2026-07-04T21:27:05Z","snapshot_observed_at":"2026-08-07T05:07:10.107694Z","submitted_at":"2026-07-04T21:27:05Z","title":"OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T22:10:49.683444Z"},"links":{"cited_paper":"/paper/2505.22922","citing_paper":"/paper/2607.04033"},"observation_digest":"sha256:2989c046d31b4c32adc3b1ebc5cb762a39de060783540f6155e73236f593d53f","observation_id":"1e26ec93-ed6e-4458-8f60-c2ce67e0df44","resolution":{"observed_at":"2026-07-11T22:10:49.683444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22922/citation-record","integrity":"/paper/2505.22922/integrity","json":"/paper/2505.22922/citation-record.json","paper":"/paper/2505.22922"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T13:06:23.201468Z","title":"Achiam, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:23.201468Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:2d4caad8740ab6d93dd15c971151863bd2ea7121007ff7c857a0e2b6d7cd762b","observation_id":"e1aa5b93-e562-49a6-9005-a98bb4b948ec","resolution":{"observed_at":"2026-08-07T13:06:23.201468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-07T13:06:23.277142Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:23.277142Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:cbcbe92bddc1b1474c5b88dfbf3ffd47eb40573600234a243831607d443b536b","observation_id":"8d44dbe3-2abf-4e70-80fe-99413fe54024","resolution":{"observed_at":"2026-08-07T13:06:23.277142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:06:33.635972Z","title":null,"venue":null,"work_id":"222d47a8-6f51-4b33-a2fa-45c7e83d58ce","year":1997},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:23.380808Z"},"links":{"citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:7da9bec970df68d6be50475b885c7a6d38ac9271d86851a0fe8707489dcf0103","observation_id":"30e8f03f-f738-4466-8458-97b12d8544fb","resolution":{"observed_at":"2026-08-07T13:06:33.671609Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:06:23.447942Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:23.447942Z"},"links":{"citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:1af432af5011d3255cc5b28a8a8efb9d406ce890059736935ef89d4c3bd6809d","observation_id":"d776d150-7441-457f-833a-86b7715e9788","resolution":{"observed_at":"2026-08-07T13:06:23.447942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11722","last_updated":"2024-10-11T15:35:49Z","snapshot_observed_at":"2026-08-03T11:30:18.738825Z","submitted_at":"2024-07-16T13:42:09Z","title":"Exploring Quantization for Efficient Pre-Training of Transformer Language Models","version":2},"cited_work":{"arxiv_id":"2407.11722","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.11722","snapshot_observed_at":"2026-08-07T13:06:29.240675Z","title":"Exploring Quantization for Efficient Pre-Training of Transformer Language Models","venue":"cs.LG","work_id":"9a3e1bde-6f48-4a41-a5e7-d74689ef8bea","year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:23.551534Z"},"links":{"cited_paper":"/paper/2407.11722","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:48fbe12de65cb794d45f4b8ea3e4ed8b23482ed3514fd2332da864c25953b709","observation_id":"999f2e20-b2ee-467e-a4a1-ccb8bce7a30b","resolution":{"observed_at":"2026-08-07T13:06:29.308955Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16029","last_updated":"2024-10-21T14:05:06Z","snapshot_observed_at":"2026-07-06T19:37:07.379149Z","submitted_at":"2024-10-21T14:05:06Z","title":"Natural GaLore: Accelerating GaLore for memory-efficient LLM Training and Fine-tuning","version":1},"cited_work":{"arxiv_id":"2410.16029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.16029","snapshot_observed_at":"2026-08-07T13:06:29.106206Z","title":"Natural GaLore: Accelerating GaLore for memory-efficient LLM Training and Fine-tuning","venue":"cs.LG","work_id":"b104938c-07c5-4574-a7e0-01aad34c1993","year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:23.613924Z"},"links":{"cited_paper":"/paper/2410.16029","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:6c99dd7ea7eb67a08696609fba8987f7383b863a70ba3eaa07bdb64e5db4bc96","observation_id":"4031ad15-2e78-486e-92b1-2d37bb73fdb4","resolution":{"observed_at":"2026-08-07T13:06:29.184569Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18137","last_updated":"2024-11-04T11:16:38Z","snapshot_observed_at":"2026-07-06T18:21:18.150567Z","submitted_at":"2024-05-28T12:51:01Z","title":"Exploiting LLM Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18137","snapshot_observed_at":"2026-08-07T13:06:23.733823Z","title":"Egashira, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:23.733823Z"},"links":{"cited_paper":"/paper/2405.18137","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:375025bb26dd89dee48fccb12ce4716c360db2dac87cc19dfe3b87ffba7c6071","observation_id":"5bb5b62c-c8fe-43bc-829b-d557021bd461","resolution":{"observed_at":"2026-08-07T13:06:23.733823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11235","last_updated":"2024-03-09T13:28:29Z","snapshot_observed_at":"2026-07-06T14:44:56.245065Z","submitted_at":"2023-01-26T17:18:36Z","title":"Handbook of Convergence Theorems for (Stochastic) Gradient Methods","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11235","snapshot_observed_at":"2026-08-07T13:06:23.807122Z","title":"Garrigos and R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:23.807122Z"},"links":{"cited_paper":"/paper/2301.11235","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:9d3805d6123e0855e53e31190873f53b02dd3e00da6dc260076114014b3bec52","observation_id":"698d426a-8526-4e44-ba34-6ff5d0488ef5","resolution":{"observed_at":"2026-08-07T13:06:23.807122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02379","last_updated":"2025-05-30T21:08:32Z","snapshot_observed_at":"2026-07-06T20:16:35.984578Z","submitted_at":"2025-01-04T20:51:51Z","title":"TensorGRaD: Tensor Gradient Robust Decomposition for Memory-Efficient Neural Operator Training","version":2},"cited_work":{"arxiv_id":"2501.02379","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.02379","snapshot_observed_at":"2026-08-07T13:06:28.880668Z","title":"TensorGRaD: Tensor Gradient Robust Decomposition for Memory-Efficient Neural Operator Training","venue":"cs.LG","work_id":"60ca93a2-91e1-4951-a7c6-acf497db3506","year":2025},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:23.881962Z"},"links":{"cited_paper":"/paper/2501.02379","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:29c6305b6bbb66e9d0e54d8e7c0e52b2cfe642b2657f344bc75f032092e97066","observation_id":"cf91af76-3be1-4402-986d-b9f19f645a37","resolution":{"observed_at":"2026-08-07T13:06:28.966129Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:06:33.431872Z","title":null,"venue":null,"work_id":"89adfda2-d1ae-4111-b667-a37785012724","year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:23.992014Z"},"links":{"citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:7e2288d14031d5f0b0e2bdf4b8d9d64131ee384441e5ba93b02ea004d429040b","observation_id":"5bcd8845-b385-4bf3-8ce4-9408a725ab21","resolution":{"observed_at":"2026-08-07T13:06:33.544934Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03293","last_updated":"2024-06-12T22:17:37Z","snapshot_observed_at":"2026-08-05T09:55:40.815776Z","submitted_at":"2024-02-05T18:50:39Z","title":"Flora: Low-Rank Adapters Are Secretly Gradient Compressors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03293","snapshot_observed_at":"2026-08-07T13:06:24.049161Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:24.049161Z"},"links":{"cited_paper":"/paper/2402.03293","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:32ff4d2daa0812270c9dc14c355a8d1a4422c95d43b4fcfc896e2fa0d19a55ef","observation_id":"3d6284ca-2101-498e-8d46-97f27e9863c0","resolution":{"observed_at":"2026-08-07T13:06:24.049161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20650","last_updated":"2024-10-28T01:12:20Z","snapshot_observed_at":"2026-08-03T13:26:49.608015Z","submitted_at":"2024-10-28T01:12:20Z","title":"NeuZip: Memory-Efficient Training and Inference with Dynamic Compression of Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20650","snapshot_observed_at":"2026-08-07T13:06:24.124343Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:24.124343Z"},"links":{"cited_paper":"/paper/2410.20650","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:3841a09cdba65a6403a763fc6f17db8835959eb0d3abefd194111111beb7f27a","observation_id":"e7f802d2-1356-4c3c-b566-b92d52f02a8f","resolution":{"observed_at":"2026-08-07T13:06:24.124343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:06:24.167449Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:24.167449Z"},"links":{"citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:7d201377779d1b9b5dd3b5c10c57766af7369aacf0980afa9324dedc37991648","observation_id":"3e32e63b-2722-4b30-9869-b800ad22bf48","resolution":{"observed_at":"2026-08-07T13:06:24.167449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11289","last_updated":"2025-06-04T06:11:50Z","snapshot_observed_at":"2026-08-02T07:33:05.101659Z","submitted_at":"2024-10-15T05:16:32Z","title":"Subspace Optimization for Large Language Models with Convergence Guarantees","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11289","snapshot_observed_at":"2026-08-07T13:06:24.246688Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:24.246688Z"},"links":{"cited_paper":"/paper/2410.11289","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:4ab23ceabba2fbd030b939044ebe7f98bef3151031f5d6eb185f52293e00e1c7","observation_id":"ebb7ee23-15e3-4f34-9b01-749953309ab2","resolution":{"observed_at":"2026-08-07T13:06:24.246688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:06:33.199105Z","title":null,"venue":null,"work_id":"1a37b4bf-ac43-4018-8eab-8c05a74e4349","year":2022},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:24.336208Z"},"links":{"citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:153deca40c443be3c973fe676b5eacc4670790ba8b4f7a183e3b778c41ac8ecf","observation_id":"bf306994-4fa3-4fbf-b2ff-a3f422936d9e","resolution":{"observed_at":"2026-08-07T13:06:33.307641Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17055","last_updated":"2026-08-03T09:15:30Z","snapshot_observed_at":"2026-08-07T17:53:37.204385Z","submitted_at":"2025-02-24T11:09:15Z","title":"GradientStabilizer:Fix the Norm, Not the Gradient","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17055","snapshot_observed_at":"2026-08-07T13:06:24.422011Z","title":"Huang, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:24.422011Z"},"links":{"cited_paper":"/paper/2502.17055","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:ccb9eaf0ea432617904358252a59205ead03a2cb10b56a926fe465e64be00805","observation_id":"9db72b11-642c-49e6-a945-d42bf23c5c3f","resolution":{"observed_at":"2026-08-07T13:06:24.422011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:06:32.944113Z","title":"Huang, Z","venue":null,"work_id":"5dfdd318-3677-4a73-81cb-fa4d572b4ea4","year":2025},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:24.533138Z"},"links":{"citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:ddd32cf34de6819d88b11bd0ab781ceb3710389a1795d3d684e2041b114d02fb","observation_id":"65878987-e081-453b-a3ec-850e94c48ed6","resolution":{"observed_at":"2026-08-07T13:06:33.059473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13569","last_updated":"2022-09-27T17:43:45Z","snapshot_observed_at":"2026-08-07T03:29:16.217842Z","submitted_at":"2022-09-27T17:43:45Z","title":"Exploring Low Rank Training of Deep Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13569","snapshot_observed_at":"2026-08-07T13:06:24.609267Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:24.609267Z"},"links":{"cited_paper":"/paper/2209.13569","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:19026124e6c5ad54d9d2e596d6aa3549670a2f51911042ce9d61371ddcd0bf02","observation_id":"97090a77-976b-4654-aee1-215f356b1371","resolution":{"observed_at":"2026-08-07T13:06:24.609267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T13:06:24.682160Z","title":"Kaplan, S","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:24.682160Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:4ae2e6bf032ea1e01c392e8fb8d55ea3c2bef48edee85a03e92a7e82ff000946","observation_id":"70504233-acfa-4ba3-b72f-09025f141a58","resolution":{"observed_at":"2026-08-07T13:06:24.682160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:06:32.657830Z","title":"Lialin, S","venue":null,"work_id":"1de3a9d4-f7f5-4ed3-bd2e-fa5030fe7b09","year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:24.755459Z"},"links":{"citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:79348d56db2a584292ea0d63dcf88d45dbf88fd8768f1491343d7e3696c35a26","observation_id":"0fb62576-360a-489a-b560-9a7d61ca6aa5","resolution":{"observed_at":"2026-08-07T13:06:32.767006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12857","last_updated":"2024-08-23T05:54:53Z","snapshot_observed_at":"2026-08-02T03:25:18.261713Z","submitted_at":"2024-08-23T05:54:53Z","title":"Memory-Efficient LLM Training with Online Subspace Descent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12857","snapshot_observed_at":"2026-08-07T13:06:24.815448Z","title":"Liang, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:24.815448Z"},"links":{"cited_paper":"/paper/2408.12857","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:f24c5c002274da49ea2ab05d46185aaf069f89f3d829b700d684698728b193e9","observation_id":"88a753df-6ad8-4188-8978-418d04835b85","resolution":{"observed_at":"2026-08-07T13:06:24.815448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19820","last_updated":"2024-12-15T12:28:13Z","snapshot_observed_at":"2026-07-06T20:13:49.797517Z","submitted_at":"2024-12-15T12:28:13Z","title":"GaLore$+$: Boosting Low-Rank Adaptation for LLMs with Cross-Head Projection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19820","snapshot_observed_at":"2026-08-07T13:06:24.897294Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:24.897294Z"},"links":{"cited_paper":"/paper/2412.19820","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:6a25742a05270e33de5cb80e5e9f0a560a083704e65b4c2a376c51a375326604","observation_id":"a92c2a26-62f7-4586-825e-b9e2e9f56b0c","resolution":{"observed_at":"2026-08-07T13:06:24.897294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16406","last_updated":"2025-02-20T06:07:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-26T02:15:49Z","title":"SpinQuant: LLM quantization with learned rotations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16406","snapshot_observed_at":"2026-08-07T13:06:24.964334Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:24.964334Z"},"links":{"cited_paper":"/paper/2405.16406","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:083fb2c384cde6d6721cdeca3c6c906769196591624f0cf5f90df1b71cba22ac","observation_id":"440355ea-aa31-4e70-98d9-3348b8e45e42","resolution":{"observed_at":"2026-08-07T13:06:24.964334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:06:25.058145Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:25.058145Z"},"links":{"citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:74382488f806280ba06d1c84304446b0818b1397e32f898470755f25747e03ca","observation_id":"3449141a-4191-4add-9edf-29d8616807d2","resolution":{"observed_at":"2026-08-07T13:06:25.058145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:06:32.388285Z","title":null,"venue":null,"work_id":"c66918ba-b840-45d3-93ba-abb6520eca2b","year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:25.163447Z"},"links":{"citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:f3e129b48898b3b5b6af090229f0b87821169a70bbaf85453e8e8fa2bf976ad2","observation_id":"5aa442f6-85ac-4b92-ae07-e8dabcfec21a","resolution":{"observed_at":"2026-08-07T13:06:32.525123Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02827","last_updated":"2024-11-15T04:17:35Z","snapshot_observed_at":"2026-07-06T17:55:12.784422Z","submitted_at":"2024-04-03T15:59:42Z","title":"BAdam: A Memory Efficient Full Parameter Optimization Method for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02827","snapshot_observed_at":"2026-08-07T13:06:25.237806Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:25.237806Z"},"links":{"cited_paper":"/paper/2404.02827","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:49b8f295f5af9a7704317276e791314c2dfafc9b0aab5d3a316adbfbc8f42640","observation_id":"35b87564-aba7-4dbe-baf7-4f8fbe4e18d3","resolution":{"observed_at":"2026-08-07T13:06:25.237806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:06:32.209868Z","title":null,"venue":null,"work_id":"9de00b18-c8a3-4130-a81a-b7203a75ebba","year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:25.332149Z"},"links":{"citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:dc1533f527576ab6a5b92724fbeb4069d6fe48dc386aae77392c0548725a31c0","observation_id":"daca3ca5-0813-4c78-9d80-0b20b5561311","resolution":{"observed_at":"2026-08-07T13:06:32.287090Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:06:32.037891Z","title":null,"venue":null,"work_id":"0371ed6e-08ff-4c4a-83a3-e65bc08573da","year":2023},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:25.426540Z"},"links":{"citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:d87bc43295a1c5bbe81ace5f2af05e768d886982894123c203ec89baca1eb523","observation_id":"000d234d-5caa-4a33-a1ed-d1c8ccc2e92f","resolution":{"observed_at":"2026-08-07T13:06:32.107044Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:06:31.855229Z","title":null,"venue":null,"work_id":"f918fd7c-f9f2-42a3-9a13-aa1354533fc0","year":2004},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:25.518997Z"},"links":{"citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:abcc11a8aad7d493f6276d28b42a136d6fe410a3771d5091d91c28e26c6ad041","observation_id":"d510f749-8f51-42f7-85bb-4abc3d6e778b","resolution":{"observed_at":"2026-08-07T13:06:31.966704Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:06:31.676328Z","title":"Miles, P","venue":null,"work_id":"50717ea0-1634-4d4c-a6cc-cd3c19e0e054","year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:25.601715Z"},"links":{"citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:cff745221a2df49a58ed5f2ad70c6614fa2567984641f6c012bcef4a51046f26","observation_id":"7495c99e-4fdc-4a55-88b7-2bc82e3119a6","resolution":{"observed_at":"2026-08-07T13:06:31.785207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:06:31.416615Z","title":"Mo, L.-K","venue":null,"work_id":"80158d8f-15b3-41fb-adee-786c8e102464","year":2025},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:25.689215Z"},"links":{"citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:8df64e91f35385910fc03b39faac88edfb0e98a3074450b486c1bfbc1d4acdd6","observation_id":"ebf63981-8683-47df-bf33-6fb65c1941d3","resolution":{"observed_at":"2026-08-07T13:06:31.501970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:06:31.200440Z","title":"Muhamed, O","venue":null,"work_id":"51a53d21-385f-4606-9fcc-97d397bcc842","year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:25.788509Z"},"links":{"citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:30661422d5d697aec487b4c6a19667770e3591254e23623d62cc48fb3fbbdb07","observation_id":"7e275cc8-e50f-4344-a9f4-847688cb3bbc","resolution":{"observed_at":"2026-08-07T13:06:31.306744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19580","last_updated":"2025-05-28T01:08:37Z","snapshot_observed_at":"2026-08-07T10:56:24.959429Z","submitted_at":"2024-07-28T20:39:16Z","title":"Mini-batch Coresets for Memory-efficient Language Model Training on Data Mixtures","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19580","snapshot_observed_at":"2026-08-07T13:06:25.885072Z","title":"Nguyen, W","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:25.885072Z"},"links":{"cited_paper":"/paper/2407.19580","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:4495b2fd7f974b3bcb970c2eb34a93ef007f0ae2aeef236fd9fcd3cba0483b2e","observation_id":"100e7885-cf8d-4f55-9842-a10b1a9e538a","resolution":{"observed_at":"2026-08-07T13:06:25.885072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09958","last_updated":"2024-10-17T06:33:05Z","snapshot_observed_at":"2026-07-06T18:30:59.857334Z","submitted_at":"2024-06-14T12:05:17Z","title":"Memory-Efficient Optimization with Factorized Hamiltonian Descent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09958","snapshot_observed_at":"2026-08-07T13:06:25.959409Z","title":"Nguyen, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:25.959409Z"},"links":{"cited_paper":"/paper/2406.09958","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:7293494c1169236125d5ad49f9ad1e71080f4a6554b805939cbf36bf67529905","observation_id":"426ae338-2280-4904-b1f8-01a9dcadba53","resolution":{"observed_at":"2026-08-07T13:06:25.959409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17919","last_updated":"2024-12-25T19:03:23Z","snapshot_observed_at":"2026-07-06T17:51:28.420385Z","submitted_at":"2024-03-26T17:55:02Z","title":"LISA: Layerwise Importance Sampling for Memory-Efficient Large Language Model Fine-Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17919","snapshot_observed_at":"2026-08-07T13:06:26.091459Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:26.091459Z"},"links":{"cited_paper":"/paper/2403.17919","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:f21fefef4b1ad2920c95c7dbca3ef331e0892e0b63c0b2eaa80f72c2d543ec5c","observation_id":"87199d54-65de-4ae1-8da2-b4606b9373c0","resolution":{"observed_at":"2026-08-07T13:06:26.091459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:06:30.961550Z","title":null,"venue":null,"work_id":"3feafad1-620c-49a1-ac65-13c7ac22d25e","year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:26.161985Z"},"links":{"citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:fe13f2e488fcd13be8c81ede204473af322228a3fc9f7366a00a3a810688da6b","observation_id":"72f40ea3-72fe-4bf9-ab87-6d6aa533b812","resolution":{"observed_at":"2026-08-07T13:06:31.087596Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:06:30.692442Z","title":"Raffel, N","venue":null,"work_id":"d2763a72-d686-4d05-9512-802a029f3c2b","year":2020},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:26.229412Z"},"links":{"citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:bfb2c52e04ef215a8028f27702ec395dc284c9f8fc91ed3087f003bf7b797327","observation_id":"28517ce2-1590-4e4d-a9ba-74703af1f799","resolution":{"observed_at":"2026-08-07T13:06:30.843674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:06:26.296395Z","title":"Rajabi, N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:26.296395Z"},"links":{"citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:77d05b1834c43a5389a2ab5342b903d4a42a5f377a56da340e0d17fe24fc805d","observation_id":"6cb3be2c-a766-4b07-97f9-ee0c73d1a3a1","resolution":{"observed_at":"2026-08-07T13:06:26.296395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17296","last_updated":"2024-12-15T07:51:18Z","snapshot_observed_at":"2026-08-05T07:44:17.245724Z","submitted_at":"2024-06-25T05:45:12Z","title":"BlockLLM: Memory-Efficient Adaptation of LLMs by Selecting and Optimizing the Right Coordinate Blocks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17296","snapshot_observed_at":"2026-08-07T13:06:26.353726Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:26.353726Z"},"links":{"cited_paper":"/paper/2406.17296","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:2ce1f6caf9cfc1d4f58f1f1c34f5b3c29ea74b8377c1ef1b74369506f49d96bd","observation_id":"f7eff28a-d138-4fbd-b84e-e26e6b646c36","resolution":{"observed_at":"2026-08-07T13:06:26.353726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16103","last_updated":"2025-03-02T18:38:37Z","snapshot_observed_at":"2026-07-06T19:37:11.636987Z","submitted_at":"2024-10-21T15:31:06Z","title":"LDAdam: Adaptive Optimization from Low-Dimensional Gradient Statistics","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16103","snapshot_observed_at":"2026-08-07T13:06:26.421862Z","title":"Robert, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:26.421862Z"},"links":{"cited_paper":"/paper/2410.16103","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:773bc65b6bccd6a188bc583a5b88454467b18cd5f8ed6dc641f0e6b395b2862e","observation_id":"8313d2d6-6976-4eed-9e3c-bf3ef019c04e","resolution":{"observed_at":"2026-08-07T13:06:26.421862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15352","last_updated":"2025-02-08T21:27:02Z","snapshot_observed_at":"2026-07-06T19:36:36.994783Z","submitted_at":"2024-10-20T10:24:38Z","title":"CompAct: Compressed Activations for Memory-Efficient LLM Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15352","snapshot_observed_at":"2026-08-07T13:06:26.479883Z","title":"Shamshoum, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:26.479883Z"},"links":{"cited_paper":"/paper/2410.15352","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:94b7e5c8edac5e39b51ef23313c28b50b32865bf252ab4a11590f2074b07aca2","observation_id":"8fa149e1-f93f-490a-bd46-0c7d732ec314","resolution":{"observed_at":"2026-08-07T13:06:26.479883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-07T13:06:26.525291Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:26.525291Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:a808a3ae96679db9ff87eeb4498e4a289d525e340b6b451579f1d45f2f2a93f0","observation_id":"bee9e8b0-40ee-4eec-93ed-fa023d855196","resolution":{"observed_at":"2026-08-07T13:06:26.525291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20437","last_updated":"2025-04-29T05:27:02Z","snapshot_observed_at":"2026-08-07T15:58:22.109682Z","submitted_at":"2025-04-29T05:27:02Z","title":"GaLore 2: Large-Scale LLM Pre-Training by Gradient Low-Rank Projection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20437","snapshot_observed_at":"2026-08-07T13:06:26.598216Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:26.598216Z"},"links":{"cited_paper":"/paper/2504.20437","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:1014dd1563d2a016a1d0c57818befbd2051c2c97b616535c59870d456c39897b","observation_id":"e1196af2-e476-43c0-b6e7-eea51c406164","resolution":{"observed_at":"2026-08-07T13:06:26.598216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-07-06T15:44:42.776459Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-07T13:06:26.659585Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:26.659585Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:22ed99e874b941d29577a13cbb2c1ead0e8a5c7ded9851caf88cf5395c61c97c","observation_id":"1a5dace1-6f64-4bbe-997d-91dc357de8a5","resolution":{"observed_at":"2026-08-07T13:06:26.659585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18144","last_updated":"2025-01-10T07:22:12Z","snapshot_observed_at":"2026-07-06T18:21:18.150567Z","submitted_at":"2024-05-28T13:02:56Z","title":"4-bit Shampoo for Memory-Efficient Network Training","version":3},"cited_work":{"arxiv_id":"2405.18144","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.18144","snapshot_observed_at":"2026-08-07T13:06:28.456640Z","title":"4-bit Shampoo for Memory-Efficient Network Training","venue":"cs.LG","work_id":"d1bfa3c8-0316-4147-95b7-60c947f7fc82","year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:26.721083Z"},"links":{"cited_paper":"/paper/2405.18144","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:13985ac02d84b1ef57ea0eb7c362ca06353f4bed480ca9341bcdbe1a833828c6","observation_id":"2f31ea51-ae60-47d1-8da9-b6e211c812de","resolution":{"observed_at":"2026-08-07T13:06:28.552320Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18242","last_updated":"2025-03-22T09:29:15Z","snapshot_observed_at":"2026-07-06T18:52:03.385131Z","submitted_at":"2024-07-25T17:57:12Z","title":"LoRA-Pro: Are Low-Rank Adapters Properly Optimized?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18242","snapshot_observed_at":"2026-08-07T13:06:26.785017Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:26.785017Z"},"links":{"cited_paper":"/paper/2407.18242","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:cf78685be2e5784bd9fbf5a874ae7d7f161cf803c59d42e62c9553702771a197","observation_id":"0b3c9b55-fafd-47f1-be7c-bc175f2d3d52","resolution":{"observed_at":"2026-08-07T13:06:26.785017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09003","last_updated":"2025-06-06T02:29:18Z","snapshot_observed_at":"2026-08-04T08:42:46.119089Z","submitted_at":"2025-02-13T06:44:33Z","title":"RoSTE: An Efficient Quantization-Aware Supervised Fine-Tuning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":"2502.09003","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.09003","snapshot_observed_at":"2026-08-07T13:06:28.124222Z","title":"RoSTE: An Efficient Quantization-Aware Supervised Fine-Tuning Approach for Large Language Models","venue":"cs.LG","work_id":"43970240-85a5-4d17-af87-9da309ffc2cb","year":2025},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:26.860384Z"},"links":{"cited_paper":"/paper/2502.09003","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:1c73a9c80f6fe15886e96bfccb409e263a83600c2c629d25946ec72a32c5bd09","observation_id":"0d447c84-afb6-4f22-b0d9-8eb50b8259cb","resolution":{"observed_at":"2026-08-07T13:06:28.231100Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:06:30.470237Z","title":null,"venue":null,"work_id":"e2e8709e-ce21-4c40-b0c5-9b22b0e645ea","year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:26.911530Z"},"links":{"citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:1db18b079a5173af2c190e9cf75c4c1224ce99486ed9b3d7728e274a1757a992","observation_id":"bf4f76ee-be28-4643-a5ea-f98afd5b86d1","resolution":{"observed_at":"2026-08-07T13:06:30.597756Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:06:30.312854Z","title":null,"venue":null,"work_id":"49272943-2286-4f5f-88f4-d50dee783612","year":2023},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:26.981446Z"},"links":{"citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:3f0bbec1462082683e0ad0c3822da3716905ff2cc108869be76d2e2da8e9d8f1","observation_id":"4d70f518-fc4d-4d34-be91-7fbc44eebd62","resolution":{"observed_at":"2026-08-07T13:06:30.385369Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00071","last_updated":"2025-03-12T00:36:08Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T03:50:52Z","title":"COAP: Memory-Efficient Training with Correlation-Aware Gradient Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00071","snapshot_observed_at":"2026-08-07T13:06:27.067357Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:27.067357Z"},"links":{"cited_paper":"/paper/2412.00071","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:a62e618c73e9ee56cb66579d8b5dafdd851b0ea7eb532979a331c3f2c13b046e","observation_id":"edb279ff-46fa-4687-aafa-2154758c86db","resolution":{"observed_at":"2026-08-07T13:06:27.067357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:06:30.145879Z","title":null,"venue":null,"work_id":"759f35a0-f3a0-4546-b948-5ee19660d690","year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:27.120930Z"},"links":{"citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:1552c6bd5ea14fe6b7379502f4a8be513e1f650199abd5ceeb0828a9b5e6bd30","observation_id":"f8bfa8cc-587e-4055-b82c-1afbb4a24ca4","resolution":{"observed_at":"2026-08-07T13:06:30.231423Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.10420","last_updated":"2023-12-23T12:53:02Z","snapshot_observed_at":"2026-07-06T15:05:12.470716Z","submitted_at":"2023-03-18T14:02:04Z","title":"A Comprehensive Capability Analysis of GPT-3 and GPT-3.5 Series Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.10420","snapshot_observed_at":"2026-08-07T13:06:27.185719Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:27.185719Z"},"links":{"cited_paper":"/paper/2303.10420","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:bb650e3f7d12c8276dab2163a7a9370726f18cfb4cdc941b6736d5a85330b5eb","observation_id":"caca98fc-ac6d-45ca-a9e9-ec8456b699b7","resolution":{"observed_at":"2026-08-07T13:06:27.185719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:06:29.889734Z","title":"Zhang and R","venue":null,"work_id":"5e0dd245-6530-4ebf-8438-8a0c91a50546","year":2019},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:27.253444Z"},"links":{"citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:023e298eeceb3c28fd2aabb63e5cc57ca907026657308772a252be7734f8269e","observation_id":"3c6fbaa0-5904-4518-9d4e-dc5a61e6d7c4","resolution":{"observed_at":"2026-08-07T13:06:30.025818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:06:27.334136Z","title":"Zhang, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:27.334136Z"},"links":{"citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:72197e6a2ea1e2c2bf8d6a8e837020208c78addf443a335b01566ac6345071be","observation_id":"0f25ab66-36a3-4321-a2db-0d0eca330da5","resolution":{"observed_at":"2026-08-07T13:06:27.334136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.10512","last_updated":"2023-12-20T20:56:14Z","snapshot_observed_at":"2026-07-06T15:05:16.471478Z","submitted_at":"2023-03-18T22:36:25Z","title":"AdaLoRA: Adaptive Budget Allocation for Parameter-Efficient Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.10512","snapshot_observed_at":"2026-08-07T13:06:27.387430Z","title":"Zhang, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:27.387430Z"},"links":{"cited_paper":"/paper/2303.10512","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:9447fc478baabee1fdf8773f2b83627881ad5204be02b6305b4f1d81cf02eb2d","observation_id":"0dda1f9b-8674-4132-a24f-c51943e9deb4","resolution":{"observed_at":"2026-08-07T13:06:27.387430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16793","last_updated":"2025-02-24T11:29:08Z","snapshot_observed_at":"2026-08-03T23:43:24.359346Z","submitted_at":"2024-06-24T16:56:41Z","title":"Adam-mini: Use Fewer Learning Rates To Gain More","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16793","snapshot_observed_at":"2026-08-07T13:06:27.471235Z","title":"Zhang, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:27.471235Z"},"links":{"cited_paper":"/paper/2406.16793","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:f599eed64f126354f9fad7fa7047cba86f3d12360c0f3ad91b2b44596b22158d","observation_id":"7692efa6-a71d-4a78-ac01-e85b85a3148e","resolution":{"observed_at":"2026-08-07T13:06:27.471235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08296","last_updated":"2024-07-11T08:42:58Z","snapshot_observed_at":"2026-07-06T18:44:41.370135Z","submitted_at":"2024-07-11T08:42:58Z","title":"Q-GaLore: Quantized GaLore with INT4 Projection and Layer-Adaptive Low-Rank Gradients","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08296","snapshot_observed_at":"2026-08-07T13:06:27.544171Z","title":"Zhang, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:27.544171Z"},"links":{"cited_paper":"/paper/2407.08296","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:6d9fc90b2090fc3dcc6f46e08ba6a9ab88ebd7f356efe215c23250c95001ccf8","observation_id":"19a2f9ca-3163-452b-a5c9-862ee48d2fae","resolution":{"observed_at":"2026-08-07T13:06:27.544171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:06:29.752815Z","title":null,"venue":null,"work_id":"7362ab7f-d261-4e67-adf5-d8fae180cc3f","year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:27.618711Z"},"links":{"citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:b58bf8e17495abfec8e45f9c0ccc08873ae799511450431d282387e5c951141f","observation_id":"8a038ccd-334b-4493-a2a8-14c67d599f16","resolution":{"observed_at":"2026-08-07T13:06:29.810859Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06564","last_updated":"2025-01-02T17:02:35Z","snapshot_observed_at":"2026-07-06T18:28:20.634381Z","submitted_at":"2024-06-03T05:40:34Z","title":"SwitchLoRA: Switched Low-Rank Adaptation Can Learn Full-Rank Information","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06564","snapshot_observed_at":"2026-08-07T13:06:27.696807Z","title":"Zhou and S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:27.696807Z"},"links":{"cited_paper":"/paper/2406.06564","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:056edf42276c746b24566a5c53871a920cc5c3e8559eb60203d8e32169551728","observation_id":"9d7fd649-6480-4858-8264-fdf4afabbdde","resolution":{"observed_at":"2026-08-07T13:06:27.696807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05270","last_updated":"2025-02-17T08:27:58Z","snapshot_observed_at":"2026-08-06T09:09:00.082930Z","submitted_at":"2024-12-06T18:55:34Z","title":"APOLLO: SGD-like Memory, AdamW-level Performance","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05270","snapshot_observed_at":"2026-08-07T13:06:27.700501Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:27.700501Z"},"links":{"cited_paper":"/paper/2412.05270","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:7b925ae76b5be4b28d6d88ade39869bea2e5fc8b113f9dcfb8bce98fcb837f10","observation_id":"655bdb2d-85e9-4505-b312-13a44980bbd8","resolution":{"observed_at":"2026-08-07T13:06:27.700501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:06:29.570788Z","title":null,"venue":null,"work_id":"150102c8-b5a2-4bc3-933b-f93b87ad153f","year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:27.721551Z"},"links":{"citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:24a8bf082a5ef07ce87613bac93228a2385e189cd966c57c027027d53d4dafbc","observation_id":"dbbfdfe2-29ba-4e61-badd-6678ad5f0c92","resolution":{"observed_at":"2026-08-07T13:06:29.619716Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07837","last_updated":"2025-08-14T17:59:26Z","snapshot_observed_at":"2026-08-06T20:34:54.480381Z","submitted_at":"2024-11-12T14:41:07Z","title":"FRUGAL: Memory-Efficient Optimization by Reducing State Overhead for Scalable Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07837","snapshot_observed_at":"2026-08-07T13:06:27.858773Z","title":"Zmushko, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T13:06:27.858773Z"},"links":{"cited_paper":"/paper/2411.07837","citing_paper":"/paper/2505.22922"},"observation_digest":"sha256:2319b77f65c8418a1dd4feb1c7a7797b6126713b342e19d6b6a792698f375a02","observation_id":"8a194aa6-c11a-487f-8ca0-f6a14f05937d","resolution":{"observed_at":"2026-08-07T13:06:27.858773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":5,"verified_fuzzy":7},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 2 inbound Pith citation observations for arXiv:2505.22922."}