Pith. sign in

Paper Citation Record · LEDGER

A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models

As of 20 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 6 inbound Pith citation observations for arXiv:2502.07222.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.07222 v1

Coverage vector

measured 26 of 26 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-08T13:31:42.126884Z

measured 32 of 32 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-20T06:33:59.587034+00:00

measured 6 of 6 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T05:06:15.845262Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-18T14:52:41.305916Z

Reference resolution

26 of 26 outbound references displayed

  • verified exact2
  • verified fuzzy3
  • unresolved21
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation c43fe9cd-617f-4505-ac56-f4d5740570ed · outbound

This paper cites Language Models are Few-Shot Learners.

A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models Language Models are Few-Shot Learners

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-08T13:31:42.007786Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:31:42.007786Z digest=sha256:54476205627b7f961bcc36b4104101906cecc8899cb81a43d47dfdd2b2b596db

Observation e0be1fcc-0bdd-44f7-b901-b882f8008b00 · outbound

This paper cites LoRA: Low-Rank Adaptation of Large Language Models.

A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models LoRA: Low-Rank Adaptation of Large Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-08T13:31:42.038311Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:31:42.038311Z digest=sha256:00c7feccdd75706b1d4f625321331d9082f895058682fd0e9bc5a71782a73ea2

Observation 1e1eff25-4cd1-4051-8c2d-52f462d793c4 · outbound

This paper cites Chain of LoRA: Efficient Fine-tuning of Language Models via Residual Learning.

A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models Chain of LoRA: Efficient Fine-tuning of Language Models via Residual Learning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-08T13:31:42.043331Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:31:42.043331Z digest=sha256:ea7ab98f262b4c05b7fa87ade085aa5a76d7620c138186b1c1d063d21d445bca

Observation 723f37ca-d918-4659-b148-8b7389db98c5 · outbound

This paper cites Subspace Optimization for Large Language Models with Convergence Guarantees.

A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models Subspace Optimization for Large Language Models with Convergence Guarantees

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-08T13:31:42.048006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:31:42.048006Z digest=sha256:ea9083a6ba201e3ab678be10b090443830fee49e25daac2ee4d149809a4c06b3

Observation c1dd313c-bc00-4608-967b-bcdeee29589f · outbound

This paper cites Flora: Low-Rank Adapters Are Secretly Gradient Compressors.

A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models Flora: Low-Rank Adapters Are Secretly Gradient Compressors

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-08T13:31:42.052527Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:31:42.052527Z digest=sha256:6e61341ed1cf13a6f9c882427484f015749f4f1db349d734923a2c76b813bc3d

Observation 3416b57f-a747-44e1-aa4f-53cd5a854338 · outbound

This paper cites Enhancing Zeroth-order Fine-tuning for Language Models with Low-rank Structures.

A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models Enhancing Zeroth-order Fine-tuning for Language Models with Low-rank Structures

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-08T13:31:42.057316Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:31:42.057316Z digest=sha256:aa63d9fc5316b12a001e93b506c15a45deb8fe642b782e849bf76df63d8f1b09

Observation 9ba0fd91-1273-4f46-8c25-048b37646563 · outbound

This paper cites LoRA Learns Less and Forgets Less.

A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models LoRA Learns Less and Forgets Less

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-08T13:31:42.061884Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:31:42.061884Z digest=sha256:af1b9579acb4c70d4b5daf4c497dc96104a4388cf90077ad482012c2a90ab036

Observation 962db0d4-9782-4af4-8935-6fcb5d559388 · outbound

This paper cites Memory-Efficient LLM Training with Online Subspace Descent.

A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models Memory-Efficient LLM Training with Online Subspace Descent

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-08T13:31:42.066484Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:31:42.066484Z digest=sha256:79963c7833e8f8802a64e8ab2791bc50ccaeef30865805d34eea32f1b4c648bf

Observation 7257a49f-7d7f-4d3f-bb85-442a9660787d · outbound

This paper cites Fira: Can we achieve full-rank training of llms under low-rank constraint? arXiv preprint arXiv:2410.01623, 2024b.

A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models Fira: Can we achieve full-rank training of llms under low-rank constraint? arXiv preprint arXiv:2410.01623, 2024b

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-08T13:31:42.070965Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:31:42.070965Z digest=sha256:435cba158c5e72b2fe457853a34a8d1af8fb0050a35117b1b689cc16e3438a0b

Observation a7221865-1152-4da2-a76c-69f946720f23 · outbound

This paper cites GWT: Scalable Optimizer State Compression for Large Language Model Training.

A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models GWT: Scalable Optimizer State Compression for Large Language Model Training

Reference 16

Resolution
verified exact
local_arxiv, observed 2026-08-08T13:31:42.282331Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T13:31:42.080116Z digest=sha256:98a7b1d47a39e63ca2d6a15d479d4afe28523ca97740dc3f6ab1bd287097bb91

Observation 5512ac83-5cbc-40c7-8f4b-cfb6d32aa5ec · outbound

This paper cites Second-Order Fine-Tuning without Pain for LLMs:A Hessian Informed Zeroth-Order Optimizer.

A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models Second-Order Fine-Tuning without Pain for LLMs:A Hessian Informed Zeroth-Order Optimizer

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-08T13:31:42.089462Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:31:42.089462Z digest=sha256:9f59d9c3ed18f9095cd2a1dbc25e474a002c3b3561de7ef6c5335286f09a9c3d

Observation 51eb4ee5-6276-4bf5-93c6-39a0e6e05ef5 · outbound

This paper cites Training Deep Nets with Sublinear Memory Cost.

A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models Training Deep Nets with Sublinear Memory Cost

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-08T13:31:42.094129Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:31:42.094129Z digest=sha256:62f8f4c94f957db2afc38e41f291a68b6c8adee4e7c11ad5a00cda6a591c11af

Observation 8999f02c-d660-4eb4-96f3-afa40bc85f4f · outbound

This paper cites {Zero-offload}: Democratizing {billion-scale} model training.

A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models {Zero-offload}: Democratizing {billion-scale} model training

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:31:42.702554Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T13:31:42.103753Z digest=sha256:cbe66c4acb36a2a458e6609ac24f1f06928a30ff1ff456527d5fc833b6ed74e9

Observation b2700321-27a8-44be-bb10-b64b6f316864 · outbound

This paper cites Unified Convergence Analysis for Adaptive Optimization with Moving Average Estimator.

A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models Unified Convergence Analysis for Adaptive Optimization with Moving Average Estimator

Reference 23

Resolution
verified exact
local_arxiv, observed 2026-08-08T13:31:42.202894Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T13:31:42.112866Z digest=sha256:8dac204c7ebfed14debcb17304de192de45af87e89e29e0b076bad669cc6e5e4

Observation 0e2b3cf8-96b4-49c7-9de4-517f0a01e3aa · outbound

This paper cites RoBERTa: A Robustly Optimized BERT Pretraining Approach.

A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models RoBERTa: A Robustly Optimized BERT Pretraining Approach

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-08T13:31:42.117526Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:31:42.117526Z digest=sha256:8bf4d38acd665ca083bcb12bf3a4329c11f3b28ad86f1d702ae10cbc488b77dd

Observation dc7a6963-77c3-4ea5-9329-d7b9aa275ed5 · outbound

This paper cites We also report the memory overhead and total training time for each method.

A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models We also report the memory overhead and total training time for each method

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:31:42.672786Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T13:31:42.126884Z digest=sha256:0158e2c70fa629f2e38a841660c2be3a41e249fc20d2b93ef1327926ba41457d

Observation 7d117e1a-e632-4350-889c-e33cbc2f503e · outbound

This paper cites Decoupled Weight Decay Regularization.

A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models Decoupled Weight Decay Regularization

Reference 2014

Resolution
unresolved
no resolver link, observed 2026-08-08T13:31:42.028545Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:31:42.028545Z digest=sha256:7446eb46bc34cf779ffce34585f2bdbf9fe2770a6c6809d1d478f2f75ee58e7e

Observation 7dbf2f18-468c-4ae3-9814-34798345d6b9 · outbound

This paper cites QLoRA: Efficient Finetuning of Quantized LLMs.

A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models QLoRA: Efficient Finetuning of Quantized LLMs

Reference 2016

Resolution
unresolved
no resolver link, observed 2026-08-08T13:31:42.098753Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:31:42.098753Z digest=sha256:02b385ebc44908332d7a7a34189042989d27a867be5d73faee0bae3f979eb970

Observation 81b546d6-cd09-41b1-b43e-8fe64df9ee27 · outbound

This paper cites GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection.

A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection

Reference 2017

Resolution
unresolved
no resolver link, observed 2026-08-08T13:31:42.033460Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:31:42.033460Z digest=sha256:5c6b8b51ab191a933541c8893399043346b9d88778ea0254956fc67fdfaa1d38

Observation a964815e-6c11-4934-8371-7c97acad7c5c · outbound

This paper cites Natural GaLore: Accelerating GaLore for memory-efficient LLM Training and Fine-tuning.

A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models Natural GaLore: Accelerating GaLore for memory-efficient LLM Training and Fine-tuning

Reference 2018

Resolution
unresolved
no resolver link, observed 2026-08-08T13:31:42.075566Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:31:42.075566Z digest=sha256:4473fe561b2367d54da178c4f4580bd83c1f9efa2b4431e7e91f0ca64bd0b3ca

Observation 3347d7e8-4a3d-48c4-92ac-90dd0a3a50dd · outbound

This paper cites GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding.

A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-08-08T13:31:42.122265Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:31:42.122265Z digest=sha256:08470b07e723506231188095b78098f9bc798acec930b292bcfdef288537d130

Observation d0cd6cf5-8f8b-4b11-99ce-5024066cf95e · outbound

This paper cites GPT-4 Technical Report.

A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models GPT-4 Technical Report

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-08T13:31:42.013680Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:31:42.013680Z digest=sha256:97710a65bb8aa49757caac852bb60a2115fd5d984130f64c96d7def714a3144c

Observation cfea90d6-d746-4ff9-877f-9862585cee59 · outbound

This paper cites G10: Enabling an efficient unified gpu memory and storage architecture with smart tensor migrations.

A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models G10: Enabling an efficient unified gpu memory and storage architecture with smart tensor migrations

Reference 2021

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T13:31:42.688081Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-08T13:31:42.108417Z digest=sha256:bd20d1a5657aff9c5fc40eb7e14c200656addeb9074fc84507dd86c324292787

Observation fe92f3d9-0eb2-4e29-bbda-735c56a10869 · outbound

This paper cites The Llama 3 Herd of Models.

A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models The Llama 3 Herd of Models

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-08T13:31:42.018811Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:31:42.018811Z digest=sha256:c3bc0dd70cbde03c0ef06258628727b08567afd880f2c037e0b434fe95abbecd

Observation c68f13ae-ebba-426c-98f6-6fdfa3823743 · outbound

This paper cites Adam: A Method for Stochastic Optimization.

A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models Adam: A Method for Stochastic Optimization

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-08T13:31:42.023758Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:31:42.023758Z digest=sha256:50689d176aa4508c819054a4415615c4fc0fe7c975ecc111fe75bb24197f4657

Observation 762db2e0-86aa-46b6-9993-bec36b85da3a · outbound

This paper cites Variance-reduced Zeroth-Order Methods for Fine-Tuning Language Models.

A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models Variance-reduced Zeroth-Order Methods for Fine-Tuning Language Models

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-08T13:31:42.084774Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T13:31:42.084774Z digest=sha256:a0b1843d56dc0922003ae9e761a8913fbde816ffe855c00a2e83568fbc6b7c41

Pith citing papers

Observation 975a7038-cd34-481d-aa55-a59dd83bf1a5 · inbound

FZOO: Fast Zeroth-Order Optimizer for Fine-Tuning Large Language Models towards Adam-Scale Speed cites this paper.

FZOO: Fast Zeroth-Order Optimizer for Fine-Tuning Large Language Models towards Adam-Scale Speed A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T05:06:15.845262Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:06:15.845262Z digest=sha256:14596763491efad0eeb594813fa15e137a637fc4af457adc331fb2b0d085f829

Observation d48eac71-acc1-4a57-a145-b1334f1674a9 · inbound

CR-Net: Scaling Parameter-Efficient Training with Cross-Layer Low-Rank Structure cites this paper.

CR-Net: Scaling Parameter-Efficient Training with Cross-Layer Low-Rank Structure A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-05-18T14:52:41.310077Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-05-18T14:51:30.312509Z digest=sha256:e6adb6a5fbe2ed64c108e3991b77e43dde606f76e4a11462356a2d1433112fa2

Observation b9b5e486-9ed5-43bd-9601-4a81e8f559c6 · inbound

BOOST: BOttleneck-Optimized Scalable Training Framework for Low-Rank Large Language Models cites this paper.

BOOST: BOttleneck-Optimized Scalable Training Framework for Low-Rank Large Language Models A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models

Reference 4

Resolution
verified exact
arxiv_id, observed 2026-05-16T23:21:21.624728Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-05-16T23:19:02.358348Z digest=sha256:787afc9a7a4b3d3d9320eca34462c92ad0eaf99d03ba9350efc7771fe26d2304

Observation fe18d896-397a-46a8-b4d8-f4cd285c224a · inbound

AdaMeZO: Adam-style Zeroth-Order Optimizer for LLM Fine-tuning Without Maintaining the Moments cites this paper.

AdaMeZO: Adam-style Zeroth-Order Optimizer for LLM Fine-tuning Without Maintaining the Moments A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models

Reference 58

Resolution
verified exact
arxiv_id, observed 2026-05-11T15:31:07.546357Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-05-09T19:50:50.653184Z digest=sha256:8b34ed91d362d31c773a81f3f235f5c716366e5f97ff07cdf786ce72db45d6e3

Observation ec5d3761-5ce8-44bf-84cd-c91704fedc2a · inbound

BROS: Bias-Corrected Randomized Subspaces for Memory-Efficient Single-Loop Bilevel Optimization cites this paper.

BROS: Bias-Corrected Randomized Subspaces for Memory-Efficient Single-Loop Bilevel Optimization A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models

Reference 8

Resolution
verified exact
arxiv_id, observed 2026-05-12T05:56:26.672855Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-05-12T04:47:04.868735Z digest=sha256:0b8e60b80195133c1c16a7460c77efa97ea23db3a88e8d438b17c6dc54df13f7

Observation 15be2455-b720-4779-9d82-bceece556a22 · inbound

BROS: Bias-Corrected Randomized Subspaces for Memory-Efficient Single-Loop Bilevel Optimization cites this paper.

BROS: Bias-Corrected Randomized Subspaces for Memory-Efficient Single-Loop Bilevel Optimization A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models

Reference 8

Resolution
verified exact
arxiv_id, observed 2026-05-13T06:22:23.334369Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-05-13T06:20:42.781613Z digest=sha256:d1c070a0f4a7b4ac1ceb387211620d9367814efaaafc079ea6a3822531fd850d