{"as_of":"2026-08-07T22:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c75d0b60001800aab4839d2e99d0bc786bedc48f236b685da52c0d34f9e5dc8c","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T13:23:55.233840Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T18:42:01.854481Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-06-30T18:45:00.461346Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.16659","last_updated":"2026-05-20T23:37:18Z","snapshot_observed_at":"2026-07-06T21:45:02.192166Z","submitted_at":"2025-06-20T00:10:35Z","title":"Memory-Efficient LLM Pretraining via Minimalist Optimizer Design","version":3},"cited_work":{"arxiv_id":"2506.16659","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.16659","snapshot_observed_at":"2026-06-30T18:45:00.461346Z","title":"Glentis, J","venue":"cs.LG","work_id":"5bba5d3c-48d9-4024-b45e-e085759c9b84","year":2025},"citing_paper":{"arxiv_id":"2509.11983","last_updated":"2026-04-19T16:56:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-15T14:28:53Z","title":"Low-rank Orthogonalization for Large-scale Matrix Optimization with Applications to Foundation Model Training","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T15:48:43.422716Z"},"links":{"cited_paper":"/paper/2506.16659","citing_paper":"/paper/2509.11983"},"observation_digest":"sha256:7c02f512917610c429c6437e48ef96b8f2fe0d91b50e79a151976c2b9a0c5170","observation_id":"607922fb-7c6c-4628-9847-25677acbfa58","resolution":{"observed_at":"2026-05-22T02:03:26.475417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16659","last_updated":"2026-05-20T23:37:18Z","snapshot_observed_at":"2026-07-06T21:45:02.192166Z","submitted_at":"2025-06-20T00:10:35Z","title":"Memory-Efficient LLM Pretraining via Minimalist Optimizer Design","version":3},"cited_work":{"arxiv_id":"2506.16659","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.16659","snapshot_observed_at":"2026-06-30T18:45:00.461346Z","title":"Glentis, J","venue":"cs.LG","work_id":"5bba5d3c-48d9-4024-b45e-e085759c9b84","year":2025},"citing_paper":{"arxiv_id":"2603.28254","last_updated":"2026-05-10T06:51:11Z","snapshot_observed_at":"2026-07-06T22:51:05.074191Z","submitted_at":"2026-03-30T10:28:18Z","title":"MuonEq: Balancing Before Orthogonalization with Lightweight Equilibration","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-14T21:12:32.579136Z"},"links":{"cited_paper":"/paper/2506.16659","citing_paper":"/paper/2603.28254"},"observation_digest":"sha256:ad5dab7b9f96d1118fecdf2db45e17df6b22179408e4baa9d3a88c1380265227","observation_id":"d6315e0f-af1f-4b82-a7d6-dbe4598f41f3","resolution":{"observed_at":"2026-05-22T02:03:26.475417Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16659","last_updated":"2026-05-20T23:37:18Z","snapshot_observed_at":"2026-07-06T21:45:02.192166Z","submitted_at":"2025-06-20T00:10:35Z","title":"Memory-Efficient LLM Pretraining via Minimalist Optimizer Design","version":3},"cited_work":{"arxiv_id":"2506.16659","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.16659","snapshot_observed_at":"2026-06-30T18:45:00.461346Z","title":"Glentis, J","venue":"cs.LG","work_id":"5bba5d3c-48d9-4024-b45e-e085759c9b84","year":2025},"citing_paper":{"arxiv_id":"2605.04418","last_updated":"2026-05-06T02:22:06Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:22:06Z","title":"Demystifying Manifold Constraints in LLM Pre-training","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T17:44:44.438637Z"},"links":{"cited_paper":"/paper/2506.16659","citing_paper":"/paper/2605.04418"},"observation_digest":"sha256:cd2e0140a997b8c86e88117361c777c75e735d44316ebc551cceba40dff90a97","observation_id":"eeca4c05-e80d-49d1-9015-de8493d9bb24","resolution":{"observed_at":"2026-05-22T02:03:26.475417Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16659","last_updated":"2026-05-20T23:37:18Z","snapshot_observed_at":"2026-07-06T21:45:02.192166Z","submitted_at":"2025-06-20T00:10:35Z","title":"Memory-Efficient LLM Pretraining via Minimalist Optimizer Design","version":3},"cited_work":{"arxiv_id":"2506.16659","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.16659","snapshot_observed_at":"2026-06-30T18:45:00.461346Z","title":"Glentis, J","venue":"cs.LG","work_id":"5bba5d3c-48d9-4024-b45e-e085759c9b84","year":2025},"citing_paper":{"arxiv_id":"2605.04711","last_updated":"2026-05-06T10:02:31Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T10:02:31Z","title":"Budget-aware Auto Optimizer Configurator","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-08T17:46:09.673049Z"},"links":{"cited_paper":"/paper/2506.16659","citing_paper":"/paper/2605.04711"},"observation_digest":"sha256:f235886d04e1b5304f4c9e4c63b18b8d82d13d42bd8b0b24ad3a140708d42df6","observation_id":"9d5d3a02-59a2-4547-ba84-af9e45b65520","resolution":{"observed_at":"2026-05-22T02:03:26.475417Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16659","last_updated":"2026-05-20T23:37:18Z","snapshot_observed_at":"2026-07-06T21:45:02.192166Z","submitted_at":"2025-06-20T00:10:35Z","title":"Memory-Efficient LLM Pretraining via Minimalist Optimizer Design","version":3},"cited_work":{"arxiv_id":"2506.16659","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.16659","snapshot_observed_at":"2026-06-30T18:45:00.461346Z","title":"Glentis, J","venue":"cs.LG","work_id":"5bba5d3c-48d9-4024-b45e-e085759c9b84","year":2025},"citing_paper":{"arxiv_id":"2605.18106","last_updated":"2026-06-22T06:06:33Z","snapshot_observed_at":"2026-07-06T23:28:59.503300Z","submitted_at":"2026-05-18T09:17:26Z","title":"Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-20T09:34:45.186929Z"},"links":{"cited_paper":"/paper/2506.16659","citing_paper":"/paper/2605.18106"},"observation_digest":"sha256:2e9670b44e29953f642f1095ea63f5316100c9735eaf9956c6d44928bac3868e","observation_id":"2d0252ca-2c12-4380-a92d-b6a9c13c8373","resolution":{"observed_at":"2026-05-22T02:03:26.475417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16659","last_updated":"2026-05-20T23:37:18Z","snapshot_observed_at":"2026-07-06T21:45:02.192166Z","submitted_at":"2025-06-20T00:10:35Z","title":"Memory-Efficient LLM Pretraining via Minimalist Optimizer Design","version":3},"cited_work":{"arxiv_id":"2506.16659","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.16659","snapshot_observed_at":"2026-06-30T18:45:00.461346Z","title":"Glentis, J","venue":"cs.LG","work_id":"5bba5d3c-48d9-4024-b45e-e085759c9b84","year":2025},"citing_paper":{"arxiv_id":"2605.18106","last_updated":"2026-06-22T06:06:33Z","snapshot_observed_at":"2026-07-06T23:28:59.503300Z","submitted_at":"2026-05-18T09:17:26Z","title":"Symmetry-Compatible Principle for Optimizer Design: Embeddings, LM Heads, SwiGLU MLPs, and MoE Routers","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-30T18:42:01.854481Z"},"links":{"cited_paper":"/paper/2506.16659","citing_paper":"/paper/2605.18106"},"observation_digest":"sha256:447b55f20f48a18732d2a3a0a8e581258d9a767db2c8e1b99b6c57a4996d75b0","observation_id":"698ffaf2-a6c9-4a4f-a3ef-35ff3efd7ed4","resolution":{"observed_at":"2026-06-30T18:45:00.462706Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.16659/citation-record","integrity":"/paper/2506.16659/integrity","json":"/paper/2506.16659/citation-record.json","paper":"/paper/2506.16659"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.20325","last_updated":"2024-12-06T14:09:22Z","snapshot_observed_at":"2026-08-03T03:18:47.425243Z","submitted_at":"2024-09-30T14:26:12Z","title":"Old Optimizer, New Norm: An Anthology","version":2},"cited_work":{"arxiv_id":"2409.20325","doi":"10.48550/arxiv.2409.20325","metadata_source":"pith","pith_arxiv_id":"2409.20325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Old Optimizer, New Norm: An Anthology","venue":"cs.LG","work_id":"c0089db6-7349-44fd-b103-0d7b36142bab","year":2024},"citing_paper":{"arxiv_id":"2506.16659","last_updated":"2026-05-20T23:37:18Z","snapshot_observed_at":"2026-07-06T21:45:02.192166Z","submitted_at":"2025-06-20T00:10:35Z","title":"Memory-Efficient LLM Pretraining via Minimalist Optimizer Design","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T13:23:55.233840Z"},"links":{"cited_paper":"/paper/2409.20325","citing_paper":"/paper/2506.16659"},"observation_digest":"sha256:f1247733f40b9dacd6fe7587e1f379f75c918f2a117febe88aaa5bf56dc862b6","observation_id":"8b6c1845-e2e0-4cb8-ae9e-26953546d9e7","resolution":{"observed_at":"2026-05-22T13:24:53.256819Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.01623","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fira: Can we achieve full-rank training of llms under low-rank constraint?arXiv preprint arXiv:2410.01623, 2024a","venue":null,"work_id":"bc618a36-505b-4655-8771-ed9a465c53df","year":2024},"citing_paper":{"arxiv_id":"2506.16659","last_updated":"2026-05-20T23:37:18Z","snapshot_observed_at":"2026-07-06T21:45:02.192166Z","submitted_at":"2025-06-20T00:10:35Z","title":"Memory-Efficient LLM Pretraining via Minimalist Optimizer Design","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T13:23:55.233840Z"},"links":{"citing_paper":"/paper/2506.16659"},"observation_digest":"sha256:558e92a301f377de20eece042dfefb465cfce9585a017d13b2754b2c63535361","observation_id":"9bf11316-10ee-492a-8df4-02127bc376cc","resolution":{"observed_at":"2026-05-22T13:24:53.237262Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22922","last_updated":"2025-05-28T22:51:43Z","snapshot_observed_at":"2026-08-07T12:55:05.462138Z","submitted_at":"2025-05-28T22:51:43Z","title":"Scalable Parameter and Memory Efficient Pretraining for LLM: Recent Algorithmic Advances and Benchmarking","version":1},"cited_work":{"arxiv_id":"2505.22922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22922","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Glentis, J","venue":null,"work_id":"c6850665-eab6-441b-af72-73065e30c6b3","year":null},"citing_paper":{"arxiv_id":"2506.16659","last_updated":"2026-05-20T23:37:18Z","snapshot_observed_at":"2026-07-06T21:45:02.192166Z","submitted_at":"2025-06-20T00:10:35Z","title":"Memory-Efficient LLM Pretraining via Minimalist Optimizer Design","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T13:23:55.233840Z"},"links":{"cited_paper":"/paper/2505.22922","citing_paper":"/paper/2506.16659"},"observation_digest":"sha256:10726155fe70fed6a352279887db2994b9af1f9538cb23dbfd0b55628d32825a","observation_id":"c96ffdcd-e6c1-45c5-b1ce-5b8491a3b64b","resolution":{"observed_at":"2026-05-22T13:24:53.193892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17055","last_updated":"2026-08-03T09:15:30Z","snapshot_observed_at":"2026-08-07T17:53:37.204385Z","submitted_at":"2025-02-24T11:09:15Z","title":"GradientStabilizer:Fix the Norm, Not the Gradient","version":5},"cited_work":{"arxiv_id":"2502.17055","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.17055","snapshot_observed_at":"2026-06-28T19:42:36.075232Z","title":"Huang, H","venue":"cs.LG","work_id":"3a18b411-ff2c-4e91-89dc-f73013be9b6a","year":2025},"citing_paper":{"arxiv_id":"2506.16659","last_updated":"2026-05-20T23:37:18Z","snapshot_observed_at":"2026-07-06T21:45:02.192166Z","submitted_at":"2025-06-20T00:10:35Z","title":"Memory-Efficient LLM Pretraining via Minimalist Optimizer Design","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T13:23:55.233840Z"},"links":{"cited_paper":"/paper/2502.17055","citing_paper":"/paper/2506.16659"},"observation_digest":"sha256:b6ece44c26c6fa9941dbc43e4392d84f573716183f19b28a1f544c034fa5cb9f","observation_id":"b342fcff-4960-49e5-8f96-e760f28afdb2","resolution":{"observed_at":"2026-05-28T02:03:51.577898Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01843","last_updated":"2025-03-17T18:55:25Z","snapshot_observed_at":"2026-08-07T17:32:39.552982Z","submitted_at":"2025-03-03T18:59:40Z","title":"When Can You Get Away with Low Memory Adam?","version":3},"cited_work":{"arxiv_id":"2503.01843","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.01843","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"(Cited on pages 2, 3, 6, 7, 10, and 16.) D","venue":null,"work_id":"839b67d4-5052-4969-948a-13463bc8d1e8","year":null},"citing_paper":{"arxiv_id":"2506.16659","last_updated":"2026-05-20T23:37:18Z","snapshot_observed_at":"2026-07-06T21:45:02.192166Z","submitted_at":"2025-06-20T00:10:35Z","title":"Memory-Efficient LLM Pretraining via Minimalist Optimizer Design","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T13:23:55.233840Z"},"links":{"cited_paper":"/paper/2503.01843","citing_paper":"/paper/2506.16659"},"observation_digest":"sha256:4d741f9116a88e0f1ace048a4c594db3035ed5f8effd1a413c8d680237bca2e4","observation_id":"2c4f6eaf-247d-4b6d-9e4c-2e8188b0ff02","resolution":{"observed_at":"2026-05-22T13:24:53.261901Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.04831","last_updated":"2016-11-15T13:56:24Z","snapshot_observed_at":"2026-08-06T21:38:44.874589Z","submitted_at":"2016-11-15T13:56:24Z","title":"The Power of Normalization: Faster Evasion of Saddle Points","version":1},"cited_work":{"arxiv_id":"1611.04831","doi":null,"metadata_source":"pith","pith_arxiv_id":"1611.04831","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Power of Normalization: Faster Evasion of Saddle Points","venue":"cs.LG","work_id":"e7d3cabe-a761-4db0-93ce-20184167fffe","year":2016},"citing_paper":{"arxiv_id":"2506.16659","last_updated":"2026-05-20T23:37:18Z","snapshot_observed_at":"2026-07-06T21:45:02.192166Z","submitted_at":"2025-06-20T00:10:35Z","title":"Memory-Efficient LLM Pretraining via Minimalist Optimizer Design","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T13:23:55.233840Z"},"links":{"cited_paper":"/paper/1611.04831","citing_paper":"/paper/2506.16659"},"observation_digest":"sha256:f497b9a0182a4219ab3265f6606de2c86acb10b2ba368f8f975b393b6a22060e","observation_id":"21c944f3-4c7b-4de5-9933-1a28d8c163d4","resolution":{"observed_at":"2026-05-22T13:24:53.221808Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19820","last_updated":"2024-12-15T12:28:13Z","snapshot_observed_at":"2026-07-06T20:13:49.797517Z","submitted_at":"2024-12-15T12:28:13Z","title":"GaLore$+$: Boosting Low-Rank Adaptation for LLMs with Cross-Head Projection","version":1},"cited_work":{"arxiv_id":"2412.19820","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.19820","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ce4938cd-0c16-4396-b5b4-b8013c9bd9bd","year":null},"citing_paper":{"arxiv_id":"2506.16659","last_updated":"2026-05-20T23:37:18Z","snapshot_observed_at":"2026-07-06T21:45:02.192166Z","submitted_at":"2025-06-20T00:10:35Z","title":"Memory-Efficient LLM Pretraining via Minimalist Optimizer Design","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T13:23:55.233840Z"},"links":{"cited_paper":"/paper/2412.19820","citing_paper":"/paper/2506.16659"},"observation_digest":"sha256:49f4e06ba12f9086c11ed6696d152f45b5d0f05f1bc7e357c39e977ebfb0bfbd","observation_id":"aaaa3d9f-c7df-4133-ba39-87287c04398e","resolution":{"observed_at":"2026-05-22T13:24:53.221906Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2506.16659","last_updated":"2026-05-20T23:37:18Z","snapshot_observed_at":"2026-07-06T21:45:02.192166Z","submitted_at":"2025-06-20T00:10:35Z","title":"Memory-Efficient LLM Pretraining via Minimalist Optimizer Design","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T13:23:55.233840Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2506.16659"},"observation_digest":"sha256:abfd6fbb9ae71a444dfd9f125ea671a5de1c2d719530ac051927f16dac9b37d0","observation_id":"8ac2c9a3-d5ce-4a81-bdec-76d82c467ae7","resolution":{"observed_at":"2026-05-22T13:24:53.207881Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02827","last_updated":"2024-11-15T04:17:35Z","snapshot_observed_at":"2026-07-06T17:55:12.784422Z","submitted_at":"2024-04-03T15:59:42Z","title":"BAdam: A Memory Efficient Full Parameter Optimization Method for Large Language Models","version":3},"cited_work":{"arxiv_id":"2404.02827","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02827","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c0817e50-459e-46cc-9e46-fefbcee1b835","year":null},"citing_paper":{"arxiv_id":"2506.16659","last_updated":"2026-05-20T23:37:18Z","snapshot_observed_at":"2026-07-06T21:45:02.192166Z","submitted_at":"2025-06-20T00:10:35Z","title":"Memory-Efficient LLM Pretraining via Minimalist Optimizer Design","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T13:23:55.233840Z"},"links":{"cited_paper":"/paper/2404.02827","citing_paper":"/paper/2506.16659"},"observation_digest":"sha256:2eb93577aaf0faf9b7462301211a4e7539bc8a351579cc12213f56858b04687a","observation_id":"2c7ad440-ac60-41d4-af55-8523aebdfe02","resolution":{"observed_at":"2026-05-22T13:24:53.227020Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13148","last_updated":"2025-02-21T18:59:37Z","snapshot_observed_at":"2026-07-06T20:08:43.596697Z","submitted_at":"2024-12-17T18:13:18Z","title":"SWAN: SGD with Normalization and Whitening Enables Stateless LLM Training","version":3},"cited_work":{"arxiv_id":"2412.13148","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13148","snapshot_observed_at":"2026-07-04T14:29:54.502956Z","title":"SWAN: SGD with normalization and whitening enables stateless LLM training","venue":null,"work_id":"5560d104-9f68-42bf-805d-593cbfa60d87","year":2025},"citing_paper":{"arxiv_id":"2506.16659","last_updated":"2026-05-20T23:37:18Z","snapshot_observed_at":"2026-07-06T21:45:02.192166Z","submitted_at":"2025-06-20T00:10:35Z","title":"Memory-Efficient LLM Pretraining via Minimalist Optimizer Design","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T13:23:55.233840Z"},"links":{"cited_paper":"/paper/2412.13148","citing_paper":"/paper/2506.16659"},"observation_digest":"sha256:a69389e53ecc36e832ce04c25621522b485d8d8fd5445e01509b35220c148178","observation_id":"ff737671-9801-4638-be91-b3d68b07fc22","resolution":{"observed_at":"2026-05-22T13:24:53.210558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Muhamed, O","venue":null,"work_id":"27353651-8058-4d88-85d7-4f1166921294","year":2024},"citing_paper":{"arxiv_id":"2506.16659","last_updated":"2026-05-20T23:37:18Z","snapshot_observed_at":"2026-07-06T21:45:02.192166Z","submitted_at":"2025-06-20T00:10:35Z","title":"Memory-Efficient LLM Pretraining via Minimalist Optimizer Design","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T13:23:55.233840Z"},"links":{"citing_paper":"/paper/2506.16659"},"observation_digest":"sha256:765ce1289fc55de8735f9ba7eaf908f14a3bd0058c12c5a9e5ba49b9189b324b","observation_id":"810ec3b8-47cf-4a7f-b507-e13f8881f7e8","resolution":{"observed_at":"2026-05-22T13:24:53.488044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07529","last_updated":"2025-06-06T13:42:19Z","snapshot_observed_at":"2026-08-03T03:50:14.086851Z","submitted_at":"2025-02-11T13:10:34Z","title":"Training Deep Learning Models with Norm-Constrained LMOs","version":2},"cited_work":{"arxiv_id":"2502.07529","doi":"10.48550/arxiv.2502.07529","metadata_source":"pith","pith_arxiv_id":"2502.07529","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Deep Learning Models with Norm-Constrained LMOs","venue":"cs.LG","work_id":"4f1b774a-8ada-4d79-a90b-520511fce5d0","year":2025},"citing_paper":{"arxiv_id":"2506.16659","last_updated":"2026-05-20T23:37:18Z","snapshot_observed_at":"2026-07-06T21:45:02.192166Z","submitted_at":"2025-06-20T00:10:35Z","title":"Memory-Efficient LLM Pretraining via Minimalist Optimizer Design","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T13:23:55.233840Z"},"links":{"cited_paper":"/paper/2502.07529","citing_paper":"/paper/2506.16659"},"observation_digest":"sha256:c150d8f02e264b1f1da4c0caee7da49d6aab3349cfb8022c6cf5e5af60684723","observation_id":"66a0262e-6d5e-4225-8fdb-2b45289408b4","resolution":{"observed_at":"2026-05-22T13:24:53.266465Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17296","last_updated":"2024-12-15T07:51:18Z","snapshot_observed_at":"2026-08-05T07:44:17.245724Z","submitted_at":"2024-06-25T05:45:12Z","title":"BlockLLM: Memory-Efficient Adaptation of LLMs by Selecting and Optimizing the Right Coordinate Blocks","version":2},"cited_work":{"arxiv_id":"2406.17296","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.17296","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"52ef1b96-780b-4539-bca9-2ad926321a0f","year":null},"citing_paper":{"arxiv_id":"2506.16659","last_updated":"2026-05-20T23:37:18Z","snapshot_observed_at":"2026-07-06T21:45:02.192166Z","submitted_at":"2025-06-20T00:10:35Z","title":"Memory-Efficient LLM Pretraining via Minimalist Optimizer Design","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T13:23:55.233840Z"},"links":{"cited_paper":"/paper/2406.17296","citing_paper":"/paper/2506.16659"},"observation_digest":"sha256:2d53a10b6ae3c8380cec5caf94401454527febcd275dfbbdeeb59096177abb5c","observation_id":"d590ed14-3955-4500-abfa-d640c286bd69","resolution":{"observed_at":"2026-05-22T13:24:53.242252Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.16561","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T15:04:46.147669Z","title":"Gradient normalization provably benefits nonconvex sgd under heavy-tailed noise","venue":null,"work_id":"6c3c8729-16bc-4eb6-a108-4dbcf5afa363","year":2024},"citing_paper":{"arxiv_id":"2506.16659","last_updated":"2026-05-20T23:37:18Z","snapshot_observed_at":"2026-07-06T21:45:02.192166Z","submitted_at":"2025-06-20T00:10:35Z","title":"Memory-Efficient LLM Pretraining via Minimalist Optimizer Design","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T13:23:55.233840Z"},"links":{"citing_paper":"/paper/2506.16659"},"observation_digest":"sha256:bdc7dbca7b34425859dddf01d36319582e62e163002d896ccf7546e75b5ce5f8","observation_id":"2058620b-bee9-4c8c-9e54-e6f4bade211c","resolution":{"observed_at":"2026-05-22T13:24:53.232134Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11768","last_updated":"2024-12-17T09:30:44Z","snapshot_observed_at":"2026-07-06T20:07:45.865569Z","submitted_at":"2024-12-16T13:41:37Z","title":"No More Adam: Learning Rate Scaling at Initialization is All You Need","version":2},"cited_work":{"arxiv_id":"2412.11768","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.11768","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minghao Xu, Lichuan Xiang, Xu Cai, and Hongkai Wen","venue":null,"work_id":"0cb36bbd-4814-4bda-a1eb-bb59b2f60f19","year":2017},"citing_paper":{"arxiv_id":"2506.16659","last_updated":"2026-05-20T23:37:18Z","snapshot_observed_at":"2026-07-06T21:45:02.192166Z","submitted_at":"2025-06-20T00:10:35Z","title":"Memory-Efficient LLM Pretraining via Minimalist Optimizer Design","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T13:23:55.233840Z"},"links":{"cited_paper":"/paper/2412.11768","citing_paper":"/paper/2506.16659"},"observation_digest":"sha256:d259bcca0e0f5f64fcbd1a72b5520c091cca1bed6aa89edbd0fc9943690aa629","observation_id":"c732579d-e615-4f62-8939-4f4a3b6dc7df","resolution":{"observed_at":"2026-05-22T13:24:53.247110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16793","last_updated":"2025-02-24T11:29:08Z","snapshot_observed_at":"2026-08-03T23:43:24.359346Z","submitted_at":"2024-06-24T16:56:41Z","title":"Adam-mini: Use Fewer Learning Rates To Gain More","version":7},"cited_work":{"arxiv_id":"2406.16793","doi":"10.48550/arxiv.2406.16793","metadata_source":"pith","pith_arxiv_id":"2406.16793","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam-mini: Use fewer learning rates to gain more.arXiv preprint arXiv:2406.16793","venue":"cs.LG","work_id":"988d7ebd-209d-4382-80e6-0d367b74e767","year":2024},"citing_paper":{"arxiv_id":"2506.16659","last_updated":"2026-05-20T23:37:18Z","snapshot_observed_at":"2026-07-06T21:45:02.192166Z","submitted_at":"2025-06-20T00:10:35Z","title":"Memory-Efficient LLM Pretraining via Minimalist Optimizer Design","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T13:23:55.233840Z"},"links":{"cited_paper":"/paper/2406.16793","citing_paper":"/paper/2506.16659"},"observation_digest":"sha256:a07a18efc350c6ce56c88d7e31a7d69b69b4d09caac2e16be789a53b096f5e15","observation_id":"94586757-8b76-4e00-8ecc-be0d4d039b79","resolution":{"observed_at":"2026-05-22T13:24:53.226332Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"(Cited on pages 3, 11, and 12.) A Appendix A.1 Details of memory estimation for 1B and 7B models Here we compute the memory estimate for both 1B and 7B LLaMA models","venue":null,"work_id":"6ed231bb-162f-407a-841d-7f6f7125668f","year":2024},"citing_paper":{"arxiv_id":"2506.16659","last_updated":"2026-05-20T23:37:18Z","snapshot_observed_at":"2026-07-06T21:45:02.192166Z","submitted_at":"2025-06-20T00:10:35Z","title":"Memory-Efficient LLM Pretraining via Minimalist Optimizer Design","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T13:23:55.233840Z"},"links":{"citing_paper":"/paper/2506.16659"},"observation_digest":"sha256:1fbc52413e76db11430d37d52676b76f9e8aa1a8c3bdce6e314211cba598a026","observation_id":"1570a9a9-4d81-42fb-af3c-658e9de81ced","resolution":{"observed_at":"2026-05-22T13:24:53.480331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"7B model: Pre-last layers include 6.607B parameters and last layer includes 0.131B parameters, which in total leads to 6.738B parameters","venue":null,"work_id":"8da77abe-81d6-4293-86dc-0e91064a0e11","year":2025},"citing_paper":{"arxiv_id":"2506.16659","last_updated":"2026-05-20T23:37:18Z","snapshot_observed_at":"2026-07-06T21:45:02.192166Z","submitted_at":"2025-06-20T00:10:35Z","title":"Memory-Efficient LLM Pretraining via Minimalist Optimizer Design","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T13:23:55.233840Z"},"links":{"citing_paper":"/paper/2506.16659"},"observation_digest":"sha256:927dd92e8967f05302a17af0587e8f6648b98b719e443c9a2b98fac2f3945744","observation_id":"e5e9bb58-295f-45be-899d-728c310a9a61","resolution":{"observed_at":"2026-05-22T13:24:53.484309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.16659","last_updated":"2026-05-20T23:37:18Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T21:45:02.192166Z","submitted_at":"2025-06-20T00:10:35Z","title":"Memory-Efficient LLM Pretraining via Minimalist Optimizer Design"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":12,"verified_fuzzy":3},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 6 inbound Pith citation observations for arXiv:2506.16659."}