{"as_of":"2026-08-09T01:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e3f9ad56f259989bd163d45531f83880073233e3bd997c5d6fe0cc99dbc99fa7","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T17:01:42.078459Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.11254/citation-record","integrity":"/paper/2509.11254/integrity","json":"/paper/2509.11254/citation-record.json","paper":"/paper/2509.11254"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.007942Z","title":"Scaling distributed machine learning with the parameter server","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-08T08:32:27.730715Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.007942Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:d4fb8728291971b8fb78c59568b42d1c2328c9ace28e922986424de3d7153b21","observation_id":"83872f07-4923-4fbd-b9a1-03f44b2a66f2","resolution":{"observed_at":"2026-08-04T17:01:42.007942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.011004Z","title":"Bandwidth optimal all-reduce algorithms for clusters of workstations.Journal of Parallel and Distributed Computing, 69(2):117–124, 2009","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-08T08:32:27.730715Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.011004Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:89419e6cccecc42f4b2a2703d7f2480c8f3b465d08088967d2aa90c8c58ef8d4","observation_id":"d9539af7-b0c0-4af2-8de0-8bd35ea37279","resolution":{"observed_at":"2026-08-04T17:01:42.011004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.014246Z","title":"1-bit stochastic gradient descent and its application to data-parallel distributed training of speech dnns","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-08T08:32:27.730715Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.014246Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:3ee1661817f73e77b8a423e9f5d743304abc9e16cacbe48195dc40085af6e47b","observation_id":"fa0af9d4-aecb-4806-93dc-acd646b067de","resolution":{"observed_at":"2026-08-04T17:01:42.014246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.017193Z","title":"Project adam: Building an efficient and scalable deep learning training system","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-08T08:32:27.730715Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.017193Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:9e940272e55bdec67ecb603f72d4b3143051a645f910e027ccac701588106266","observation_id":"8f70ee7f-a8b0-4246-935a-3d8be6330014","resolution":{"observed_at":"2026-08-04T17:01:42.017193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.020282Z","title":"Qsgd: Communication-efficient sgd via gradient quantization and encoding.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-08T08:32:27.730715Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.020282Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:8ffe9c3592ce18e703b00848fffbc8869ed51900a8c57567450af64b11017dc4","observation_id":"a9ad12bd-9b49-40d6-a8b1-d79cdc2b55ae","resolution":{"observed_at":"2026-08-04T17:01:42.020282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.023417Z","title":"Terngrad: Ternary gradients to reduce communication in distributed deep learning.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-08T08:32:27.730715Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.023417Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:eb29dbdfc578f01dc37282b30ccc6180e2d5b49091beb31a5a08e2fc26588e61","observation_id":"c090a467-3b2d-4520-b04e-df041fe5ddac","resolution":{"observed_at":"2026-08-04T17:01:42.023417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.05492","last_updated":"2017-10-30T20:52:14Z","snapshot_observed_at":"2026-07-06T05:15:00.158639Z","submitted_at":"2016-10-18T09:11:51Z","title":"Federated Learning: Strategies for Improving Communication Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.05492","snapshot_observed_at":"2026-08-04T17:01:42.026238Z","title":"Federated learning: Strategies for improving communication efficiency.arXiv preprint arXiv:1610.05492, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-08T08:32:27.730715Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.026238Z"},"links":{"cited_paper":"/paper/1610.05492","citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:6165a422816d754567f1e321d477e55eb994612f42dc815f078c0db937e44b31","observation_id":"70983f45-eb54-46d5-a7e9-b4e2e50b3c62","resolution":{"observed_at":"2026-08-04T17:01:42.026238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.029318Z","title":"Gradient sparsification for communication-efficient distributed optimization.Advances in Neural Information Processing Systems, 31, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-08T08:32:27.730715Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.029318Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:7ac6da83979da95e6e034ae56287492cb2a7ad906e5bc698e3710b8429c151f9","observation_id":"5e083bab-dcb5-48a1-bbde-113d798d832d","resolution":{"observed_at":"2026-08-04T17:01:42.029318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.031993Z","title":"Sparsified sgd with memory.Advances in neural information processing systems, 31, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-08T08:32:27.730715Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.031993Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:90985132d756cf7732f5b06d98c689ee91d69d6cc177f22a4538c7f305c3360e","observation_id":"48c065bf-e9f9-47f4-bc2f-212fd1f91d5f","resolution":{"observed_at":"2026-08-04T17:01:42.031993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.034491Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-08T08:32:27.730715Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.034491Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:4532b59ed74bd6a88b0db1a733b08efcd99561323e2b4581e822246e5753e9f0","observation_id":"7d3beb5f-c2e7-4fcc-871e-a82c46bb0527","resolution":{"observed_at":"2026-08-04T17:01:42.034491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03507","last_updated":"2024-06-02T21:24:12Z","snapshot_observed_at":"2026-07-06T17:40:15.746482Z","submitted_at":"2024-03-06T07:29:57Z","title":"GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03507","snapshot_observed_at":"2026-08-04T17:01:42.037020Z","title":"Galore: Memory-efficient llm training by gradient low-rank projection.arXiv preprint arXiv:2403.03507, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-08T08:32:27.730715Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.037020Z"},"links":{"cited_paper":"/paper/2403.03507","citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:e56bbd0a7cf99849958a672bbbda598107c180e25b788d734fb05169308dcc04","observation_id":"1a3dd5dc-f83f-4698-8b3f-271a689313bf","resolution":{"observed_at":"2026-08-04T17:01:42.037020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.039844Z","title":"Sltrain: a sparse plus low rank approach for parameter and memory efficient pretraining.Advances in Neural Information Processing Systems, 37:118267–118295, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-08T08:32:27.730715Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.039844Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:1ea65062c2a37ea49815601d88d3df37bf8c189e80fb0c1d42715f0ac329bc03","observation_id":"ad88d29b-8031-4eb9-a05a-f450f1f0e019","resolution":{"observed_at":"2026-08-04T17:01:42.039844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07698","last_updated":"2024-10-10T08:10:53Z","snapshot_observed_at":"2026-08-06T18:34:48.824634Z","submitted_at":"2024-10-10T08:10:53Z","title":"Enhancing Zeroth-order Fine-tuning for Language Models with Low-rank Structures","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07698","snapshot_observed_at":"2026-08-04T17:01:42.042592Z","title":"Enhancing zeroth-order fine-tuning for language models with low-rank structures.arXiv preprint arXiv:2410.07698, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-08T08:32:27.730715Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.042592Z"},"links":{"cited_paper":"/paper/2410.07698","citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:3b95e054798a46251631b091d35c3d7e2b3735c01b9b3076043d5db0aac67c06","observation_id":"95b7e784-4094-479f-b626-8868187e7af5","resolution":{"observed_at":"2026-08-04T17:01:42.042592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.045428Z","title":"Powersgd: Practical low-rank gradient compression for distributed optimization.Advances in Neural Information Processing Systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-08T08:32:27.730715Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.045428Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:d11e4fcda1ae596d13278d9c6cccbb5b42c4f301853a19b4873d2ef86741a3c8","observation_id":"6b27ab68-3b4f-41ab-9af7-1b0c2fe8f4ea","resolution":{"observed_at":"2026-08-04T17:01:42.045428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.048192Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-08T08:32:27.730715Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.048192Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:0f598ebaadddfa08676535606da89d3b74ec6d69773eac9980977d8de464a68d","observation_id":"4411f083-7653-4de7-8fea-d230e4f16aee","resolution":{"observed_at":"2026-08-04T17:01:42.048192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.02868","last_updated":"2023-03-06T03:36:26Z","snapshot_observed_at":"2026-07-31T13:29:57.932652Z","submitted_at":"2023-03-06T03:36:26Z","title":"Angel-PTM: A Scalable and Economical Large-scale Pre-training System in Tencent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.02868","snapshot_observed_at":"2026-08-04T17:01:42.051031Z","title":"Angel- ptm: A scalable and economical large-scale pre-training system in tencent.arXiv preprint arXiv:2303.02868, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-08T08:32:27.730715Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.051031Z"},"links":{"cited_paper":"/paper/2303.02868","citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:af75cab6939a073c0e96a1955b50ad27bdfa03c3a865cadb776f9e8644de5585","observation_id":"8a12f758-da24-43c7-be5d-46f6984f79e3","resolution":{"observed_at":"2026-08-04T17:01:42.051031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.053851Z","title":"Error feedback fixes signsgd and other gradient compression schemes","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-08T08:32:27.730715Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.053851Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:dfe99068bd888d3d59609d33ea2c8e94c22870fbede446591538822bce73f5d7","observation_id":"2b48aaf0-3f7c-4f10-a112-c695b0483338","resolution":{"observed_at":"2026-08-04T17:01:42.053851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.003318Z","title":"single-step power iteration","venue":null,"work_id":null,"year":2091},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-08T08:32:27.730715Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.003318Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:cc30b42e7b01759c4253ccd99ccd53d96b6a4ffc0dcfc2d6548f7a64d6a74c6b","observation_id":"638fb470-f9ea-4018-be12-ffd430cfb395","resolution":{"observed_at":"2026-08-04T17:01:42.003318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.056500Z","title":"Ef21: A new, simpler, theoretically better, and practically faster error feedback.Advances in Neural Information Processing Systems, 34:4384–4396, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-08T08:32:27.730715Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.056500Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:8c74528be9e37476943bfbf04df423a69aea961431113a73268a11c9ba125ad3","observation_id":"81bde3cf-94be-45fb-89bf-8b8cf9e25e79","resolution":{"observed_at":"2026-08-04T17:01:42.056500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.059202Z","title":"Lower bounds and nearly optimal algorithms in distributed learning with communication compression.Advances in Neural Information Processing Systems, 35:18955–18969, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-08T08:32:27.730715Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.059202Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:665d8a44008281ecdf4f59d8df10cffc09c07a09c1560eff357e519ea1938dd2","observation_id":"5fad0cd2-3d78-43d2-a6af-c9d062d96753","resolution":{"observed_at":"2026-08-04T17:01:42.059202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.05350","last_updated":"2021-06-16T15:44:47Z","snapshot_observed_at":"2026-07-06T08:21:01.643474Z","submitted_at":"2019-09-11T20:54:49Z","title":"The Error-Feedback Framework: Better Rates for SGD with Delayed Gradients and Compressed Communication","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.05350","snapshot_observed_at":"2026-08-04T17:01:42.061587Z","title":"The error-feedback framework: Better rates for sgd with delayed gradients and compressed communication.arXiv preprint arXiv:1909.05350, 2019","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-08T08:32:27.730715Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.061587Z"},"links":{"cited_paper":"/paper/1909.05350","citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:81f2a28478302a3d1e4f3a39874e30e8193d4a2d40aa101b7db2b6d003a7ae21","observation_id":"e65ccc3e-13ba-41a3-98b1-4059729db6ff","resolution":{"observed_at":"2026-08-04T17:01:42.061587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.064823Z","title":"Momentum provably improves error feedback!Ad- vances in Neural Information Processing Systems, 36:76444–76495, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-08T08:32:27.730715Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.064823Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:243cd5da240c00c12b1c276d70f2ab0edaaead69f82469c47a3e00da73aa6073","observation_id":"c7395f9c-76d2-4d0c-8269-09c78faacc0a","resolution":{"observed_at":"2026-08-04T17:01:42.064823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.067290Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-08T08:32:27.730715Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.067290Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:19914e600011cce98fd3333e335082f6226fa12fff037c5dcb706bdd5be29641","observation_id":"16680f9c-4920-4dce-bb4a-12a797d159a6","resolution":{"observed_at":"2026-08-04T17:01:42.067290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.069707Z","title":"Atomo: Communication-efficient learning via atomic sparsification.Advances in neural information processing systems, 31, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-08T08:32:27.730715Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.069707Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:b5c732c190827bed8a9416092a41b167cfc28eaf976b327db8e2d804957bf538","observation_id":"e651f1b9-d25d-44b1-8392-24c2c159f715","resolution":{"observed_at":"2026-08-04T17:01:42.069707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.072449Z","title":"Greedy low-rank gradient compression for distributed learning with convergence guarantees.arXiv preprint arXiv:2507.08784, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-08T08:32:27.730715Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.072449Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:822111450e47a9cdf90f3513ec23e1d366d6cdee5887c024f5592a66bd1b5ff0","observation_id":"80269079-ba91-48c4-918b-88d47f9e1f0c","resolution":{"observed_at":"2026-08-04T17:01:42.072449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11289","last_updated":"2025-06-04T06:11:50Z","snapshot_observed_at":"2026-08-08T08:32:10.511805Z","submitted_at":"2024-10-15T05:16:32Z","title":"Subspace Optimization for Large Language Models with Convergence Guarantees","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11289","snapshot_observed_at":"2026-08-04T17:01:42.075076Z","title":"NX i=1 (λ(i) t +γ (i) t ) ! A+ NX i=1 β(i) t ! B # C∈span(C), ⇒ ˜Pt =C. Then: Qt = 1 N NX i=1 ∆(i)⊤ t ˜Pt = qt−1 N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-08T08:32:27.730715Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.075076Z"},"links":{"cited_paper":"/paper/2410.11289","citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:2ae89d7fd6c3d4c0aad95561dedd0f62549675817ff87badf4b64abfeda3a5c8","observation_id":"ccd0a2ae-c1ed-4255-8051-ae80ee6c9889","resolution":{"observed_at":"2026-08-04T17:01:42.075076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:01:42.078459Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","snapshot_observed_at":"2026-08-08T08:32:27.730715Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T17:01:42.078459Z"},"links":{"citing_paper":"/paper/2509.11254"},"observation_digest":"sha256:d73b20daeec6801b1bfd24f00a63c3fa5018b791158fb9a3b43f8788dc611d00","observation_id":"3971d6e2-aa22-4d9d-b675-6ac80d1f8972","resolution":{"observed_at":"2026-08-04T17:01:42.078459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.11254","last_updated":"2025-09-14T12:54:28Z","latest_version":1,"primary_category":"math.OC","snapshot_observed_at":"2026-08-08T08:32:27.730715Z","submitted_at":"2025-09-14T12:54:28Z","title":"From PowerSGD to PowerSGD+: Low-Rank Gradient Compression for Distributed Optimization with Convergence Guarantees"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2509.11254."}