{"as_of":"2026-08-08T02:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cb05da97006c8ac89c503076b4d736159e61c5e9e0c66351145bfcfc6e465c93","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:55:15.447206Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T18:53:47.187437Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-28T19:42:36.073867Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"cited_work":{"arxiv_id":"2506.01260","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01260","snapshot_observed_at":"2026-07-09T00:19:35.965961Z","title":"Mikhail I","venue":null,"work_id":"be24e955-164c-4eba-98c6-2b858a34c76e","year":2025},"citing_paper":{"arxiv_id":"2507.06542","last_updated":"2026-04-27T10:34:05Z","snapshot_observed_at":"2026-08-06T23:52:48.965163Z","submitted_at":"2025-07-09T04:56:56Z","title":"On the Surprising Effectiveness of a Single Global Merging in Decentralized Learning","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-19T05:39:53.088948Z"},"links":{"cited_paper":"/paper/2506.01260","citing_paper":"/paper/2507.06542"},"observation_digest":"sha256:61b004cf1aaca55075fee4e2d0af9241bc53a39a4bb30349c9545763f8533a9a","observation_id":"9a3fc158-0571-435a-9652-263a421bd0b8","resolution":{"observed_at":"2026-07-09T00:19:35.965961Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"cited_work":{"arxiv_id":"2506.01260","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01260","snapshot_observed_at":"2026-07-09T00:19:35.965961Z","title":"Mikhail I","venue":null,"work_id":"be24e955-164c-4eba-98c6-2b858a34c76e","year":2025},"citing_paper":{"arxiv_id":"2604.11947","last_updated":"2026-04-13T18:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T18:40:45Z","title":"ResBM: Residual Bottleneck Models for Low-Bandwidth Pipeline Parallelism","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:15.760164Z"},"links":{"cited_paper":"/paper/2506.01260","citing_paper":"/paper/2604.11947"},"observation_digest":"sha256:fca8f2afed3d935ddb11783f53e802b393ba22e9816e15dcb2ed88274bc7f6d0","observation_id":"5ab30c17-9f1e-48dc-b734-49a5b9295181","resolution":{"observed_at":"2026-07-09T00:19:35.965961Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"cited_work":{"arxiv_id":"2506.01260","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01260","snapshot_observed_at":"2026-07-09T00:19:35.965961Z","title":"Mikhail I","venue":null,"work_id":"be24e955-164c-4eba-98c6-2b858a34c76e","year":2025},"citing_paper":{"arxiv_id":"2606.00539","last_updated":"2026-05-30T05:11:13Z","snapshot_observed_at":"2026-07-06T23:41:15.410587Z","submitted_at":"2026-05-30T05:11:13Z","title":"GNMR: Runtime Stability Control for Low-Precision Large Language Model Training","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T18:53:47.187437Z"},"links":{"cited_paper":"/paper/2506.01260","citing_paper":"/paper/2606.00539"},"observation_digest":"sha256:8b816f7806b7f24622e1bdc1662204fdd33c7927c3d5ccd93aecc3b413cd3b6e","observation_id":"d3d7d422-f931-43f2-85ba-457aed58aacd","resolution":{"observed_at":"2026-07-09T00:19:35.965961Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01260/citation-record","integrity":"/paper/2506.01260/integrity","json":"/paper/2506.01260/citation-record.json","paper":"/paper/2506.01260"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:19.588634Z","title":"Transformers learn through gradual rank increase","venue":null,"work_id":"eac3185d-7b23-4d3b-81f3-bd5464f141cb","year":2024},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:12.762172Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:510cd6c87bcda291e1b6fbbfda287a3ee3bd4d98678b068377c72052220b513a","observation_id":"592c6e93-48c5-42ed-a329-6175452b8bf2","resolution":{"observed_at":"2026-08-07T11:55:19.678630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:19.419099Z","title":"Qsgd: Communication-efficient sgd via gradient quantization and encoding","venue":null,"work_id":"75ba17e2-40ae-4a78-a8c5-2be314de509c","year":2017},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:12.792678Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:d44a5ee933b3a7409309e20ba231fa354d7181521434a7edf9591aa4a1f3fc55","observation_id":"c64f9b57-fbda-4ae6-9d11-f765a78e9e18","resolution":{"observed_at":"2026-08-07T11:55:19.504881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:19.272609Z","title":"Dissecting adam: The sign, magnitude and variance of stochastic gradients","venue":null,"work_id":"90e314c2-c453-4d85-b56f-c55315af9f36","year":2018},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:12.887755Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:89a42e689592e14aa9b96700a75805cdd6d05d92218b8bdb0d99a187f5204ff5","observation_id":"d9f4a23d-1c97-4aff-8476-1549f87bd169","resolution":{"observed_at":"2026-08-07T11:55:19.330916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:19.136150Z","title":"signsgd: Compressed optimisation for non-convex problems","venue":null,"work_id":"c9219804-5d1b-49e3-aa21-61d3d52c0a67","year":2018},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:12.938754Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:ded865e21bd2470259cdabf79c13cfd9bb5bda670328f1e3a488fcfe87340248","observation_id":"b0970cf0-a55e-4c8e-bd80-4d94511bc6d9","resolution":{"observed_at":"2026-08-07T11:55:19.199270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09078","last_updated":"2025-04-01T12:48:43Z","snapshot_observed_at":"2026-07-06T20:05:46.205005Z","submitted_at":"2024-12-12T09:01:18Z","title":"Forest-of-Thought: Scaling Test-Time Compute for Enhancing LLM Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09078","snapshot_observed_at":"2026-08-07T11:55:12.978236Z","title":"Forest-of-thought: Scaling test-time compute for enhancing llm reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:12.978236Z"},"links":{"cited_paper":"/paper/2412.09078","citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:d5e9b8a989cca373c95598f39fd9d5dde18efddd882c3d8477f343c984d9c0b9","observation_id":"f0b24b53-ce89-4eeb-8b57-0b237e83940b","resolution":{"observed_at":"2026-08-07T11:55:12.978236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:18.972152Z","title":"Does compressing activations help model parallel training? Proceedings of Machine Learning and Systems, 6: 0 239--252, 2024","venue":null,"work_id":"04dd3248-0dcd-44d0-a65f-c377b07104b5","year":2024},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:13.031459Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:7f14b242b84fc8715578627f09ea1671f594025fa82c5881ba288473c836cc16","observation_id":"1add04da-defb-470c-90cd-02b6b5ca622c","resolution":{"observed_at":"2026-08-07T11:55:19.045514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:18.777887Z","title":"Low-rank gradient descent","venue":null,"work_id":"9de02711-6dbd-4998-9fe0-e8f80891b862","year":2023},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:13.092064Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:996387102d74d94b1a533f8f97040fb5cd039bdaae412427e0dccedcfb27ec93","observation_id":"c8e9404a-916d-4c17-804c-81fdebbac5f7","resolution":{"observed_at":"2026-08-07T11:55:18.889782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:18.580808Z","title":"DeepSeek LLMs , 2023","venue":null,"work_id":"2c4d8d54-9941-4e34-8af1-157526243ada","year":2023},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:13.159428Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:472cd9890716cb6a2791218048b02c290ff0d39cd6bc0ef52e656c17e64a0d74","observation_id":"68b31344-16d3-455d-bc0d-ca08bcbba0c4","resolution":{"observed_at":"2026-08-07T11:55:18.694587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.02395","last_updated":"2022-10-17T13:20:40Z","snapshot_observed_at":"2026-08-06T18:53:35.682332Z","submitted_at":"2020-03-05T01:56:17Z","title":"A Simple Convergence Proof of Adam and Adagrad","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.02395","snapshot_observed_at":"2026-08-07T11:55:13.202772Z","title":"A simple convergence proof of adam and adagrad","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:13.202772Z"},"links":{"cited_paper":"/paper/2003.02395","citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:4b7ba85ce43c09efca9d4ff556e3754f198e9be89e372ead948ec0c291a83d5b","observation_id":"4b22ed7a-9bb6-4124-bbc1-0c5aaec5abd2","resolution":{"observed_at":"2026-08-07T11:55:13.202772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-07-06T11:55:04.054344Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-07T11:55:13.250462Z","title":"8-bit optimizers via block-wise quantization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:13.250462Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:5071c1c8dac413fcf59942a0d76dcd190cee2295da0a1ddea6109eacf3b281fa","observation_id":"f320d63e-c91c-46e4-9a45-535ee198c85f","resolution":{"observed_at":"2026-08-07T11:55:13.250462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:18.494947Z","title":"Distributed deep learning in open collaborations","venue":null,"work_id":"b7ee4253-ba10-41d2-8f6a-bc8097ba5033","year":2021},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:13.281551Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:dcf2cec9e3e0e83aecd3a957a46ece1c180845eda2e0f20cc49f6be2639a94f0","observation_id":"0ca8007e-5add-4001-a83b-f107719004ae","resolution":{"observed_at":"2026-08-07T11:55:18.526941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:18.429929Z","title":"Attention is not all you need: Pure attention loses rank doubly exponentially with depth","venue":null,"work_id":"29bfd4b9-7c91-4ddc-8aae-9c914eeffa12","year":2021},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:13.326951Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:2228a09457ff4a5ffd48e785bffad81e0700b11d41754b873cdd2f486921f662","observation_id":"f036de15-21bb-48ec-810e-d27ca7cb503e","resolution":{"observed_at":"2026-08-07T11:55:18.456406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-07T11:55:13.360801Z","title":"Diloco: Distributed low-communication training of language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:13.360801Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:8da918ea6f70455e69730d9be7b30ada91168fd74a4bdbcd66256ae719917547","observation_id":"6e906f3c-ff5a-495d-ab76-86472ce8777e","resolution":{"observed_at":"2026-08-07T11:55:13.360801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:55:13.407145Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:13.407145Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:a63593fb583e0d437438fa47fad2c68445e4deb2e1cf48ed4aa637407aa8f3c8","observation_id":"657f8464-4b43-4ef3-a757-c4b350906cce","resolution":{"observed_at":"2026-08-07T11:55:13.407145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:13.449970Z","title":"Openwebtext corpus","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:13.449970Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:cb68fb7d84aba29e36b23ed261690720ffe30dacf20cfaa5ffdfed99748ae73f","observation_id":"e1517c73-b813-4383-9d2b-c86d6c3edb31","resolution":{"observed_at":"2026-08-07T11:55:13.449970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.04754","last_updated":"2018-12-12T00:36:17Z","snapshot_observed_at":"2026-07-06T07:20:39.525340Z","submitted_at":"2018-12-12T00:36:17Z","title":"Gradient Descent Happens in a Tiny Subspace","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.04754","snapshot_observed_at":"2026-08-07T11:55:13.490228Z","title":"Gradient descent happens in a tiny subspace","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:13.490228Z"},"links":{"cited_paper":"/paper/1812.04754","citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:aed5e3f6a039f45f9ac02073236252f8249b84add2c3b9cf9f34aec9fba1f9ac","observation_id":"4dd99cc9-a68d-4bba-b2a7-7be5f5266f9b","resolution":{"observed_at":"2026-08-07T11:55:13.490228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:18.275785Z","title":"Training compute-optimal large language models","venue":null,"work_id":"2f471d0c-74a8-4a84-8686-79fc5788aaa8","year":null},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:13.527372Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:34594f2536b6a2ddc0cb2925ce0806fe23f34e8389ab332e5cde5ae5d71f8ccd","observation_id":"af20aac7-bd93-48cd-8526-2d1f2499c4b3","resolution":{"observed_at":"2026-08-07T11:55:18.325287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:13.561151Z","title":"Gpipe: Efficient training of giant neural networks using pipeline parallelism","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:13.561151Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:0ed6b3ce2f2be471a6f4780c33586c1fb699e48cca4ca499a607f3d031e17e86","observation_id":"683d281f-56b2-437a-8a1e-24729c94ee26","resolution":{"observed_at":"2026-08-07T11:55:13.561151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:13.601856Z","title":"Error feedback fixes signsgd and other gradient compression schemes","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:13.601856Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:1f8e4f081b91338dbfd29a30921aa5960872e02389f9fb3cc8d757e53c04aa53","observation_id":"b4c27129-cdab-49cd-99c9-b8aa62ec37ca","resolution":{"observed_at":"2026-08-07T11:55:13.601856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T11:55:13.644921Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:13.644921Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:3d6ef40714d59dbc0448afa269c133e6b2e647faae08f950557ad8abd0ab2827","observation_id":"64d9c80c-1fe9-42e7-bb18-22149f1a0fc3","resolution":{"observed_at":"2026-08-07T11:55:13.644921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:18.154532Z","title":"Big transfer (bit): General visual representation learning","venue":null,"work_id":"c0bc7703-52ad-4db3-90e6-4bdb6728cba2","year":2020},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:13.685383Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:119362ee9dbcefe6949382be79a177efce2a8a39962358bc2c860405b9d16391","observation_id":"c9e3c9a4-ab2e-456e-aeaa-ce89aaa02670","resolution":{"observed_at":"2026-08-07T11:55:18.191509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:18.071332Z","title":"Decentralized stochastic optimization and gossip algorithms with compressed communication","venue":null,"work_id":"7fd57304-1fc0-428b-8e59-21678e24882b","year":2019},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:13.722281Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:6f2b68a31065a93814b40271d55dcaa9d85aaca67cb7a1e3e58b9378cecadf36","observation_id":"28c35edf-fce5-4f31-9f2e-739c15297eb7","resolution":{"observed_at":"2026-08-07T11:55:18.111648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:17.983552Z","title":"A unified theory of decentralized sgd with changing topology and local updates","venue":null,"work_id":"42cceee5-1e5a-4b7b-8e60-697fcad07131","year":2020},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:13.774841Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:96653268798921cf8b24b3f6cc4b60c1faf9ae97244b59ccfd47cf424c7d993e","observation_id":"4e2ef206-c2d0-4d33-bc94-9ab270d35c10","resolution":{"observed_at":"2026-08-07T11:55:18.022141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:13.802110Z","title":"Imagenet classification with deep convolutional neural networks","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:13.802110Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:aa6e6ed302fe372b25a331876f69f627ebfe6d5d8fba9c18fbf50990c5967abe","observation_id":"886cc201-60f9-4848-93b9-49a731d1a1f7","resolution":{"observed_at":"2026-08-07T11:55:13.802110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:17.822881Z","title":"Convergence of adam under relaxed assumptions","venue":null,"work_id":"82741742-7043-43d8-aa73-8472326d1034","year":2024},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:13.825919Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:5b4401c092de61bfd7cb18aa2124135975520c52933e5d6b9e8e1e29d0392ea4","observation_id":"0d731396-90cc-43ae-bf02-63c8765e4443","resolution":{"observed_at":"2026-08-07T11:55:17.906167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:17.706641Z","title":"Learning on transformers is provable low-rank and sparse: A one-layer analysis","venue":null,"work_id":"dc8d2588-ab60-4b29-a66f-29554f03fbe8","year":2024},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:13.868539Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:50b17a51b59752149ce903ecbdf217cd9f5e8eac77c5fa9b671ab25a34219d10","observation_id":"4cc5152f-e7a0-4997-a5f0-5e9f547c6b78","resolution":{"observed_at":"2026-08-07T11:55:17.727061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.15704","last_updated":"2020-06-28T20:39:45Z","snapshot_observed_at":"2026-07-06T09:33:26.082100Z","submitted_at":"2020-06-28T20:39:45Z","title":"PyTorch Distributed: Experiences on Accelerating Data Parallel Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.15704","snapshot_observed_at":"2026-08-07T11:55:13.906478Z","title":"Pytorch distributed: Experiences on accelerating data parallel training","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:13.906478Z"},"links":{"cited_paper":"/paper/2006.15704","citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:517a1ef3ab57e95650a97299dd0622576ac107e511453515a8151b0a07e73caf","observation_id":"19dd66f6-69f6-4bb8-a90d-8468618ce0ff","resolution":{"observed_at":"2026-08-07T11:55:13.906478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:17.603134Z","title":"Can decentralized algorithms outperform centralized algorithms? a case study for decentralized parallel stochastic gradient descent","venue":null,"work_id":"b5a461c6-b46e-4d6c-9af1-ed635bfdd83c","year":2017},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:13.949599Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:6d843f80bb4759a5b95bdd25faa35b530cb96933b54e95ba7a393827f6b75ce5","observation_id":"732b3de9-bc91-4a0d-a6ca-47b1d0f59ec7","resolution":{"observed_at":"2026-08-07T11:55:17.641992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06511","last_updated":"2025-06-07T19:16:22Z","snapshot_observed_at":"2026-08-07T00:12:09.462694Z","submitted_at":"2024-10-09T03:26:11Z","title":"TorchTitan: One-stop PyTorch native solution for production ready LLM pre-training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06511","snapshot_observed_at":"2026-08-07T11:55:13.990201Z","title":"Torchtitan: One-stop pytorch native solution for production ready llm pre-training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:13.990201Z"},"links":{"cited_paper":"/paper/2410.06511","citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:f93fb0514a7b93f7d1022fc0c1d869e7ed2a7328c9ba26303ab7ff5fd378db5a","observation_id":"0bd52271-10b8-4d50-a78c-22c4a00bb911","resolution":{"observed_at":"2026-08-07T11:55:13.990201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-07T09:53:59.286406Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-07T11:55:14.033583Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:14.033583Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:51e6e91282a3f84c4a32318eca03ba2064fcd25c98a3ccee9e26a61bc2f0667a","observation_id":"e8cf2029-b266-4302-bfb0-99f8904247e0","resolution":{"observed_at":"2026-08-07T11:55:14.033583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.11985","last_updated":"2020-11-24T09:28:53Z","snapshot_observed_at":"2026-07-06T10:17:20.018106Z","submitted_at":"2020-11-24T09:28:53Z","title":"Adam$^+$: A Stochastic Method with Adaptive Variance Reduction","version":1},"cited_work":{"arxiv_id":"2011.11985","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.11985","snapshot_observed_at":"2026-08-07T11:55:15.817882Z","title":"Adam$^+$: A Stochastic Method with Adaptive Variance Reduction","venue":"cs.LG","work_id":"3dca7a7c-12a4-4be5-9028-7453faa290a8","year":2020},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:14.067024Z"},"links":{"cited_paper":"/paper/2011.11985","citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:fec809bb0b8fe68b21407f79e75b234b610569b2ab67edaa39e890e35d0a7e4e","observation_id":"6f8f90bb-c2ea-4452-9de8-6966bae1c399","resolution":{"observed_at":"2026-08-07T11:55:15.848572Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T11:55:14.108295Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:14.108295Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:44f93bfcbee026ffba86edf3b463b73c30c5b43ea8175be7f0546def6a9f4f3d","observation_id":"9d2acdea-e1c8-4755-8b44-50e70a49009d","resolution":{"observed_at":"2026-08-07T11:55:14.108295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:14.137281Z","title":"Pointer sentinel mixture models, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:14.137281Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:310ea2ed4cb166a0ccfc9adb272e7c831af6ba5a50e3b7cac9545a99f4807d84","observation_id":"0dc712ca-9b3e-4e6c-99e1-0292bccb2473","resolution":{"observed_at":"2026-08-07T11:55:14.137281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:14.176931Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:14.176931Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:e6cfca848e74bc6eebe1cf4f97e313c6ad1145b5c9d8726cea17053bd513c075","observation_id":"8c77da94-f270-4761-bd07-7264e30cae9f","resolution":{"observed_at":"2026-08-07T11:55:14.176931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:14.217550Z","title":"Decoupled momentum optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:14.217550Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:733628aa8256982a07e180684ab46d11fe852b6bcc41be52e9a3912446e79158","observation_id":"fc818491-3547-47da-94c9-deac8862c8f2","resolution":{"observed_at":"2026-08-07T11:55:14.217550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:17.499732Z","title":"Ai and compute","venue":null,"work_id":"353fcbed-12d6-447c-b43d-dc5e43a06492","year":null},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:14.258302Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:54cd6d464bf63960f8764c4aeac965578c9100d454697d4be92071abc8d15e05","observation_id":"23dbdad6-0ba3-4c34-afb7-f26c30eb8305","resolution":{"observed_at":"2026-08-07T11:55:17.532560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:14.298139Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:14.298139Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:4ac1e2043fc497c777dc359b088b455163d6066e3707ea28f6ba9a86be296e70","observation_id":"06aeac6e-0e51-469d-9d5e-ff5d00d31a4f","resolution":{"observed_at":"2026-08-07T11:55:14.298139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.10845","last_updated":"2023-03-20T03:39:27Z","snapshot_observed_at":"2026-08-07T00:30:20.086985Z","submitted_at":"2023-03-20T03:39:27Z","title":"PanGu-{\\Sigma}: Towards Trillion Parameter Language Model with Sparse Heterogeneous Computing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.10845","snapshot_observed_at":"2026-08-07T11:55:14.338207Z","title":"Pangu- \\ Sigma \\ : Towards trillion parameter language model with sparse heterogeneous computing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:14.338207Z"},"links":{"cited_paper":"/paper/2303.10845","citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:123a70358f15cc6420608e5b0072c5b557f1f1fbf95c0948b1b20874487a8b6f","observation_id":"084b05a6-4f5a-47db-801b-fb9d6b952adf","resolution":{"observed_at":"2026-08-07T11:55:14.338207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:17.406492Z","title":"Activations and gradients compression for model-parallel training","venue":null,"work_id":"b57dc72e-7e9d-4f12-a5ec-944dd5bc953c","year":2023},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:14.379343Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:6a8926e73508ca894082f39619763046bf13815964df1096d59d410d535887fa","observation_id":"95d26b16-c41d-4c86-b777-8211317f30dd","resolution":{"observed_at":"2026-08-07T11:55:17.445422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:17.316642Z","title":"Towards crowdsourced training of large neural networks using decentralized mixture-of-experts","venue":null,"work_id":"db3e7f43-cbd9-4b11-887f-966fe8fb232a","year":2020},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:14.444090Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:3c3d734ed4af3302a03cab88d22c832d0eabd58042c81928ba8d36837e67c9df","observation_id":"847e1442-37ef-42f9-b5bd-b2febdfc801f","resolution":{"observed_at":"2026-08-07T11:55:17.356432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:17.231965Z","title":"Moshpit sgd: Communication-efficient decentralized training on heterogeneous unreliable devices","venue":null,"work_id":"5eedfbad-4e63-4058-8542-364cab751ef9","year":2021},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:14.490832Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:41accd36d7af7e20cc34f158b0c104b6571149e34438541e4a29c8851715170a","observation_id":"ea379800-0903-4da6-9da1-a2b0399d6d36","resolution":{"observed_at":"2026-08-07T11:55:17.271867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:17.158363Z","title":"Swarm parallelism: Training large models can be surprisingly communication-efficient","venue":null,"work_id":"04845427-c5cf-404f-af01-bdbf1b2c8c8a","year":2023},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:14.539044Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:ab3d6603260246656b75276e5be3e549edd9947441c4ed5b1a3841c207aaa169","observation_id":"ea093586-11fc-473b-a71d-e4a9a660c855","resolution":{"observed_at":"2026-08-07T11:55:17.187559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:14.585859Z","title":"Inheritune: Training smaller yet more attentive language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:14.585859Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:6b1086e0901038dc77a2462fce20cd886919b1d47b88506a0586f569bf182f0d","observation_id":"01da2141-3467-4517-86e1-04d69921597a","resolution":{"observed_at":"2026-08-07T11:55:14.585859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T11:55:14.633452Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:14.633452Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:21388c24050949e5146fd05f03493135434ca0bf6688b2460eee7eabfd8e27da","observation_id":"28adb1f0-5240-469f-a239-f90147d83e63","resolution":{"observed_at":"2026-08-07T11:55:14.633452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:17.092014Z","title":"1-bit adam: Communication efficient large-scale training with adam’s convergence speed","venue":null,"work_id":"f5190e97-2073-4556-92c5-7137dfcab3d3","year":2021},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:14.675721Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:70f8313dac25049cf94d627020cf485cf164ae92b6bd11fd72b8384ee3691ad7","observation_id":"0c5ed812-b146-4583-acd0-2f391285cda7","resolution":{"observed_at":"2026-08-07T11:55:17.120045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:17.009705Z","title":"Scaling the summit: deploying the world’s fastest supercomputer","venue":null,"work_id":"ccecfa8e-ed68-4f0b-924e-db74d2bc6b00","year":2019},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:14.729222Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:cc467d9532493bbda42b80eea9c6b5f9ad23530500362dce4915b4aa17d0d05d","observation_id":"d3f47848-25af-49fb-8b0c-f25666683362","resolution":{"observed_at":"2026-08-07T11:55:17.055192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:14.772989Z","title":"Powersgd: Practical low-rank gradient compression for distributed optimization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:14.772989Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:550bde7ae31de4cddd2c72acc56ff1193c93945a070a26a4baf40a9a4d482747","observation_id":"3670813a-87e0-4f51-ae8f-e6a7fff0a382","resolution":{"observed_at":"2026-08-07T11:55:14.772989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12273","last_updated":"2018-10-29T17:42:39Z","snapshot_observed_at":"2026-07-06T07:11:13.925078Z","submitted_at":"2018-10-29T17:42:39Z","title":"Kalman Gradient Descent: Adaptive Variance Reduction in Stochastic Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12273","snapshot_observed_at":"2026-08-07T11:55:14.838055Z","title":"Kalman gradient descent: Adaptive variance reduction in stochastic optimization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:14.838055Z"},"links":{"cited_paper":"/paper/1810.12273","citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:e6b75408072c7e61c9c8d20b61009dff6723843bc28f652d70dffaceb920eccf","observation_id":"dcaaf8b2-61dc-427c-bae4-f0c9bf3f473a","resolution":{"observed_at":"2026-08-07T11:55:14.838055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:16.928785Z","title":"Variance reduction for stochastic gradient optimization","venue":null,"work_id":"b79c4713-0a1e-4aed-b244-bc2ac40a5673","year":2013},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:14.864069Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:c09c154efecec2edf0e74803aa8df1ded3f2e5bbfe49fca835b3d87c4e582d59","observation_id":"6874d0b4-192d-415b-96a5-3531593fc3fa","resolution":{"observed_at":"2026-08-07T11:55:16.949401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:16.849142Z","title":"Atomo: Communication-efficient learning via atomic sparsification","venue":null,"work_id":"c49fc75d-e244-4bfc-8252-ebf01d307418","year":2018},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:14.902786Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:984830a57054d3e7d22383be78321a8f3094888e7f2f540a49202723e436408a","observation_id":"7f84e35e-cba5-42b3-8109-1a64f96e43ab","resolution":{"observed_at":"2026-08-07T11:55:16.890495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:16.765294Z","title":"Pufferfish: Communication-efficient models at no extra cost","venue":null,"work_id":"1cfe2147-78a0-4c44-ac23-9d426d56b768","year":2021},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:14.942915Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:2f8877fb15d5837038f1b622a86c83b915acf426033e6c588ba7220737527c6d","observation_id":"cc829027-62a7-422f-915c-8e12a8b7961c","resolution":{"observed_at":"2026-08-07T11:55:16.804411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:16.678898Z","title":"Efficient distributed learning with sparsity","venue":null,"work_id":"cf991c23-212d-4497-999c-21cf1aa93011","year":2017},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:15.004690Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:ad68ef5955e3feee2d24d5b892b31b3cd327d8d1f8d3b28fa90847057690e01a","observation_id":"2193dd3a-4213-465e-b126-d8717960a4fe","resolution":{"observed_at":"2026-08-07T11:55:16.716469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:16.588730Z","title":"Cocktailsgd: Fine-tuning foundation models over 500mbps networks","venue":null,"work_id":"8af2a56f-21df-4388-a62e-90202f48287e","year":2023},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:15.041815Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:79cd8d19b3c2175db33d071d201bc8a78ee1912035565152f4eb03531cb4d252","observation_id":"d4b889cc-8acb-4882-82c0-a01bebc72cff","resolution":{"observed_at":"2026-08-07T11:55:16.633501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:16.505958Z","title":"Gradient sparsification for communication-efficient distributed optimization","venue":null,"work_id":"b91eb3d1-6347-42cf-8e24-3c2e6307478c","year":2018},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:15.092180Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:793d6fec68c3e6483d6f1c45fdd634a7809c1b5ba3f6aff3a76d69ff00efee0b","observation_id":"bc257cec-5b28-4b92-8d2c-e30af183a949","resolution":{"observed_at":"2026-08-07T11:55:16.537448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:16.347090Z","title":"Error compensated quantized sgd and its applications to large-scale distributed optimization","venue":null,"work_id":"bd7aa5bf-4477-4576-a54a-646b6ac453b8","year":2018},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:15.139453Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:8879be9fea8019a32280c3362858264c0e9db1511199cff16c4802700b52bfe4","observation_id":"74a6b4c1-4926-4340-bc05-6b093c11153f","resolution":{"observed_at":"2026-08-07T11:55:16.430575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17813","last_updated":"2024-05-14T00:10:33Z","snapshot_observed_at":"2026-07-06T16:39:16.652626Z","submitted_at":"2023-10-26T23:17:39Z","title":"A Spectral Condition for Feature Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17813","snapshot_observed_at":"2026-08-07T11:55:15.171300Z","title":"A spectral condition for feature learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:15.171300Z"},"links":{"cited_paper":"/paper/2310.17813","citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:e55f3f9da1a6d519277e529425965f6d19194a7108e3204cf05aba6bb6b583f1","observation_id":"d054a76c-f635-49b6-b8ac-0faffc2dc425","resolution":{"observed_at":"2026-08-07T11:55:15.171300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.12418","last_updated":"2021-05-15T01:53:12Z","snapshot_observed_at":"2026-08-02T19:38:09.844978Z","submitted_at":"2020-12-22T23:48:42Z","title":"Stochastic Gradient Variance Reduction by Solving a Filtering Problem","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.12418","snapshot_observed_at":"2026-08-07T11:55:15.205516Z","title":"Stochastic gradient variance reduction by solving a filtering problem","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:15.205516Z"},"links":{"cited_paper":"/paper/2012.12418","citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:eb145111fad12985217bf2b72c9862a7b2c9f3dfc6aab7bb28e7b195135f2407","observation_id":"fc8965be-0e92-426b-80f8-55b176dddbf8","resolution":{"observed_at":"2026-08-07T11:55:15.205516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:16.181423Z","title":"Decentralized training of foundation models in heterogeneous environments","venue":null,"work_id":"718f0859-6b3b-41ac-a3a9-3a85c6dcfecb","year":2022},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:15.244018Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:9ef82a38c7b03069dbfe3c610ed3a84f2cf42aace6b8f225cfad157945755398","observation_id":"e20f2efd-df6b-429e-8765-f24f65a631e5","resolution":{"observed_at":"2026-08-07T11:55:16.241381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01436","last_updated":"2025-03-08T20:11:54Z","snapshot_observed_at":"2026-07-06T17:54:11.726535Z","submitted_at":"2024-04-01T19:17:45Z","title":"Convergence Guarantees for RMSProp and Adam in Generalized-smooth Non-convex Optimization with Affine Noise Variance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01436","snapshot_observed_at":"2026-08-07T11:55:15.284168Z","title":"Convergence guarantees for rmsprop and adam in generalized-smooth non-convex optimization with affine noise variance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:15.284168Z"},"links":{"cited_paper":"/paper/2404.01436","citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:596f660803fc6c18deab0c510ec03d28c490e9009014861f54da42cc90892278","observation_id":"62d9db7f-7614-4cbd-9382-b7706f10294e","resolution":{"observed_at":"2026-08-07T11:55:15.284168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.12661","last_updated":"2022-11-04T17:17:26Z","snapshot_observed_at":"2026-07-06T12:01:14.487467Z","submitted_at":"2021-10-25T06:17:33Z","title":"ZerO Initialization: Initializing Neural Networks with only Zeros and Ones","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.12661","snapshot_observed_at":"2026-08-07T11:55:15.314868Z","title":"Zero initialization: Initializing neural networks with only zeros and ones","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:15.314868Z"},"links":{"cited_paper":"/paper/2110.12661","citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:2fe40b5b8d21d0d210bc75929d3ed4d025f04f574b9c824ec3ab7b03a47c9568","observation_id":"54ddbd28-fa93-40ef-a94b-65c092a6f745","resolution":{"observed_at":"2026-08-07T11:55:15.314868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03507","last_updated":"2024-06-02T21:24:12Z","snapshot_observed_at":"2026-07-06T17:40:15.746482Z","submitted_at":"2024-03-06T07:29:57Z","title":"GaLore: Memory-Efficient LLM Training by Gradient Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03507","snapshot_observed_at":"2026-08-07T11:55:15.366875Z","title":"Galore: Memory-efficient llm training by gradient low-rank projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:15.366875Z"},"links":{"cited_paper":"/paper/2403.03507","citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:c1d8498ce9e821b881b86dad77db5f79d308ac0b01448db4869ca311e039a5da","observation_id":"529c2762-7a6b-4c2d-b08d-0186b91e35ff","resolution":{"observed_at":"2026-08-07T11:55:15.366875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-07T11:55:15.412077Z","title":"Pytorch fsdp: experiences on scaling fully sharded data parallel","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:15.412077Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:1a646719aeac54ff63bbca70088f77a689d356c3c0f228bdd32982ecc91c8bca","observation_id":"03303144-9887-4265-b371-af3dcdde92c0","resolution":{"observed_at":"2026-08-07T11:55:15.412077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:16.059660Z","title":"Aligning books and movies: Towards story-like visual explanations by watching movies and reading books","venue":null,"work_id":"0656dfe9-52f8-44ca-9e87-8e958f5b9573","year":2015},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:15.447206Z"},"links":{"citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:4fc8a3bf252f8ab52a76e50a22ab94280205943a4a79653eec4015ba4de92ed5","observation_id":"84ae9fa8-ad4c-46f6-8881-7f811796074d","resolution":{"observed_at":"2026-08-07T11:55:16.124732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":1,"verified_fuzzy":32},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 3 inbound Pith citation observations for arXiv:2506.01260."}