{"as_of":"2026-08-10T11:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:371412360f13386f5147ebd1c30e2555f99a547c58b24bfe7fa4bb1a4916790d","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T17:50:42.853083Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:45:28.702340Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15706","snapshot_observed_at":"2026-08-07T12:45:28.702340Z","title":"Communication efficient LLM pre-training with sparseloco","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23725","last_updated":"2026-06-02T01:19:21Z","snapshot_observed_at":"2026-08-07T12:36:41.591936Z","submitted_at":"2025-05-29T17:55:37Z","title":"MuLoCo: Muon is a practical inner optimizer for DiLoCo","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:28.702340Z"},"links":{"cited_paper":"/paper/2508.15706","citing_paper":"/paper/2505.23725"},"observation_digest":"sha256:c7da8e2eeeac899034b3c6c49196511d6a2d1b62ee6daa34914a1abddf04a7d4","observation_id":"c154d6ed-ccdb-41eb-b8d5-14eba14dc59e","resolution":{"observed_at":"2026-08-07T12:45:28.702340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"cited_work":{"arxiv_id":"2508.15706","doi":"10.48550/arxiv.2508.15706","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.15706","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Communication efficient LLM pre-training with SparseLoCo","venue":"ArXiv.org","work_id":"55ed9ad5-b2b5-4b30-85f8-9c932ee25977","year":2025},"citing_paper":{"arxiv_id":"2602.03839","last_updated":"2026-05-19T16:03:06Z","snapshot_observed_at":"2026-07-06T22:44:23.981940Z","submitted_at":"2026-02-03T18:56:48Z","title":"Understanding and Exploiting Weight Update Sparsity for Communication-Efficient Distributed RL","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T13:37:20.114152Z"},"links":{"cited_paper":"/paper/2508.15706","citing_paper":"/paper/2602.03839"},"observation_digest":"sha256:7299a9dd44aaebedce1cf8df3dcc037bed79104be750a87ebc8ff07b0c7b2e3e","observation_id":"126fe051-41cf-4dbe-ad5b-43d896bd82b0","resolution":{"observed_at":"2026-07-24T02:22:54.639277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15706","snapshot_observed_at":"2026-08-03T04:44:55.982385Z","title":"Com- munication efficient LLM pre-training with sparseloco","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.04396","last_updated":"2026-06-17T18:22:54Z","snapshot_observed_at":"2026-08-08T18:55:31.308399Z","submitted_at":"2026-02-04T10:25:24Z","title":"LoRDO: Distributed Low-Rank Optimization with Infrequent Communication","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T04:44:55.982385Z"},"links":{"cited_paper":"/paper/2508.15706","citing_paper":"/paper/2602.04396"},"observation_digest":"sha256:04d9d59f7af1449a15295f2a9f4c1f9aefca1c036721c7394f404e645fd60b4c","observation_id":"a68ffe5a-ef00-452d-a16c-cbcc61f46106","resolution":{"observed_at":"2026-08-03T04:44:55.982385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"cited_work":{"arxiv_id":"2508.15706","doi":"10.48550/arxiv.2508.15706","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.15706","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Communication efficient LLM pre-training with SparseLoCo","venue":"ArXiv.org","work_id":"55ed9ad5-b2b5-4b30-85f8-9c932ee25977","year":2025},"citing_paper":{"arxiv_id":"2604.11947","last_updated":"2026-04-13T18:40:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T18:40:45Z","title":"ResBM: Residual Bottleneck Models for Low-Bandwidth Pipeline Parallelism","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:15.760164Z"},"links":{"cited_paper":"/paper/2508.15706","citing_paper":"/paper/2604.11947"},"observation_digest":"sha256:9d0daed6cf8b6ce3df8202946133e7653ecb14c0bc92b2bfe960e90d68ebbf15","observation_id":"c0dcd1dc-464b-4c46-84c0-ed2d084ad204","resolution":{"observed_at":"2026-07-24T02:22:54.639277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"cited_work":{"arxiv_id":"2508.15706","doi":"10.48550/arxiv.2508.15706","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.15706","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Communication efficient LLM pre-training with SparseLoCo","venue":"ArXiv.org","work_id":"55ed9ad5-b2b5-4b30-85f8-9c932ee25977","year":2025},"citing_paper":{"arxiv_id":"2605.06534","last_updated":"2026-05-20T11:37:51Z","snapshot_observed_at":"2026-08-03T06:43:16.351179Z","submitted_at":"2026-05-07T16:33:40Z","title":"ROSE: Rollout On Serving GPUs via Cooperative Elasticity for Agentic RL","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-08T05:14:14.168753Z"},"links":{"cited_paper":"/paper/2508.15706","citing_paper":"/paper/2605.06534"},"observation_digest":"sha256:bb7ab2a098b98392050e9bef2a8206ddae56afa4ccd664d7ad38eb2a1825a5d3","observation_id":"3646a5f2-e9f7-45ea-9aa6-f819aa2acaf6","resolution":{"observed_at":"2026-07-24T02:22:54.639277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"cited_work":{"arxiv_id":"2508.15706","doi":"10.48550/arxiv.2508.15706","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.15706","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Communication efficient LLM pre-training with SparseLoCo","venue":"ArXiv.org","work_id":"55ed9ad5-b2b5-4b30-85f8-9c932ee25977","year":2025},"citing_paper":{"arxiv_id":"2605.06534","last_updated":"2026-05-20T11:37:51Z","snapshot_observed_at":"2026-08-03T06:43:16.351179Z","submitted_at":"2026-05-07T16:33:40Z","title":"ROSE: Rollout On Serving GPUs via Cooperative Elasticity for Agentic RL","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-21T08:39:31.911497Z"},"links":{"cited_paper":"/paper/2508.15706","citing_paper":"/paper/2605.06534"},"observation_digest":"sha256:6c230cba12b3f55c238893b7a02e1bfe84bf192a578fb0afd57bd19b5bc97a5f","observation_id":"9fb95a3d-52ce-4a82-ad20-b73f8a39e7da","resolution":{"observed_at":"2026-07-24T02:22:54.639277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"cited_work":{"arxiv_id":"2508.15706","doi":"10.48550/arxiv.2508.15706","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.15706","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Communication efficient LLM pre-training with SparseLoCo","venue":"ArXiv.org","work_id":"55ed9ad5-b2b5-4b30-85f8-9c932ee25977","year":2025},"citing_paper":{"arxiv_id":"2606.05484","last_updated":"2026-06-03T22:10:16Z","snapshot_observed_at":"2026-08-08T18:26:57.970156Z","submitted_at":"2026-06-03T22:10:16Z","title":"Learned Subspace Compression for Communication-Efficient Pipeline Parallelism","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T06:41:58.301482Z"},"links":{"cited_paper":"/paper/2508.15706","citing_paper":"/paper/2606.05484"},"observation_digest":"sha256:e412990ae1ac4d78f764d2d94386952304017ba4d9551c1614574b2db4cc8916","observation_id":"6cc8a123-c7b5-4134-83e1-63c5c4fb1c83","resolution":{"observed_at":"2026-07-24T02:22:54.639277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"cited_work":{"arxiv_id":"2508.15706","doi":"10.48550/arxiv.2508.15706","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.15706","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Communication efficient LLM pre-training with SparseLoCo","venue":"ArXiv.org","work_id":"55ed9ad5-b2b5-4b30-85f8-9c932ee25977","year":2025},"citing_paper":{"arxiv_id":"2606.11081","last_updated":"2026-06-09T16:40:54Z","snapshot_observed_at":"2026-08-03T08:40:34.396170Z","submitted_at":"2026-06-09T16:40:54Z","title":"Unifying Local Communications and Local Updates for LLM Pretraining","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T14:07:42.062805Z"},"links":{"cited_paper":"/paper/2508.15706","citing_paper":"/paper/2606.11081"},"observation_digest":"sha256:f85bd60b59df21ae909c0d214a4a155a8f522600e5e93e26fdc74aaef21888f1","observation_id":"bc42eb0a-9ce7-46ac-9282-99f3de76e69b","resolution":{"observed_at":"2026-07-24T02:22:54.639277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"cited_work":{"arxiv_id":"2508.15706","doi":"10.48550/arxiv.2508.15706","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.15706","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Communication efficient LLM pre-training with SparseLoCo","venue":"ArXiv.org","work_id":"55ed9ad5-b2b5-4b30-85f8-9c932ee25977","year":2025},"citing_paper":{"arxiv_id":"2606.19025","last_updated":"2026-06-20T12:18:17Z","snapshot_observed_at":"2026-08-04T11:35:50.051001Z","submitted_at":"2026-06-17T12:50:07Z","title":"FoMoE: Breaking the Full-Replica Barrier with a Federation of MoEs","version":2},"reference_index":143,"source":"arxiv_source","source_observed_at":"2026-06-26T21:25:15.709652Z"},"links":{"cited_paper":"/paper/2508.15706","citing_paper":"/paper/2606.19025"},"observation_digest":"sha256:8451e0fd88a5f4bbf861d108b19ce68fbb242b90e5d8737e68a3e5f174dc905f","observation_id":"abe9d0ca-ee98-467a-870c-9ed1dcc00a57","resolution":{"observed_at":"2026-07-24T02:22:54.639277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.15706/citation-record","integrity":"/paper/2508.15706/integrity","json":"/paper/2508.15706/citation-record.json","paper":"/paper/2508.15706"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:43.313989Z","title":"16 Preprint Table 12: Final validation loss for the 178M model while varying the number of workers (R∈ {8,16,32}) and the communication interval (H∈ {15,50,100}).Bestis bold","venue":null,"work_id":"697476ba-27c3-412e-ae7f-d927372e14fe","year":2048},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.853083Z"},"links":{"citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:3617052c727955758887dd55873f73d7b1ba6a4972dd26aa63237d0c545f5cf3","observation_id":"6221515e-e182-4be1-823f-8309dee29e8b","resolution":{"observed_at":"2026-08-05T17:50:43.317668Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-05T17:50:42.630685Z","title":"Train- ing compute-optimal large language models.arXiv preprint arXiv:2203.15556,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.630685Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:e24b983efad8bf033e501e9823cdb5613d6e8a0a2a3c4b20c410cee2f327bc9d","observation_id":"02098e63-497e-48e5-b296-5fcc499f8ff9","resolution":{"observed_at":"2026-08-05T17:50:42.630685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01152","last_updated":"2024-12-02T05:52:32Z","snapshot_observed_at":"2026-08-10T06:47:37.804819Z","submitted_at":"2024-12-02T05:52:32Z","title":"INTELLECT-1 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01152","snapshot_observed_at":"2026-08-05T17:50:42.768010Z","title":"Charles- ´Etienne Joseph, Benjamin Th ´erien, Abhinav Moudgil, Boris Knyazev, and Eugene Belilovsky","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.768010Z"},"links":{"cited_paper":"/paper/2412.01152","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:ac300dff447e820c641c6643196e0d47021d0bd660ee6d65e6d64cad3b4886aa","observation_id":"63df926d-8e53-4189-88e7-22d9e4ffa8e5","resolution":{"observed_at":"2026-08-05T17:50:42.768010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13960","last_updated":"2023-04-27T05:41:13Z","snapshot_observed_at":"2026-08-02T07:55:35.655526Z","submitted_at":"2023-04-27T05:41:13Z","title":"Noise Is Not the Main Factor Behind the Gap Between SGD and Adam on Transformers, but Sign Descent Might Be","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13960","snapshot_observed_at":"2026-08-05T17:50:42.783058Z","title":"Noise is not the main factor behind the gap between sgd and adam on transformers, but sign descent might be","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.783058Z"},"links":{"cited_paper":"/paper/2304.13960","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:5bbdd131880547eee4e8c9a290763498aa71da1a554cee4fbc0c65b9b333ebcb","observation_id":"bf1d3653-3e5a-48ba-a4f7-dd2cbb1f5aa0","resolution":{"observed_at":"2026-08-05T17:50:42.783058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:43.394212Z","title":null,"venue":null,"work_id":"ad729f8c-7f9a-4b15-a502-e93ee574a4bd","year":2024},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.786073Z"},"links":{"citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:2f0a559b503b1867904f36d34a1a146b8abba0c557cccd9e474d188bd8d3720e","observation_id":"a45babaf-8826-4cf5-87ea-5c08e4a1d170","resolution":{"observed_at":"2026-08-05T17:50:43.397038Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:43.384592Z","title":"Shigang Li and Torsten Hoefler","venue":null,"work_id":"bb1e8f0f-9974-40f7-97d5-ff46d554f1dd","year":2024},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.789216Z"},"links":{"citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:8d155b8c3f210f522da77ef25c535ffe1e793454f9025df2c57a5131d0c48d28","observation_id":"77bef573-8aeb-4a55-b5b4-a2b3846e9218","resolution":{"observed_at":"2026-08-05T17:50:43.387707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:43.375587Z","title":"Federated optimization in heterogeneous networks","venue":null,"work_id":"116c9105-106c-47d1-bcba-6c0bc4ada5b4","year":2020},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.793019Z"},"links":{"citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:8498b697bd2bd8428803e9ea15eef03518fc62a6d2cfeb3228a626349e6df94e","observation_id":"1e9f20c1-531a-4430-ae6f-0a1001da84c6","resolution":{"observed_at":"2026-08-05T17:50:43.378489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21684","last_updated":"2025-05-27T19:11:22Z","snapshot_observed_at":"2026-08-07T19:56:38.719142Z","submitted_at":"2025-05-27T19:11:22Z","title":"Incentivizing Permissionless Distributed Learning of LLMs","version":1},"cited_work":{"arxiv_id":"2505.21684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.21684","snapshot_observed_at":"2026-08-05T17:50:43.158551Z","title":"Incentivizing Permissionless Distributed Learning of LLMs","venue":"cs.LG","work_id":"fdac7bc1-4bea-440b-9690-31584c849dcd","year":2025},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.795875Z"},"links":{"cited_paper":"/paper/2505.21684","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:d2dff091e049bed8dde6bae97819b4bf65f40c11b301bd94fe4246c04715b8d9","observation_id":"0c0f2604-2fcd-4c56-98ed-9444dc80d49b","resolution":{"observed_at":"2026-08-05T17:50:43.162053Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.07217","last_updated":"2020-02-17T11:42:10Z","snapshot_observed_at":"2026-08-09T03:16:31.553014Z","submitted_at":"2018-08-22T04:50:55Z","title":"Don't Use Large Mini-Batches, Use Local SGD","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.07217","snapshot_observed_at":"2026-08-05T17:50:42.798739Z","title":"Stich, and Martin Jaggi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.798739Z"},"links":{"cited_paper":"/paper/1808.07217","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:9d2a2b3f70626cca6610f7214c7c6344a59e03403ab2b41fe8f5c8fdebfb703c","observation_id":"b85900f8-f8d3-49e3-8353-904a2293331a","resolution":{"observed_at":"2026-08-05T17:50:42.798739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08133","last_updated":"2021-10-15T15:00:42Z","snapshot_observed_at":"2026-08-03T14:49:06.740593Z","submitted_at":"2021-10-15T15:00:42Z","title":"Trade-offs of Local SGD at Scale: An Empirical Study","version":1},"cited_work":{"arxiv_id":"2110.08133","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.08133","snapshot_observed_at":"2026-08-05T17:50:43.117651Z","title":"Trade-offs of Local SGD at Scale: An Empirical Study","venue":"cs.LG","work_id":"1ec9c1af-9ef5-472f-8622-87f6fcfdad69","year":2021},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.805050Z"},"links":{"cited_paper":"/paper/2110.08133","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:d357b00ae06fe479524e25fc3be72a365c997bac087227b9a2d21b225f5a9379","observation_id":"fd604448-d23b-4e34-a966-a2ad89c2f040","resolution":{"observed_at":"2026-08-05T17:50:43.123584Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.00295","last_updated":"2021-09-08T23:37:17Z","snapshot_observed_at":"2026-07-06T09:01:12.515300Z","submitted_at":"2020-02-29T16:37:29Z","title":"Adaptive Federated Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.00295","snapshot_observed_at":"2026-08-05T17:50:42.811192Z","title":"Adaptive federated optimization.arXiv preprint arXiv:2003.00295,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.811192Z"},"links":{"cited_paper":"/paper/2003.00295","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:b178d66cc4cc6471de43cbf3530a616a42e3aab6b854f9f10c895cafddac121b","observation_id":"76434ade-3f92-47d1-995a-cf1f69e543e0","resolution":{"observed_at":"2026-08-05T17:50:42.811192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:43.365951Z","title":"Fedpaq: A communication-efficient federated learning method with periodic averaging and quan- tization","venue":null,"work_id":"66a19e38-079f-42b5-b894-7a5931fc51ba","year":2020},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.814455Z"},"links":{"citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:f8aa271197fadbc7507fcc84348a77b5f2801eb13f39df2cc453099231dee3c8","observation_id":"4a93db86-469d-456f-8eb1-fbe2d0c37ee1","resolution":{"observed_at":"2026-08-05T17:50:43.369319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:43.354980Z","title":"Daniel Rothchild, Ashwinee Panda, Enayat Ullah, Nikita Ivkin, Ion Stoica, Vladimir Braverman, Joseph Gonzalez, and Raman Arora","venue":null,"work_id":"fe016071-4ff8-4e4a-80ef-1e4e53a79d29","year":2020},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.817061Z"},"links":{"citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:e813f37af956709e23deb6927ad0e7653ad5b9acfe2634fc4876a2ba751dbbd4","observation_id":"f54a0ab4-e55b-46fc-a858-74364dacdff9","resolution":{"observed_at":"2026-08-05T17:50:43.358390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:43.345422Z","title":"Frank Seide, Hao Fu, Jasha Droppo, Gang Li, and Dong Yu","venue":null,"work_id":"1bf1d304-3129-458d-81c8-eb80b3438879","year":2014},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.819836Z"},"links":{"citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:6085f103f2e02d78e56f12daacbeb0396728fa040ed43e4940554142b6c2606b","observation_id":"e9ceadcd-49c7-4772-b107-db8fe1eada13","resolution":{"observed_at":"2026-08-05T17:50:43.348698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.09767","last_updated":"2019-05-03T12:58:04Z","snapshot_observed_at":"2026-07-06T06:41:03.009337Z","submitted_at":"2018-05-24T16:38:51Z","title":"Local SGD Converges Fast and Communicates Little","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.09767","snapshot_observed_at":"2026-08-05T17:50:42.825545Z","title":"Local sgd converges fast and communicates little.arXiv preprint arXiv:1805.09767,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.825545Z"},"links":{"cited_paper":"/paper/1805.09767","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:3c6b94aa05e4721f9ad5bb3b840e02e06cc7843e9f4ba64c320e42a94674931a","observation_id":"cfda8956-9216-4fbf-abad-c3a3e96ce514","resolution":{"observed_at":"2026-08-05T17:50:42.825545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.05350","last_updated":"2021-06-16T15:44:47Z","snapshot_observed_at":"2026-08-10T03:02:49.223784Z","submitted_at":"2019-09-11T20:54:49Z","title":"The Error-Feedback Framework: Better Rates for SGD with Delayed Gradients and Compressed Communication","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.05350","snapshot_observed_at":"2026-08-05T17:50:42.832022Z","title":"Benjamin Th´erien, Xiaolong Huang, Irina Rish, and Eugene Belilovsky","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.832022Z"},"links":{"cited_paper":"/paper/1909.05350","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:6dcd369443fe4f359a0bf7ff28dc50b146d3c6d8b2f333714b533f04cd311362","observation_id":"c7b2f858-94bd-43c9-aaa2-4f663a26e2d7","resolution":{"observed_at":"2026-08-05T17:50:42.832022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23725","last_updated":"2026-06-02T01:19:21Z","snapshot_observed_at":"2026-08-07T12:36:41.591936Z","submitted_at":"2025-05-29T17:55:37Z","title":"MuLoCo: Muon is a practical inner optimizer for DiLoCo","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23725","snapshot_observed_at":"2026-08-05T17:50:42.834629Z","title":"Hugo Touvron, Louis Martin, Kevin Stone, Peter Albert, Amjad Almahairi, Yasmine Babaei, Niko- lay Bashlykov, Soumya Batra, Prajjwal Bhargava, Shruti Bhosale, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.834629Z"},"links":{"cited_paper":"/paper/2505.23725","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:0ef55a48ebd4285cd9791393373ef30c6de10af6e65155075ff4e704e2d59e2d","observation_id":"cfa86fd4-b77c-4429-a9d6-4c88b674ac0b","resolution":{"observed_at":"2026-08-05T17:50:42.834629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:43.333972Z","title":"Powersgd: Practical low-rank gra- dient compression for distributed optimization","venue":null,"work_id":"5ccaae24-2979-4a08-8130-3b307bb66842","year":2019},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.837941Z"},"links":{"citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:a12bcb52cf0ca02cb99c57ae959a97a80ec750c41b960f783429256767cfa2b4","observation_id":"bc7ce4e6-e092-4508-84f9-ee6e9fb245d7","resolution":{"observed_at":"2026-08-05T17:50:43.338673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00643","last_updated":"2020-02-19T20:00:02Z","snapshot_observed_at":"2026-08-06T13:30:13.145140Z","submitted_at":"2019-10-01T20:06:48Z","title":"SlowMo: Improving Communication-Efficient Distributed SGD with Slow Momentum","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00643","snapshot_observed_at":"2026-08-05T17:50:42.840735Z","title":"Jianyu Wang, Vinayak Tantia, Nicolas Ballas, and Michael G","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.840735Z"},"links":{"cited_paper":"/paper/1910.00643","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:32adf59503815c4292bd960739ecfcfc5cbf9bce189583b73c1962137c6cc76a","observation_id":"319545ff-8ff6-45a6-bd7d-c89389b22308","resolution":{"observed_at":"2026-08-05T17:50:42.840735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:42.843800Z","title":"12 Preprint Prateek Yadav, Derek Tam, Leshem Choshen, Colin Raffel, and Mohit Bansal","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.843800Z"},"links":{"citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:ff82fa6720e038c857362e423be38174bdb9a7b7c3887c1700f34eff40e02b3f","observation_id":"cb840401-95b0-47c9-8ce9-921e70a0c235","resolution":{"observed_at":"2026-08-05T17:50:42.843800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01708","last_updated":"2023-10-27T01:09:31Z","snapshot_observed_at":"2026-07-06T15:37:16.278040Z","submitted_at":"2023-06-02T17:31:32Z","title":"TIES-Merging: Resolving Interference When Merging Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01708","snapshot_observed_at":"2026-08-05T17:50:42.846515Z","title":"Hanzhen Zhao, Xingyu Xie, Cong Fang, and Zhouchen Lin","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.846515Z"},"links":{"cited_paper":"/paper/2306.01708","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:8aa34c7df785953e143c9d56227fed64eb08f30f2dc54b30adf46040adbfadbc","observation_id":"0b5e8ceb-46a3-4688-9858-41b8c4b4d0c1","resolution":{"observed_at":"2026-08-05T17:50:42.846515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:43.324177Z","title":null,"venue":null,"work_id":"e600211c-7f07-4601-9017-0a1444b3f87f","year":2024},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.850040Z"},"links":{"citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:56faa7265b931dfe0abd7ba2d437f7f42e3e05394e210f0aff3b2a156d1b75f7","observation_id":"22f7550f-3658-46d9-98b9-5618ee0a8859","resolution":{"observed_at":"2026-08-05T17:50:43.327078Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.08772","last_updated":"2019-11-20T08:50:59Z","snapshot_observed_at":"2026-08-08T15:30:46.445288Z","submitted_at":"2019-11-20T08:50:59Z","title":"Understanding Top-k Sparsification in Distributed Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.08772","snapshot_observed_at":"2026-08-05T17:50:42.822540Z","title":"2014-274","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.822540Z"},"links":{"cited_paper":"/paper/1911.08772","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:fdb49862ef8910a46f1cace9b89f099b5cc12b76a136500b68bf856abcf9615f","observation_id":"b4982b35-9e66-4f74-905e-e11c073a41fe","resolution":{"observed_at":"2026-08-05T17:50:42.822540Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:43.402894Z","title":"Ilyas Fatkhullin, Alexander Tyurin, and Peter Richt´arik","venue":null,"work_id":"64803f6b-8ccc-4041-a2d3-884412998d87","year":2023},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.460974Z"},"links":{"citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:2140e4aa33343b42fd179e8fdf29231131c27fb0527a5641bbf24736348f856a","observation_id":"9882bc39-c807-4627-80db-8146ef538214","resolution":{"observed_at":"2026-08-05T17:50:43.405846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02664","last_updated":"2022-05-19T18:18:32Z","snapshot_observed_at":"2026-07-06T12:25:37.802654Z","submitted_at":"2022-01-07T20:17:33Z","title":"Optimizing the Communication-Accuracy Trade-off in Federated Learning with Rate-Distortion Theory","version":3},"cited_work":{"arxiv_id":"2201.02664","doi":null,"metadata_source":"pith","pith_arxiv_id":"2201.02664","snapshot_observed_at":"2026-08-05T17:50:43.134471Z","title":"Optimizing the Communication-Accuracy Trade-off in Federated Learning with Rate-Distortion Theory","venue":"cs.LG","work_id":"08cddef4-920b-44ea-a411-5e82f0f27cf0","year":2022},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.801755Z"},"links":{"cited_paper":"/paper/2201.02664","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:fe9a7daf8714fbf91de49c7d082adb4882455b7b46e74b4fdf5cd1f9cbb112de","observation_id":"705b1671-64c1-4608-8a81-a1538f6a8306","resolution":{"observed_at":"2026-08-05T17:50:43.138006Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.09847","last_updated":"2019-05-29T12:57:30Z","snapshot_observed_at":"2026-07-06T07:29:30.878084Z","submitted_at":"2019-01-28T17:39:54Z","title":"Error Feedback Fixes SignSGD and other Gradient Compression Schemes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.09847","snapshot_observed_at":"2026-08-05T17:50:42.775569Z","title":"org/abs/1901.09847","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.775569Z"},"links":{"cited_paper":"/paper/1901.09847","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:2e06a14112dc5310aa1a708fc9b60e4c443ef713cecfec1b81e4e22a3964b23d","observation_id":"86d2e3ab-221c-43e8-9605-21c57eb89b87","resolution":{"observed_at":"2026-08-05T17:50:42.775569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.02527","last_updated":"2016-10-08T13:25:15Z","snapshot_observed_at":"2026-07-06T05:13:51.685562Z","submitted_at":"2016-10-08T13:25:15Z","title":"Federated Optimization: Distributed Machine Learning for On-Device Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.02527","snapshot_observed_at":"2026-08-05T17:50:42.779456Z","title":"Federated optimization: Distributed machine learning for on-device intelligence.arXiv preprint arXiv:1610.02527,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.779456Z"},"links":{"cited_paper":"/paper/1610.02527","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:7092a8730785d20faabf63617d63904af96fea9fbb2601468c3ad8e9088c511b","observation_id":"ee5d3247-a933-498e-a5b7-1107f4133822","resolution":{"observed_at":"2026-08-05T17:50:42.779456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:42.808173Z","title":"Decoupled momentum optimization.arXiv preprint arXiv:2411.19870,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.808173Z"},"links":{"citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:392ccfe1e93614825bce53e4e12858d0bdd4a2ad384fb2979c0726c5baa146a4","observation_id":"a3705fd5-2814-4ef8-82cf-5495a7ca8831","resolution":{"observed_at":"2026-08-05T17:50:42.808173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01152","last_updated":"2024-12-02T05:52:32Z","snapshot_observed_at":"2026-08-10T06:47:37.804819Z","submitted_at":"2024-12-02T05:52:32Z","title":"INTELLECT-1 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01152","snapshot_observed_at":"2026-08-05T17:50:42.668228Z","title":"INTELLECT-1 technical report.CoRR, abs/2412.01152,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.668228Z"},"links":{"cited_paper":"/paper/2412.01152","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:26ace885174eecae947762185206c117660e5d3b3263ff2f222094836a0877c6","observation_id":"e163af05-5ad3-4b11-9034-c2322da03950","resolution":{"observed_at":"2026-08-05T17:50:42.668228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17517","last_updated":"2024-05-27T09:02:57Z","snapshot_observed_at":"2026-08-06T23:48:10.947298Z","submitted_at":"2024-05-27T09:02:57Z","title":"WASH: Train your Ensemble with Communication-Efficient Weight Shuffling, then Average","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17517","snapshot_observed_at":"2026-08-05T17:50:42.528727Z","title":"Louis Fournier, Adel Nabli, Masih Aminbeidokhti, Marco Pedersoli, Eugene Belilovsky, and Edouard Oyallon","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.528727Z"},"links":{"cited_paper":"/paper/2405.17517","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:c0e94d6ff213f179df5d75da2298b294bb9ab555c60b745f7512efad7e668c31","observation_id":"2f595d93-b45a-42a4-8cd5-f81b06ca3339","resolution":{"observed_at":"2026-08-05T17:50:42.528727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T17:50:42.327928Z","title":"Diloco: Distributed low- communication training of language models.arXiv preprint arXiv:2311.08105, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.327928Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:1b026e1b66f557e414acf50c7ab25372bc07408691af985a332b1ec1b58cfb0f","observation_id":"56cd2afe-9f0a-41fd-a231-e5696fb4f400","resolution":{"observed_at":"2026-08-05T17:50:42.327928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:50:42.224878Z","title":"Debraj Basu, Deepesh Data, Can Karakus, and Suhas Diggavi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.224878Z"},"links":{"citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:374eaa60c6d8e051371c5f7afa91edb9f9bbc1508074e71259d9c23b1f73af54","observation_id":"89ce55a4-0b28-47c8-a9b6-6077f25d8c10","resolution":{"observed_at":"2026-08-05T17:50:42.224878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":20,"verified_exact":2,"verified_fuzzy":7},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 9 inbound Pith citation observations for arXiv:2508.15706."}