{"as_of":"2026-08-07T22:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aae6523effcc2c0d05b20379c7051165e9b1acb86de12a62316e6c53176bec8d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":40,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:45:00.694739Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":7,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-07T15:45:00.694739Z","title":"Rusu, Rachita Chhaparia, Yani Donchev, Adhiguna Kuncoro, Marc'Aurelio Ranzato, Arthur Szlam, and Jiajun Shen","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14065","last_updated":"2025-05-20T08:11:42Z","snapshot_observed_at":"2026-08-07T15:39:01.366601Z","submitted_at":"2025-05-20T08:11:42Z","title":"Prime Collective Communications Library -- Technical Report","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:45:00.694739Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2505.14065"},"observation_digest":"sha256:696d436814dac7b443404d299b011ed5f51915234a35a47ae13dffe9b170375b","observation_id":"15ad925d-b52d-460d-877d-99fbcae9f9fa","resolution":{"observed_at":"2026-08-07T15:45:00.694739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-07T13:30:19.164843Z","title":"Diloco: Distributed low- communication training of language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21684","last_updated":"2025-05-27T19:11:22Z","snapshot_observed_at":"2026-08-07T19:56:38.719142Z","submitted_at":"2025-05-27T19:11:22Z","title":"Incentivizing Permissionless Distributed Learning of LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:19.164843Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2505.21684"},"observation_digest":"sha256:5a8127aea7f533a91ac6da3d140211a10a3b8d5ec2772b0ea2d938736bcf0dbb","observation_id":"071f1e30-5c6f-4492-bf64-3c50eca7c604","resolution":{"observed_at":"2026-08-07T13:30:19.164843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-07T13:13:21.194758Z","title":"Douillard, Q","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22549","last_updated":"2025-05-28T16:32:33Z","snapshot_observed_at":"2026-08-07T22:00:36.809838Z","submitted_at":"2025-05-28T16:32:33Z","title":"DES-LOC: Desynced Low Communication Adaptive Optimizers for Training Foundation Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:21.194758Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2505.22549"},"observation_digest":"sha256:cbbeb9e7210d585d6ab4245d1f3039c1be91950424f04b01b711d5cb853b6928","observation_id":"ec5ff9dd-d323-429c-b9ae-5d73bd6acdd0","resolution":{"observed_at":"2026-08-07T13:13:21.194758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-07T12:45:26.610592Z","title":"Diloco: Distributed low-communication training of language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23725","last_updated":"2026-06-02T01:19:21Z","snapshot_observed_at":"2026-08-07T12:36:41.591936Z","submitted_at":"2025-05-29T17:55:37Z","title":"MuLoCo: Muon is a practical inner optimizer for DiLoCo","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:26.610592Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2505.23725"},"observation_digest":"sha256:63f159c6f06b4f42a2455220a742eed30d49b1cd9fd5a084fcd71153e14e1c63","observation_id":"4449a919-5659-43e7-bf23-9d0dc44eb9a2","resolution":{"observed_at":"2026-08-07T12:45:26.610592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-07T11:55:13.360801Z","title":"Diloco: Distributed low-communication training of language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-07T11:44:19.535882Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:13.360801Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:8da918ea6f70455e69730d9be7b30ada91168fd74a4bdbcd66256ae719917547","observation_id":"6e906f3c-ff5a-495d-ab76-86472ce8777e","resolution":{"observed_at":"2026-08-07T11:55:13.360801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-07T11:17:08.727540Z","title":"https://arxiv.org/abs/2311.08105","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02965","last_updated":"2025-06-04T05:38:31Z","snapshot_observed_at":"2026-08-07T11:09:27.978189Z","submitted_at":"2025-06-03T15:00:18Z","title":"PC-MoE: Memory-Efficient and Privacy-Preserving Collaborative Training for Mixture-of-Experts LLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:08.727540Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2506.02965"},"observation_digest":"sha256:5bdc49a8505d6f194221f0e372e2d1e552f5b980a316fb7813add94b8a1edaac","observation_id":"76f073f6-21b1-4e85-aabd-74f486939cb4","resolution":{"observed_at":"2026-08-07T11:17:08.727540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-07T10:46:06.468296Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04531","last_updated":"2025-06-05T00:48:55Z","snapshot_observed_at":"2026-08-07T10:37:29.647793Z","submitted_at":"2025-06-05T00:48:55Z","title":"HALoS: Hierarchical Asynchronous Local SGD over Slow Networks for Geo-Distributed Large Language Model Training","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:46:06.468296Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2506.04531"},"observation_digest":"sha256:3e049c2f116b90227e058b47e2601365fa6806022cd01011bd40ef39d6c12246","observation_id":"416f7470-76d8-4077-8710-3ab49683b68f","resolution":{"observed_at":"2026-08-07T10:46:06.468296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-07T04:20:01.338312Z","title":"Diloco: Distributed low-communication training of language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:01.338312Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:4213be8aa370fba51e567f65002c78c2a378daa3872cd677fd409e5682b8b763","observation_id":"407c224f-5d82-43e0-9a22-a0ba775b36cf","resolution":{"observed_at":"2026-08-07T04:20:01.338312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-06T22:40:13.436255Z","title":"A., Chhaparia, R., Donchev, Y ., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-06T22:26:16.043178Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:13.436255Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2506.21263"},"observation_digest":"sha256:744b1cc3887f22da799310063a602622e3b43490f320cdb0751645e0bbf207e3","observation_id":"8549cf5b-dd06-4a11-98b6-9f82744c914d","resolution":{"observed_at":"2026-08-06T22:40:13.436255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2507.06542","last_updated":"2026-04-27T10:34:05Z","snapshot_observed_at":"2026-08-06T23:52:48.965163Z","submitted_at":"2025-07-09T04:56:56Z","title":"On the Surprising Effectiveness of a Single Global Merging in Decentralized Learning","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T05:39:53.088948Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2507.06542"},"observation_digest":"sha256:2c4fb0450b2ba17efddd1ddb34b9e1127fb13512fb142f24e3a707547c20a2bc","observation_id":"547be796-941e-40ce-aa18-496d59b245c6","resolution":{"observed_at":"2026-05-19T05:42:06.087985Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-06T19:00:00.918889Z","title":"Diloco: Distributed low- communication training of language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06931","last_updated":"2025-07-09T15:13:44Z","snapshot_observed_at":"2026-08-07T13:55:22.620397Z","submitted_at":"2025-07-09T15:13:44Z","title":"DICE: Data Influence Cascade in Decentralized Learning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:00.918889Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2507.06931"},"observation_digest":"sha256:d12996c862c6404cbb2671004c0568802da459df048d96d8d6170711eab68acf","observation_id":"4581f219-a55e-46eb-8f6f-dac9a32201d5","resolution":{"observed_at":"2026-08-06T19:00:00.918889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-06T18:37:45.531277Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07765","last_updated":"2025-07-10T13:43:15Z","snapshot_observed_at":"2026-08-07T22:00:37.033332Z","submitted_at":"2025-07-10T13:43:15Z","title":"Distributed and Decentralised Training: Technical Governance Challenges in a Shifting AI Landscape","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T18:37:45.531277Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2507.07765"},"observation_digest":"sha256:2ec78b28135ca23ddf6ddb2b545c068fc2f027ea91936b270bc0044e329c49af","observation_id":"ef29e758-7d1f-40ed-898a-be261a4fc9a9","resolution":{"observed_at":"2026-08-06T18:37:45.531277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-06T18:19:59.333518Z","title":"Douillard, Q","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09029","last_updated":"2026-05-31T02:40:58Z","snapshot_observed_at":"2026-08-06T18:03:36.091427Z","submitted_at":"2025-07-11T21:25:11Z","title":"Model Parallelism With Subnetwork Data Parallelism","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:59.333518Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2507.09029"},"observation_digest":"sha256:6f01bd8e8674694c1050693d454ead5c2c61d6c81ff53951ece5f865a06af40c","observation_id":"ee585c18-0e62-4758-9dbe-f2062d9917bb","resolution":{"observed_at":"2026-08-06T18:19:59.333518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-06T17:52:50.265538Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10618","last_updated":"2025-07-13T21:28:02Z","snapshot_observed_at":"2026-08-06T19:48:06.288712Z","submitted_at":"2025-07-13T21:28:02Z","title":"Compute Requirements for Algorithmic Innovation in Frontier AI Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:50.265538Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2507.10618"},"observation_digest":"sha256:4d525c6f0f07d87f8b482520841bb6158396d16e3e35a52db976aa8ac77d75b8","observation_id":"719527bf-0822-43b7-ac90-8e208eac7646","resolution":{"observed_at":"2026-08-06T17:52:50.265538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T17:50:42.327928Z","title":"Diloco: Distributed low- communication training of language models.arXiv preprint arXiv:2311.08105, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.15706","last_updated":"2026-07-23T09:18:31Z","snapshot_observed_at":"2026-08-07T19:57:01.269382Z","submitted_at":"2025-08-21T16:48:19Z","title":"Overcoming the Communication-Performance Tradeoff in LLM Pretraining","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T17:50:42.327928Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2508.15706"},"observation_digest":"sha256:1b026e1b66f557e414acf50c7ab25372bc07408691af985a332b1ec1b58cfb0f","observation_id":"56cd2afe-9f0a-41fd-a231-e5696fb4f400","resolution":{"observed_at":"2026-08-05T17:50:42.327928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T16:36:50.502069Z","title":"Rusu, Rachita Chhaparia, Yani Donchev, Adhiguna Kuncoro, Marc'Aurelio Ranzato, Arthur Szlam, and Jiajun Shen","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18182","last_updated":"2025-08-25T16:35:57Z","snapshot_observed_at":"2026-08-05T16:36:35.157558Z","submitted_at":"2025-08-25T16:35:57Z","title":"AdLoCo: adaptive batching significantly improves communications efficiency and convergence for Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T16:36:50.502069Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2508.18182"},"observation_digest":"sha256:dbb89748efdbb181915a6b5ee8a8fa1007a9429315fd5a79cc32683960384e25","observation_id":"d20fa830-0265-4a0b-8cef-3700bff4f7c1","resolution":{"observed_at":"2026-08-05T16:36:50.502069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-04T12:37:33.139636Z","title":"Diloco: Distributed low-communication training of language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03434","last_updated":"2026-07-31T16:40:13Z","snapshot_observed_at":"2026-08-05T23:14:15.176223Z","submitted_at":"2025-10-03T18:53:12Z","title":"Paris: A Decentralized Trained Open-Weight Diffusion Model","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T12:37:33.139636Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2510.03434"},"observation_digest":"sha256:9959b177d15c161aa0da6c2b89cdbe58a097b77d02f331174b2c6e3fe883bdec","observation_id":"735fd172-a4bc-4a6b-a7b2-3b5eb52e84cb","resolution":{"observed_at":"2026-08-04T12:37:33.139636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-03T21:00:25.350044Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19468","last_updated":"2026-06-17T09:31:06Z","snapshot_observed_at":"2026-08-03T21:00:24.229884Z","submitted_at":"2025-11-22T00:28:08Z","title":"Towards a future space-based, highly scalable AI infrastructure system design","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T21:00:25.350044Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2511.19468"},"observation_digest":"sha256:b3befd6c9e1fdafe266a3d1119dbddb2db5c4a7eb258f042e15cf845d437b108","observation_id":"ee686517-8e08-47fb-bea2-93f0aa6fde3e","resolution":{"observed_at":"2026-08-03T21:00:25.350044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2601.21972","last_updated":"2026-05-26T15:41:11Z","snapshot_observed_at":"2026-08-03T06:46:35.623443Z","submitted_at":"2026-01-29T16:50:30Z","title":"Learning Decentralized LLM Collaboration with Multi-Agent Actor Critic","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T09:47:47.051969Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2601.21972"},"observation_digest":"sha256:3f800d5b53a6670fcc4961925ac1e828a85db943218eeab9427ec4cef76e27f1","observation_id":"8affa5a0-6c2d-45ed-b5c8-488d36d803c2","resolution":{"observed_at":"2026-05-16T09:50:49.408158Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-03T06:46:38.886381Z","title":"A., Chhaparia, R., Donchev, Y ., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.21972","last_updated":"2026-05-26T15:41:11Z","snapshot_observed_at":"2026-08-03T06:46:35.623443Z","submitted_at":"2026-01-29T16:50:30Z","title":"Learning Decentralized LLM Collaboration with Multi-Agent Actor Critic","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:38.886381Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2601.21972"},"observation_digest":"sha256:23ac8c57fe0ce1e37adc9c7056fca609b9449227c531641dbbadab860434db23","observation_id":"14ec8947-395e-4b2e-8ba7-f4de7bc932a9","resolution":{"observed_at":"2026-08-03T06:46:38.886381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-03T04:44:55.319460Z","title":"A., Chhaparia, R., Donchev, Y ., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.04396","last_updated":"2026-06-17T18:22:54Z","snapshot_observed_at":"2026-08-06T09:19:41.876564Z","submitted_at":"2026-02-04T10:25:24Z","title":"LoRDO: Distributed Low-Rank Optimization with Infrequent Communication","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T04:44:55.319460Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2602.04396"},"observation_digest":"sha256:a23d05f2e1c58ce8f5faedb10c3153f4bc182982f5259ae17fe44a6cb9203e03","observation_id":"60c3ecbb-c895-41d5-9e0d-221fa60f8ccb","resolution":{"observed_at":"2026-08-03T04:44:55.319460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2604.21072","last_updated":"2026-05-05T16:09:43Z","snapshot_observed_at":"2026-07-06T23:07:41.856444Z","submitted_at":"2026-04-22T20:36:47Z","title":"Distributed Generative Inference of LLM at Internet Scales with Multi-Dimensional Communication Optimization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-09T23:01:56.712670Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2604.21072"},"observation_digest":"sha256:4a3f166c3629bc73f834b7e7490efe2b6378a51210727451a227ea0450f2b3f8","observation_id":"d1c9f7f1-8bbe-4e3c-baf0-9adfa6831473","resolution":{"observed_at":"2026-05-09T23:04:17.846136Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2604.24708","last_updated":"2026-04-27T17:17:28Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:17:28Z","title":"Scalable Hyperparameter-Divergent Ensemble Training with Automatic Learning Rate Exploration for Large Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T04:08:25.530778Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2604.24708"},"observation_digest":"sha256:2401bc1d643a558d0375152a9aa7a7249a7790e0417d83e29149de07081b903c","observation_id":"669f8d3c-b7c6-48da-a9fa-389612f0a24d","resolution":{"observed_at":"2026-05-11T21:51:20.305569Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2605.08871","last_updated":"2026-05-09T10:46:59Z","snapshot_observed_at":"2026-07-31T15:53:03.039634Z","submitted_at":"2026-05-09T10:46:59Z","title":"Rennala MVR: Improved Time Complexity for Parallel Stochastic Optimization via Momentum-Based Variance Reduction","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-12T01:51:20.003552Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2605.08871"},"observation_digest":"sha256:60e408071ccb872e59e98c825790a9d7e270c49094162a47eeaf849232708a6f","observation_id":"7d01d556-d04a-45ed-b874-a4ebec0d0f21","resolution":{"observed_at":"2026-05-12T07:51:31.493255Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2605.09126","last_updated":"2026-05-09T19:16:29Z","snapshot_observed_at":"2026-08-04T17:08:40.060316Z","submitted_at":"2026-05-09T19:16:29Z","title":"Cosine-Gated Adam-Decay: Drop-In Staleness-Aware Outer Optimization for Decoupled DiLoCo","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T02:30:11.470788Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2605.09126"},"observation_digest":"sha256:8c47e41c408d5abd38b18ad9b8aee7766bea0b6f7ee132739bc25b062ebae29f","observation_id":"da34be27-988f-409b-83a0-7ec12094c728","resolution":{"observed_at":"2026-05-12T02:31:16.903062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2605.11172","last_updated":"2026-05-11T19:30:47Z","snapshot_observed_at":"2026-07-06T23:23:02.025664Z","submitted_at":"2026-05-11T19:30:47Z","title":"Optimistic Dual Averaging Unifies Modern Optimizers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T05:52:16.805180Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2605.11172"},"observation_digest":"sha256:a90caaf121956a653f2eead84a4efa7dd6b344e53a0e7eb6afc36ae00256bfcd","observation_id":"4e08d48d-d067-4fd7-8043-523dfc129b2f","resolution":{"observed_at":"2026-05-13T05:52:21.837939Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2605.19095","last_updated":"2026-05-18T20:31:49Z","snapshot_observed_at":"2026-07-06T23:29:52.061489Z","submitted_at":"2026-05-18T20:31:49Z","title":"ScheduleFree+: Scaling Learning-Rate-Free & Schedule-Free Learning to Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-20T12:22:30.263086Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2605.19095"},"observation_digest":"sha256:a6afb6754e0a0b778b6ce46feea100cdafa5fcfbff73ddf824235b4154977556","observation_id":"0dbb234a-1f2d-48ae-8b63-af31aca8ebeb","resolution":{"observed_at":"2026-05-20T12:23:16.790219Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2605.24326","last_updated":"2026-05-23T01:11:19Z","snapshot_observed_at":"2026-07-06T23:34:23.087565Z","submitted_at":"2026-05-23T01:11:19Z","title":"ScaleAcross Explorer: Exploring Communication Optimization for Scale-Across AI Model Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T12:57:37.344369Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2605.24326"},"observation_digest":"sha256:4de8a91f358ea096d82bbda3c705ada33536cec87397c0b0f659c8643aafffab","observation_id":"f2347315-cd60-43e8-ad4c-7105119d1cd7","resolution":{"observed_at":"2026-06-30T13:04:40.496903Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2605.28585","last_updated":"2026-05-27T15:09:02Z","snapshot_observed_at":"2026-08-07T06:12:39.413721Z","submitted_at":"2026-05-27T15:09:02Z","title":"Outer-Momentum Restarting in High-Dimensional Two-Phase Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T13:31:23.664332Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2605.28585"},"observation_digest":"sha256:3712fcbe0be143aa8831c9d3cb84ac504b770f4c0c0ad4ac849c0a67fa4d7c8a","observation_id":"a9082207-48d1-4bc4-b2f5-e4ba2ba2779c","resolution":{"observed_at":"2026-06-29T13:33:27.499368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2606.01128","last_updated":"2026-05-31T10:02:15Z","snapshot_observed_at":"2026-08-07T15:58:31.574574Z","submitted_at":"2026-05-31T10:02:15Z","title":"Local MixVR: Breaking the Communication-Sample Dependence in Distributed Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T17:22:36.503465Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2606.01128"},"observation_digest":"sha256:66dfe6c765b8b11bebe2ce170060da46e16398f1993d86c233ab5bddd06ea29c","observation_id":"89e02c70-d3cc-40a7-a260-fd4ab45ed7d0","resolution":{"observed_at":"2026-07-01T21:16:14.072138Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2606.02958","last_updated":"2026-06-01T23:28:29Z","snapshot_observed_at":"2026-07-06T23:43:17.879245Z","submitted_at":"2026-06-01T23:28:29Z","title":"Echelon: Auditable Aggregate-Only Language-Model Adaptation Across Privacy Boundaries","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T13:38:48.333498Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2606.02958"},"observation_digest":"sha256:4d63eddd9da259c702c03530d2bfa7d828027937dbf8fd226c46b64d30d0ccf8","observation_id":"e18b6555-34f8-4f6c-96e7-27c2a768b362","resolution":{"observed_at":"2026-07-02T00:06:23.646181Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2606.05484","last_updated":"2026-06-03T22:10:16Z","snapshot_observed_at":"2026-07-06T23:45:28.379468Z","submitted_at":"2026-06-03T22:10:16Z","title":"Learned Subspace Compression for Communication-Efficient Pipeline Parallelism","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T06:41:58.301482Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2606.05484"},"observation_digest":"sha256:1c4d96bcde56dfa66d5f909a6088f375912ee6a5101634d97e87fe28b21763b4","observation_id":"cbdf6fdf-bd18-4ff0-8067-26d1d8d21a0d","resolution":{"observed_at":"2026-07-02T07:46:46.170228Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2606.11081","last_updated":"2026-06-09T16:40:54Z","snapshot_observed_at":"2026-08-03T08:40:34.396170Z","submitted_at":"2026-06-09T16:40:54Z","title":"Unifying Local Communications and Local Updates for LLM Pretraining","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T14:07:42.062805Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2606.11081"},"observation_digest":"sha256:2b64f754f4557106fd0ba89f201d37d6034c1d0db069f0c9075e6c76fb2be702","observation_id":"6c2cffcd-d7b8-49f4-a770-06a1de08f54f","resolution":{"observed_at":"2026-07-03T04:07:37.145086Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2606.19025","last_updated":"2026-06-20T12:18:17Z","snapshot_observed_at":"2026-08-04T11:35:50.051001Z","submitted_at":"2026-06-17T12:50:07Z","title":"FoMoE: Breaking the Full-Replica Barrier with a Federation of MoEs","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-06-26T21:25:15.709652Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2606.19025"},"observation_digest":"sha256:4796ff4d7d1c621cbd6f566d90d4a7e48c30663f707c7b433f0340cddd5f1163","observation_id":"a21a84fc-055c-42ac-af50-6b1ca4ac5690","resolution":{"observed_at":"2026-06-26T21:30:02.824990Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":"2311.08105","doi":"10.48550/arxiv.2311.08105","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A., Chhaparia, R., Donchev, Y., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":"arXiv (Cornell University)","work_id":"035ce0b0-a340-41e2-9dd3-f381ed1d7f7d","year":2023},"citing_paper":{"arxiv_id":"2606.24942","last_updated":"2026-06-22T20:50:05Z","snapshot_observed_at":"2026-08-02T03:45:42.319310Z","submitted_at":"2026-06-22T20:50:05Z","title":"Quantum-Resilient Decentralized AI Economies: Proof-of-Useful-Work and Post-Quantum Security","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T07:34:47.006198Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2606.24942"},"observation_digest":"sha256:92e759fe15f1d79c25c2cc9a31bb2cfb9074013d0d09286f31239eb6e84798b7","observation_id":"da0efcae-8cec-4d96-94fd-204f83bcd174","resolution":{"observed_at":"2026-07-04T11:49:50.890394Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.681334+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-07-12T12:16:10.904456Z","title":"and Chhaparia, Rachita and Donchev, Yani and Kuncoro, Adhiguna and Ranzato, Marc'Aurelio and Szlam, Arthur and Shen, Jiajun , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02544","last_updated":"2026-06-24T05:57:19Z","snapshot_observed_at":"2026-08-07T01:41:05.813944Z","submitted_at":"2026-06-24T05:57:19Z","title":"Not Every Sync Is Safe: Calibrated DiLoCo Scheduling for Shared AI Infrastructure","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-12T12:16:10.904456Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2607.02544"},"observation_digest":"sha256:6f201062db1e379b401b7e3f0b696d94a9b0988a364a0f62d7067a01ce50e088","observation_id":"49c6774a-1edd-4d97-bfe8-5f87a536ef4a","resolution":{"observed_at":"2026-07-12T12:16:10.904456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-07-14T12:46:51.615514Z","title":"Rusu, Rachita Chhaparia, Yani Donchev, Adhiguna Kuncoro, Marc’Aurelio Ranzato, Arthur Szlam, and Jiajun Shen","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10305","last_updated":"2026-07-11T13:23:06Z","snapshot_observed_at":"2026-08-03T02:30:45.447762Z","submitted_at":"2026-07-11T13:23:06Z","title":"Byzantine Accountability Without Consensus: Strong Eventual Consistency for Non-Associative, Stochastic, Robust Aggregation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T12:46:51.615514Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2607.10305"},"observation_digest":"sha256:c645aef724a8b2e06282cfa513e5eac9bc4ec25881334274f62f94a5a1946bc6","observation_id":"f05a57ea-6304-4234-a165-48f9392853ae","resolution":{"observed_at":"2026-07-14T12:46:51.615514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-02T01:23:30.172502Z","title":"Diloco: Distributed low- communication training of language models.arXiv preprint arXiv:2311.08105, 2023.(Cited on pages 2, 3, and 5)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14731","last_updated":"2026-07-16T08:56:45Z","snapshot_observed_at":"2026-08-03T18:32:12.673941Z","submitted_at":"2026-07-16T08:56:45Z","title":"What's in a Smoothness Constant? Tighter Rates for Local SGD with Bounded Second-order Heterogeneity","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T01:23:30.172502Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2607.14731"},"observation_digest":"sha256:1a6ea84b43777eb54ee92826ee39f97ae5b96d1ac5da8a843b507035cdfe7c6c","observation_id":"2148f948-01ab-44ea-bc42-d3748978e21f","resolution":{"observed_at":"2026-08-02T01:23:30.172502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-01T17:36:03.863586Z","title":"arXiv preprint arXiv:2311.08105 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18343","last_updated":"2026-07-20T07:03:03Z","snapshot_observed_at":"2026-08-04T13:02:40.700429Z","submitted_at":"2026-07-20T07:03:03Z","title":"Federated Lightweight Fine-Tuning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T17:36:03.863586Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2607.18343"},"observation_digest":"sha256:911611772623e5ee2a6e757897a6c592597ce9c92e0710ab97507f1f211669b1","observation_id":"19bc8e28-174c-4e81-9325-4f63e772b91f","resolution":{"observed_at":"2026-08-01T17:36:03.863586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-01T08:10:51.408706Z","title":"Douillard, Q","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21224","last_updated":"2026-07-23T11:39:21Z","snapshot_observed_at":"2026-08-07T09:45:10.594452Z","submitted_at":"2026-07-23T11:39:21Z","title":"Controlled Periodic Synchronization for Efficient Data-Parallel Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T08:10:51.408706Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2607.21224"},"observation_digest":"sha256:97e3f9594d2c95892b8e09ed8ed5276a7f351b0501040a7651368265b53671c1","observation_id":"6bfc9d83-eeff-4b6c-96eb-2155984c6f95","resolution":{"observed_at":"2026-08-01T08:10:51.408706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.08105/citation-record","integrity":"/paper/2311.08105/integrity","json":"/paper/2311.08105/citation-record.json","paper":"/paper/2311.08105"},"outbound":[],"paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 40 inbound Pith citation observations for arXiv:2311.08105."}