{"as_of":"2026-08-07T21:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:77edb1ad191ae9053b0031f7178884e7a349744347e41cca4882d352d5770088","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:40:13.785408Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T04:44:55.885810Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T00:09:15.165598Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-06T22:26:16.043178Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21263","snapshot_observed_at":"2026-08-03T04:44:55.885810Z","title":"Dilocox: A low- communication large-scale training framework for de- centralized cluster.arXiv preprint arXiv:2506.21263,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.04396","last_updated":"2026-06-17T18:22:54Z","snapshot_observed_at":"2026-08-06T09:19:41.876564Z","submitted_at":"2026-02-04T10:25:24Z","title":"LoRDO: Distributed Low-Rank Optimization with Infrequent Communication","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T04:44:55.885810Z"},"links":{"cited_paper":"/paper/2506.21263","citing_paper":"/paper/2602.04396"},"observation_digest":"sha256:bed1d57cf9c383fc71a02895f4c4934c19828e8636d24b86eeb603ca498e828d","observation_id":"b0a1f4a5-444f-4928-a0d5-0d7f644bc7cd","resolution":{"observed_at":"2026-08-03T04:44:55.885810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-06T22:26:16.043178Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"cited_work":{"arxiv_id":"2506.21263","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21263","snapshot_observed_at":"2026-07-04T00:09:15.165598Z","title":"Dilocox: A low-communication large-scale training framework for decentralized cluster","venue":null,"work_id":"feb78ab9-3fcb-46a2-b91a-3e91b0ec274b","year":2025},"citing_paper":{"arxiv_id":"2606.19025","last_updated":"2026-06-20T12:18:17Z","snapshot_observed_at":"2026-08-04T11:35:50.051001Z","submitted_at":"2026-06-17T12:50:07Z","title":"FoMoE: Breaking the Full-Replica Barrier with a Federation of MoEs","version":2},"reference_index":131,"source":"arxiv_source","source_observed_at":"2026-06-26T21:25:15.709652Z"},"links":{"cited_paper":"/paper/2506.21263","citing_paper":"/paper/2606.19025"},"observation_digest":"sha256:0985b84472346cef10f6a230c6b415a32838f7f075d620ac29cbbef67513b05c","observation_id":"fbed2714-ad13-42f6-a330-a1da3b15ba6f","resolution":{"observed_at":"2026-07-04T00:09:15.167756Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.21263/citation-record","integrity":"/paper/2506.21263/integrity","json":"/paper/2506.21263/citation-record.json","paper":"/paper/2506.21263"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-06T22:40:13.252709Z","title":"A., Adeli, E., Altman, R., Arora, S., von Arx, S., Bernstein, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-06T22:26:16.043178Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:13.252709Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2506.21263"},"observation_digest":"sha256:2dfe3b3deb3d6b45b48da9424162f754d9b74904db3c8d965752b637b46d4775","observation_id":"9f1c84f6-ffa4-4f9d-84b9-0eaef4e66dff","resolution":{"observed_at":"2026-08-06T22:40:13.252709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-06T22:40:13.436255Z","title":"A., Chhaparia, R., Donchev, Y ., Kuncoro, A., Ranzato, M., Szlam, A., and Shen, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-06T22:26:16.043178Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:13.436255Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2506.21263"},"observation_digest":"sha256:744b1cc3887f22da799310063a602622e3b43490f320cdb0751645e0bbf207e3","observation_id":"8549cf5b-dd06-4a11-98b6-9f82744c914d","resolution":{"observed_at":"2026-08-06T22:40:13.436255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:40:13.523444Z","title":"Crafting papers on machine learning","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-06T22:26:16.043178Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:13.523444Z"},"links":{"citing_paper":"/paper/2506.21263"},"observation_digest":"sha256:fa76ecf4254a6cee71e91a5cf167624ab0b76f44e618d29040cfb14fdf955508","observation_id":"9528fa99-09b1-4bc9-a50c-3542a360415f","resolution":{"observed_at":"2026-08-06T22:40:13.523444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.13727","last_updated":"2020-02-18T14:13:56Z","snapshot_observed_at":"2026-08-03T23:32:37.116762Z","submitted_at":"2019-05-31T17:25:13Z","title":"PowerSGD: Practical Low-Rank Gradient Compression for Distributed Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.13727","snapshot_observed_at":"2026-08-06T22:40:13.682045Z","title":"Wang, H., Li, J., Wu, H., Hovy, E., and Sun, Y","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-06T22:26:16.043178Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:13.682045Z"},"links":{"cited_paper":"/paper/1905.13727","citing_paper":"/paper/2506.21263"},"observation_digest":"sha256:2ee264d820ef5dab37efece733d5ab4ffb86e59728e22578543bdeebb036477b","observation_id":"d415e8e9-6869-43ef-a2e7-c0c0f9839eca","resolution":{"observed_at":"2026-08-06T22:40:13.682045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.00119","last_updated":"2022-10-28T15:55:09Z","snapshot_observed_at":"2026-07-06T13:05:19.702730Z","submitted_at":"2022-04-30T00:55:29Z","title":"MiCS: Near-linear Scaling for Training Gigantic Model on Public Cloud","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.00119","snapshot_observed_at":"2026-08-06T22:40:13.736781Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-06T22:26:16.043178Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:13.736781Z"},"links":{"cited_paper":"/paper/2205.00119","citing_paper":"/paper/2506.21263"},"observation_digest":"sha256:2bc5c70241a0c8babd8a073498f9932439e5aa6445cb8c5a84fea908f18c8156","observation_id":"eb6af78d-5f49-40b9-a22b-54d9e8126298","resolution":{"observed_at":"2026-08-06T22:40:13.736781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-06T22:40:13.785408Z","title":"X., Zhou, K., Li, J., Tang, T., Wang, X., Hou, Y ., Min, Y ., Zhang, B., Zhang, J., Dong, Z., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-06T22:26:16.043178Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:13.785408Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2506.21263"},"observation_digest":"sha256:0af54707d976e0ca1f63f734d6a80992a8b5d6a8bedd350b9618184b8e905607","observation_id":"c16f3d0b-5aef-4d2a-bdf0-057f4e63b042","resolution":{"observed_at":"2026-08-06T22:40:13.785408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-06T22:40:13.565214Z","title":"Merity, S., Xiong, C., Bradbury, J., and Socher, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-06T22:26:16.043178Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"reference_index":2000,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:13.565214Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2506.21263"},"observation_digest":"sha256:b3fd40e3f1bbe58dac64d6d8f3758e5fa4aa2ca3f4d69ce6bb356e8a72657c65","observation_id":"de7a93ad-a5ca-4838-8bd9-30373a58e329","resolution":{"observed_at":"2026-08-06T22:40:13.565214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-06T22:40:13.643058Z","title":"Megatron-lm: Training multi- billion parameter language models using model paral- lelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-06T22:26:16.043178Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:13.643058Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2506.21263"},"observation_digest":"sha256:92d07122173d5422f8d21e6c3934518d3eaf15456e5de30493cf7109b7919790","observation_id":"eb463f6f-dc62-4044-8e27-e1a66ea2f5e7","resolution":{"observed_at":"2026-08-06T22:40:13.643058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.02132","last_updated":"2017-12-06T18:28:32Z","snapshot_observed_at":"2026-07-06T05:13:43.147966Z","submitted_at":"2016-10-07T03:44:34Z","title":"QSGD: Communication-Efficient SGD via Gradient Quantization and Encoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.02132","snapshot_observed_at":"2026-08-06T22:40:13.136132Z","title":"Alistarh, D., Hoefler, T., Johansson, M., Khirirat, S., Kon- stantinov, N., and Renggli, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-06T22:26:16.043178Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:13.136132Z"},"links":{"cited_paper":"/paper/1610.02132","citing_paper":"/paper/2506.21263"},"observation_digest":"sha256:f51bc3573ef34f85041a8dd89ab1afca5fbb87b10b3e25ec70decddc26fad7b6","observation_id":"a9fc2713-726f-4861-b362-8801425a4c50","resolution":{"observed_at":"2026-08-06T22:40:13.136132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.10505","last_updated":"2018-09-27T13:23:35Z","snapshot_observed_at":"2026-07-06T07:04:39.537654Z","submitted_at":"2018-09-27T13:23:35Z","title":"The Convergence of Sparsified Gradient Methods","version":1},"cited_work":{"arxiv_id":"1809.10505","doi":null,"metadata_source":"pith","pith_arxiv_id":"1809.10505","snapshot_observed_at":"2026-08-06T22:40:13.907534Z","title":"The Convergence of Sparsified Gradient Methods","venue":"cs.LG","work_id":"e0086c1a-f9f5-48b6-a904-0ea250191b63","year":2018},"citing_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-06T22:26:16.043178Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:13.176409Z"},"links":{"cited_paper":"/paper/1809.10505","citing_paper":"/paper/2506.21263"},"observation_digest":"sha256:e685279fefdf27e459f82e306afac706659eaa3df012c3f76b22c9362a885f46","observation_id":"852583dd-5db7-4651-bb32-9c0f5fc3dbce","resolution":{"observed_at":"2026-08-06T22:40:14.005772Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02054","last_updated":"2020-05-13T06:45:15Z","snapshot_observed_at":"2026-07-06T08:27:00.558613Z","submitted_at":"2019-10-04T17:29:39Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.02054","snapshot_observed_at":"2026-08-06T22:40:13.598804Z","title":"Rendle, S., Fetterly, D., Shekita, E","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-06T22:26:16.043178Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:13.598804Z"},"links":{"cited_paper":"/paper/1910.02054","citing_paper":"/paper/2506.21263"},"observation_digest":"sha256:dc9b4f372b63848999d241f3561a5e4c21475832b5ead00bb9d339e4e0522162","observation_id":"b427e7c6-2ce3-4342-9304-8d57dd793cc9","resolution":{"observed_at":"2026-08-06T22:40:13.598804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-06T22:40:13.301213Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-06T22:26:16.043178Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:13.301213Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2506.21263"},"observation_digest":"sha256:8f0f39e6f47b4ac6205e42275de843c5bc165aa9b763c9bf559ac4fd811a9321","observation_id":"d2c398b0-ccde-41b9-9fdb-27c90be31eab","resolution":{"observed_at":"2026-08-06T22:40:13.301213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07852","last_updated":"2024-07-10T17:13:17Z","snapshot_observed_at":"2026-08-03T21:39:52.555111Z","submitted_at":"2024-07-10T17:13:17Z","title":"OpenDiLoCo: An Open-Source Framework for Globally Distributed Low-Communication Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07852","snapshot_observed_at":"2026-08-06T22:40:13.488227Z","title":"M., and Hagemann, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-06T22:26:16.043178Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:13.488227Z"},"links":{"cited_paper":"/paper/2407.07852","citing_paper":"/paper/2506.21263"},"observation_digest":"sha256:42af747313ca85799def35526ae82b5402e4de74c2b2fceaa0047e895d4231e7","observation_id":"7db6d8c9-3376-48a1-8d07-981a35e2727e","resolution":{"observed_at":"2026-08-06T22:40:13.488227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T22:40:13.370660Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","snapshot_observed_at":"2026-08-06T22:26:16.043178Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:13.370660Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2506.21263"},"observation_digest":"sha256:256a4bcf54bca734ade54d78ab5ca7d1c6583e8c13eda16b8e3b49656baded8f","observation_id":"7d3cf74f-3194-43f7-bcfe-54803e81582a","resolution":{"observed_at":"2026-08-06T22:40:13.370660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.21263","last_updated":"2025-06-26T13:45:04Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T22:26:16.043178Z","submitted_at":"2025-06-26T13:45:04Z","title":"DiLoCoX: A Low-Communication Large-Scale Training Framework for Decentralized Cluster"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 2 inbound Pith citation observations for arXiv:2506.21263."}