{"as_of":"2026-08-18T22:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2dcb838d7929157ed3919b004c798cdd24c2e3aa5a949ac9852b3ef46a14916d","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:39:02.104523Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T13:38:48.333498Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T00:06:23.692867Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.17672","last_updated":"2025-04-24T15:40:17Z","snapshot_observed_at":"2026-08-18T13:05:29.369165Z","submitted_at":"2025-04-24T15:40:17Z","title":"Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation","version":1},"cited_work":{"arxiv_id":"2504.17672","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.17672","snapshot_observed_at":"2026-07-02T00:06:23.692867Z","title":null,"venue":null,"work_id":"19fa84ee-a054-43ad-93ba-74ac473d9b68","year":2025},"citing_paper":{"arxiv_id":"2606.02958","last_updated":"2026-06-01T23:28:29Z","snapshot_observed_at":"2026-08-14T17:03:15.950355Z","submitted_at":"2026-06-01T23:28:29Z","title":"Echelon: Auditable Aggregate-Only Language-Model Adaptation Across Privacy Boundaries","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T13:38:48.333498Z"},"links":{"cited_paper":"/paper/2504.17672","citing_paper":"/paper/2606.02958"},"observation_digest":"sha256:0e5814748cb952df52707d693f5cea1320599e5d1c0c72e03962fab3301cd15a","observation_id":"27b34fac-b38b-4157-82b8-fef10d185a17","resolution":{"observed_at":"2026-07-02T00:06:23.694803Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.17672/citation-record","integrity":"/paper/2504.17672/integrity","json":"/paper/2504.17672/citation-record.json","paper":"/paper/2504.17672"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.06196","last_updated":"2025-03-23T14:51:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-09T05:37:09Z","title":"Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06196","snapshot_observed_at":"2026-08-16T10:39:01.971436Z","title":"Minaee, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17672","last_updated":"2025-04-24T15:40:17Z","snapshot_observed_at":"2026-08-18T13:05:29.369165Z","submitted_at":"2025-04-24T15:40:17Z","title":"Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T10:39:01.971436Z"},"links":{"cited_paper":"/paper/2402.06196","citing_paper":"/paper/2504.17672"},"observation_digest":"sha256:efe8fb8d36ec7771e2fb620a69389792a1bdb0b58c9aa1f6d7da317d740062c1","observation_id":"19667b00-3a8b-4adf-b226-ddd2b605da6c","resolution":{"observed_at":"2026-08-16T10:39:01.971436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:39:02.526531Z","title":"Efficient Large Scale Language Modeling with Mixtures of Experts,","venue":null,"work_id":"844298f9-278f-4ff3-83c6-c851c85fc36a","year":2022},"citing_paper":{"arxiv_id":"2504.17672","last_updated":"2025-04-24T15:40:17Z","snapshot_observed_at":"2026-08-18T13:05:29.369165Z","submitted_at":"2025-04-24T15:40:17Z","title":"Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T10:39:01.977020Z"},"links":{"citing_paper":"/paper/2504.17672"},"observation_digest":"sha256:d898ff5a065da9d772bedd7e78e24ed225605fbdc0a434cc2aba06100a115891","observation_id":"8420e8cb-162d-421e-a7bc-73ba3a81d05b","resolution":{"observed_at":"2026-08-16T10:39:02.530091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:39:02.511380Z","title":"Language Models Are Few-Shot Learners,","venue":null,"work_id":"a22f3dba-2954-4de1-9871-2d4a507f89bc","year":2020},"citing_paper":{"arxiv_id":"2504.17672","last_updated":"2025-04-24T15:40:17Z","snapshot_observed_at":"2026-08-18T13:05:29.369165Z","submitted_at":"2025-04-24T15:40:17Z","title":"Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T10:39:01.981858Z"},"links":{"citing_paper":"/paper/2504.17672"},"observation_digest":"sha256:ec585bb0edcfd5b2e313c59ae20e09f5ce0f594d342280a6d833464ec189ba98","observation_id":"0330fe44-4761-4847-8de4-9ed94131d4ea","resolution":{"observed_at":"2026-08-16T10:39:02.516345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:39:02.498491Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Mod- els Using Model Parallelism,","venue":null,"work_id":"4c61ae5b-e7c9-460d-ae9e-672dc379a694","year":2020},"citing_paper":{"arxiv_id":"2504.17672","last_updated":"2025-04-24T15:40:17Z","snapshot_observed_at":"2026-08-18T13:05:29.369165Z","submitted_at":"2025-04-24T15:40:17Z","title":"Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T10:39:01.986351Z"},"links":{"citing_paper":"/paper/2504.17672"},"observation_digest":"sha256:fae8db4df34bc1e3510447bef49f42e70286670bd67b09a830933818f6db42a8","observation_id":"69618d4e-c190-41d3-99ec-510cb844fec8","resolution":{"observed_at":"2026-08-16T10:39:02.502430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:39:02.484486Z","title":"PaLM: Scaling Language Modeling with Pathways,","venue":null,"work_id":"86d869fc-9e6e-43f3-88d6-cc0339c33de3","year":2022},"citing_paper":{"arxiv_id":"2504.17672","last_updated":"2025-04-24T15:40:17Z","snapshot_observed_at":"2026-08-18T13:05:29.369165Z","submitted_at":"2025-04-24T15:40:17Z","title":"Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T10:39:01.991947Z"},"links":{"citing_paper":"/paper/2504.17672"},"observation_digest":"sha256:f54e92e3256c3299c5158502117dad5a2aa6c4b0b6454327baa07dead8517c04","observation_id":"1f64304b-4bc9-440c-ac23-e8c33f1e1a13","resolution":{"observed_at":"2026-08-16T10:39:02.488543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:39:02.465645Z","title":"Multi-Datacenter Training: OpenAI’s Ambitious Plan to Beat Google’s Infrastructure,","venue":null,"work_id":"eab473be-edb6-45d1-ae1b-d24d336210c1","year":2024},"citing_paper":{"arxiv_id":"2504.17672","last_updated":"2025-04-24T15:40:17Z","snapshot_observed_at":"2026-08-18T13:05:29.369165Z","submitted_at":"2025-04-24T15:40:17Z","title":"Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T10:39:01.997807Z"},"links":{"citing_paper":"/paper/2504.17672"},"observation_digest":"sha256:594c0be243748243cbd9dad6ee00942e4a249846a1e16e01c09ec25fc0cc6e8a","observation_id":"aacc2f9f-c33a-48d6-8a14-e3d2c4ed6a9a","resolution":{"observed_at":"2026-08-16T10:39:02.474253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:39:02.002291Z","title":"Communication-Efficient Learning of Deep Networks from Decentralized Data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17672","last_updated":"2025-04-24T15:40:17Z","snapshot_observed_at":"2026-08-18T13:05:29.369165Z","submitted_at":"2025-04-24T15:40:17Z","title":"Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T10:39:02.002291Z"},"links":{"citing_paper":"/paper/2504.17672"},"observation_digest":"sha256:910a25fd68bf525a3551d7d3e1afe0fe41de80fb8cf2413d2554846edfcf16f3","observation_id":"89248a13-a43f-4986-a865-5edf1add277d","resolution":{"observed_at":"2026-08-16T10:39:02.002291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:39:02.433171Z","title":"Cross-Silo Federated Learning across Divergent Domains with Iterative Parameter Alignment,","venue":null,"work_id":"edda4579-20f8-4d0d-96f4-7625e787af83","year":2024},"citing_paper":{"arxiv_id":"2504.17672","last_updated":"2025-04-24T15:40:17Z","snapshot_observed_at":"2026-08-18T13:05:29.369165Z","submitted_at":"2025-04-24T15:40:17Z","title":"Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T10:39:02.007001Z"},"links":{"citing_paper":"/paper/2504.17672"},"observation_digest":"sha256:039c4928dc4a9636afab12073788b6aecd3ba39286996c5c662696d54c928e61","observation_id":"4e62a954-2698-4b70-bb8d-91e17512386f","resolution":{"observed_at":"2026-08-16T10:39:02.439539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:39:02.415739Z","title":"Communication-Efficient Large-Scale Distributed Deep Learning: A Comprehensive Survey,","venue":null,"work_id":"7f2b4dd6-c87c-41e3-8708-acd5cd5c52b8","year":2024},"citing_paper":{"arxiv_id":"2504.17672","last_updated":"2025-04-24T15:40:17Z","snapshot_observed_at":"2026-08-18T13:05:29.369165Z","submitted_at":"2025-04-24T15:40:17Z","title":"Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T10:39:02.012054Z"},"links":{"citing_paper":"/paper/2504.17672"},"observation_digest":"sha256:0c239f218dced8e6cd0676d5db0acfbcd9afac7cdb7fbf3e0d8d6f243483fc1f","observation_id":"72b8190e-b8c8-413c-b4b5-97dd3be827e2","resolution":{"observed_at":"2026-08-16T10:39:02.422878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:39:02.398428Z","title":"Measuring the Effects of Data Parallelism on Neural Network Training,","venue":null,"work_id":"db36265b-8b5a-4ac4-959c-efa155f69a2a","year":2019},"citing_paper":{"arxiv_id":"2504.17672","last_updated":"2025-04-24T15:40:17Z","snapshot_observed_at":"2026-08-18T13:05:29.369165Z","submitted_at":"2025-04-24T15:40:17Z","title":"Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T10:39:02.016391Z"},"links":{"citing_paper":"/paper/2504.17672"},"observation_digest":"sha256:deb2805d79d1fc595ffff574428baa9213be746f9f0e894f7455eee3836ca03a","observation_id":"9563ea96-01a8-4300-8bd0-df25863b544f","resolution":{"observed_at":"2026-08-16T10:39:02.402829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1604.00981","last_updated":"2017-03-21T07:44:39Z","snapshot_observed_at":"2026-08-14T22:03:08.190474Z","submitted_at":"2016-04-04T18:40:05Z","title":"Revisiting Distributed Synchronous SGD","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.00981","snapshot_observed_at":"2026-08-16T10:39:02.020746Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17672","last_updated":"2025-04-24T15:40:17Z","snapshot_observed_at":"2026-08-18T13:05:29.369165Z","submitted_at":"2025-04-24T15:40:17Z","title":"Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T10:39:02.020746Z"},"links":{"cited_paper":"/paper/1604.00981","citing_paper":"/paper/2504.17672"},"observation_digest":"sha256:0bf26e118a353efee9cdca704af4b02d42b7793b1d0e549eaea5639f14b0de82","observation_id":"903369d3-18e6-4fdc-8f2d-4e95c85ace36","resolution":{"observed_at":"2026-08-16T10:39:02.020746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-18T20:33:44.932427Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-16T10:39:02.026235Z","title":"Douillard, Q","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17672","last_updated":"2025-04-24T15:40:17Z","snapshot_observed_at":"2026-08-18T13:05:29.369165Z","submitted_at":"2025-04-24T15:40:17Z","title":"Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T10:39:02.026235Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2504.17672"},"observation_digest":"sha256:9a36186615767adefdee80883cac203b7d2180205bc5b1582dffbbbc7d4058fc","observation_id":"71a652a7-53d8-4c60-b46b-7335b1675d41","resolution":{"observed_at":"2026-08-16T10:39:02.026235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:39:02.383847Z","title":"OpenDiLoCo: An Open- Source Framework for Globally Distributed Low-Communication Train- ing,","venue":null,"work_id":"3be79d5f-93a0-43ea-9b2f-729e504d8679","year":2024},"citing_paper":{"arxiv_id":"2504.17672","last_updated":"2025-04-24T15:40:17Z","snapshot_observed_at":"2026-08-18T13:05:29.369165Z","submitted_at":"2025-04-24T15:40:17Z","title":"Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T10:39:02.034339Z"},"links":{"citing_paper":"/paper/2504.17672"},"observation_digest":"sha256:e36c6373a04823ac03a5fea433283cf58eef108a02fe3fe4766967c7e608192d","observation_id":"d6ae871b-6349-4cf8-a741-7f09fdd5ca8e","resolution":{"observed_at":"2026-08-16T10:39:02.388733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18512","last_updated":"2025-01-30T17:23:50Z","snapshot_observed_at":"2026-08-17T14:32:18.997308Z","submitted_at":"2025-01-30T17:23:50Z","title":"Streaming DiLoCo with overlapping communication: Towards a Distributed Free Lunch","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18512","snapshot_observed_at":"2026-08-16T10:39:02.038914Z","title":"Douillard, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17672","last_updated":"2025-04-24T15:40:17Z","snapshot_observed_at":"2026-08-18T13:05:29.369165Z","submitted_at":"2025-04-24T15:40:17Z","title":"Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T10:39:02.038914Z"},"links":{"cited_paper":"/paper/2501.18512","citing_paper":"/paper/2504.17672"},"observation_digest":"sha256:fdaaf7540f58901a8cdfb2d3123fe8a91bb58080df1c094659e7ecea7eec278b","observation_id":"f4955831-5178-43fc-a08f-109a560390eb","resolution":{"observed_at":"2026-08-16T10:39:02.038914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:39:02.370391Z","title":"PipeDream: Generalized Pipeline Parallelism for DNN Training,","venue":null,"work_id":"aaa429bf-1de5-456e-9af4-a403a399960c","year":2019},"citing_paper":{"arxiv_id":"2504.17672","last_updated":"2025-04-24T15:40:17Z","snapshot_observed_at":"2026-08-18T13:05:29.369165Z","submitted_at":"2025-04-24T15:40:17Z","title":"Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T10:39:02.044777Z"},"links":{"citing_paper":"/paper/2504.17672"},"observation_digest":"sha256:f16ca24e99a56c8139eed88fe19cc20f36a9b0b6524d4618988c6932a1e22309","observation_id":"902ea739-b1e3-4387-b267-5c71d3a208b0","resolution":{"observed_at":"2026-08-16T10:39:02.374917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:39:02.357745Z","title":"SAPipe: Staleness-Aware Pipeline for Data Parallel DNN Training,","venue":null,"work_id":"a77d501f-0de1-4612-9e74-27046b1c3746","year":2022},"citing_paper":{"arxiv_id":"2504.17672","last_updated":"2025-04-24T15:40:17Z","snapshot_observed_at":"2026-08-18T13:05:29.369165Z","submitted_at":"2025-04-24T15:40:17Z","title":"Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T10:39:02.050754Z"},"links":{"citing_paper":"/paper/2504.17672"},"observation_digest":"sha256:962e48eea815f61ec34b69a416b57b072fdc23ff8f059ac71fc5103641a43964","observation_id":"73b45ab4-dff9-488f-92ca-9f0ede352849","resolution":{"observed_at":"2026-08-16T10:39:02.361877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:39:02.344683Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM,","venue":null,"work_id":"7fa75840-6e34-4b1d-a9fa-56a3b5536d96","year":2021},"citing_paper":{"arxiv_id":"2504.17672","last_updated":"2025-04-24T15:40:17Z","snapshot_observed_at":"2026-08-18T13:05:29.369165Z","submitted_at":"2025-04-24T15:40:17Z","title":"Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T10:39:02.055515Z"},"links":{"citing_paper":"/paper/2504.17672"},"observation_digest":"sha256:c7a89b20bc7df7e3efe9f6cfb1339b824f1e17cf0460c764e360349a85df418b","observation_id":"d01c6aac-0324-4d5a-a593-4041c3cd3eaa","resolution":{"observed_at":"2026-08-16T10:39:02.349608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:39:02.330336Z","title":"Stragglers are not disaster: A hybrid federated learning algorithm with delayed gradients,","venue":null,"work_id":"f17ebb52-2c9b-4eea-9af6-944373470c97","year":2021},"citing_paper":{"arxiv_id":"2504.17672","last_updated":"2025-04-24T15:40:17Z","snapshot_observed_at":"2026-08-18T13:05:29.369165Z","submitted_at":"2025-04-24T15:40:17Z","title":"Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T10:39:02.060566Z"},"links":{"citing_paper":"/paper/2504.17672"},"observation_digest":"sha256:aeca0385d6debc790e816b69e74e1f4de16e3652acb25e609bb2b2211ae89a63","observation_id":"8dbdf998-ecb4-434f-b6a4-c969a26437aa","resolution":{"observed_at":"2026-08-16T10:39:02.335442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:39:02.317328Z","title":"Structured second-and higher-order derivatives through univariate taylor series,","venue":null,"work_id":"447d83a0-e3a0-4f05-8792-0b2efa28e16a","year":1993},"citing_paper":{"arxiv_id":"2504.17672","last_updated":"2025-04-24T15:40:17Z","snapshot_observed_at":"2026-08-18T13:05:29.369165Z","submitted_at":"2025-04-24T15:40:17Z","title":"Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T10:39:02.065542Z"},"links":{"citing_paper":"/paper/2504.17672"},"observation_digest":"sha256:a0157c9913b63ea13d485e0b23d3f4988d1acc8c886b0be00827b82be45eba7e","observation_id":"80847d9a-59e6-4a3e-a9e1-23d504039373","resolution":{"observed_at":"2026-08-16T10:39:02.321489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:39:02.302133Z","title":"Asynchronous Stochastic Gradient Descent with Delay Compensation,","venue":null,"work_id":"a9c474a8-63d7-4d02-9384-b087604b2d07","year":2020},"citing_paper":{"arxiv_id":"2504.17672","last_updated":"2025-04-24T15:40:17Z","snapshot_observed_at":"2026-08-18T13:05:29.369165Z","submitted_at":"2025-04-24T15:40:17Z","title":"Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T10:39:02.070038Z"},"links":{"citing_paper":"/paper/2504.17672"},"observation_digest":"sha256:7b4ad711355891757c6473eaeaa74a4ff730e1eb45bdd3402565ff5dd1cf5226","observation_id":"5c80019c-a8ff-4512-b3b5-850894328602","resolution":{"observed_at":"2026-08-16T10:39:02.306331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:39:02.288566Z","title":"DC-S3GD: Delay-Compensated Stale-Synchronous SGD for Large-Scale Decentralized Neural Network Training,","venue":null,"work_id":"9d8305e4-7f4b-4bca-bffb-3446b8a1fbdc","year":2019},"citing_paper":{"arxiv_id":"2504.17672","last_updated":"2025-04-24T15:40:17Z","snapshot_observed_at":"2026-08-18T13:05:29.369165Z","submitted_at":"2025-04-24T15:40:17Z","title":"Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T10:39:02.074166Z"},"links":{"citing_paper":"/paper/2504.17672"},"observation_digest":"sha256:3a26d8f0146ee250de47c6caa9b01a22ebbde2b472c9e1d1c36d309df5b09d0b","observation_id":"7d71ef85-ffdd-4ff3-bacd-cfc9c1b2fb19","resolution":{"observed_at":"2026-08-16T10:39:02.293117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:39:02.273834Z","title":"Asynchronous Training Schemes in Distributed Learning with Time Delay,","venue":null,"work_id":"f477d0b8-d46b-451d-894d-73faff882608","year":2023},"citing_paper":{"arxiv_id":"2504.17672","last_updated":"2025-04-24T15:40:17Z","snapshot_observed_at":"2026-08-18T13:05:29.369165Z","submitted_at":"2025-04-24T15:40:17Z","title":"Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T10:39:02.079067Z"},"links":{"citing_paper":"/paper/2504.17672"},"observation_digest":"sha256:2edb71bd2600df47646548cd1981b2852d44a918c5f84ea19a2ab4a1a4a57e58","observation_id":"2fed379c-98cc-4c5f-a1e6-35deb1a0398e","resolution":{"observed_at":"2026-08-16T10:39:02.278466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:39:02.260082Z","title":"The elements of statistical learning. vol. 1 Springer series in statistics,","venue":null,"work_id":"541352f5-bbb0-4466-b496-4bc97dceec86","year":2001},"citing_paper":{"arxiv_id":"2504.17672","last_updated":"2025-04-24T15:40:17Z","snapshot_observed_at":"2026-08-18T13:05:29.369165Z","submitted_at":"2025-04-24T15:40:17Z","title":"Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T10:39:02.083001Z"},"links":{"citing_paper":"/paper/2504.17672"},"observation_digest":"sha256:7d0c75b293af6703a22de3c25a7628be47ee98fc25d52ecb595774d5381b0ab5","observation_id":"ad6db2ab-6eb0-4bc5-94a0-d042d1edb667","resolution":{"observed_at":"2026-08-16T10:39:02.265338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:39:02.247800Z","title":"Natural Gradient Works Efficiently in Learning,","venue":null,"work_id":"dd2a440a-030c-46b1-a831-9c93c1cc4e60","year":1998},"citing_paper":{"arxiv_id":"2504.17672","last_updated":"2025-04-24T15:40:17Z","snapshot_observed_at":"2026-08-18T13:05:29.369165Z","submitted_at":"2025-04-24T15:40:17Z","title":"Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T10:39:02.087653Z"},"links":{"citing_paper":"/paper/2504.17672"},"observation_digest":"sha256:2a0d8c1da7de1676341021fa1e4de117f0439f9a6ea5bea073da2127b62d29b9","observation_id":"d5a88871-8c28-499e-b099-6cbc540a6d5d","resolution":{"observed_at":"2026-08-16T10:39:02.251663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:39:02.234773Z","title":"Pytorch distributed: Experiences on accelerating data parallel training,","venue":null,"work_id":"4587a552-b7e3-40a4-aa05-f4751a60e0d9","year":2020},"citing_paper":{"arxiv_id":"2504.17672","last_updated":"2025-04-24T15:40:17Z","snapshot_observed_at":"2026-08-18T13:05:29.369165Z","submitted_at":"2025-04-24T15:40:17Z","title":"Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T10:39:02.092078Z"},"links":{"citing_paper":"/paper/2504.17672"},"observation_digest":"sha256:7a76eb567bb1b87ebb760b9404424d9747c2c0d30b2c8104b35799751d05e830","observation_id":"f56e310b-99cb-4f90-87af-5edf26dbe0eb","resolution":{"observed_at":"2026-08-16T10:39:02.239568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:39:02.221351Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":"ead48024-cc22-4d27-862f-4d112f7637b6","year":2023},"citing_paper":{"arxiv_id":"2504.17672","last_updated":"2025-04-24T15:40:17Z","snapshot_observed_at":"2026-08-18T13:05:29.369165Z","submitted_at":"2025-04-24T15:40:17Z","title":"Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T10:39:02.096298Z"},"links":{"citing_paper":"/paper/2504.17672"},"observation_digest":"sha256:41d39304a4f8b205066fffa862c7903edfaec0b84d7592ed925f9e50830a9d21","observation_id":"f9d47580-75a1-4cf8-8a71-09c0b06afe54","resolution":{"observed_at":"2026-08-16T10:39:02.225593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:39:02.205967Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":"4053bc10-3564-4348-b773-5d70c3b521fa","year":2023},"citing_paper":{"arxiv_id":"2504.17672","last_updated":"2025-04-24T15:40:17Z","snapshot_observed_at":"2026-08-18T13:05:29.369165Z","submitted_at":"2025-04-24T15:40:17Z","title":"Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T10:39:02.100460Z"},"links":{"citing_paper":"/paper/2504.17672"},"observation_digest":"sha256:ec9036232ff04f96c72978215e8398f61670de497c088760a78d41015ad1682d","observation_id":"372aa781-d93a-434d-b9ce-fe31ffa56e5c","resolution":{"observed_at":"2026-08-16T10:39:02.210616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:39:02.188561Z","title":"A study of bfloat16 for deep learning training,","venue":null,"work_id":"afe95902-1759-439d-8d5a-8f8960a4aecc","year":2019},"citing_paper":{"arxiv_id":"2504.17672","last_updated":"2025-04-24T15:40:17Z","snapshot_observed_at":"2026-08-18T13:05:29.369165Z","submitted_at":"2025-04-24T15:40:17Z","title":"Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T10:39:02.104523Z"},"links":{"citing_paper":"/paper/2504.17672"},"observation_digest":"sha256:9201253a517e6cfd43dff35bd039335add03cbe1312bd9704e172441e69496d8","observation_id":"b6ac22cf-4272-44db-9b00-481f5a67f6db","resolution":{"observed_at":"2026-08-16T10:39:02.195213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.17672","last_updated":"2025-04-24T15:40:17Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-18T13:05:29.369165Z","submitted_at":"2025-04-24T15:40:17Z","title":"Cross-region Model Training with Communication-Computation Overlapping and Delay Compensation"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 1 inbound Pith citation observation for arXiv:2504.17672."}