{"as_of":"2026-08-21T03:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b726a38a8c33e651318fcb8106e222c09dc69d3245027c89d015073e73f1cfb2","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":41,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:58:55.184891Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":647,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":"1712.01887","doi":"10.48550/arxiv.1712.01887","metadata_source":"pith","pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training","venue":"cs.CV","work_id":"d6d95b2f-ca12-43e9-bf95-2bc1d987d1a5","year":2017},"citing_paper":{"arxiv_id":"1806.00582","last_updated":"2022-07-21T12:33:15Z","snapshot_observed_at":"2026-08-20T14:11:46.485424Z","submitted_at":"2018-06-02T04:45:58Z","title":"Federated Learning with Non-IID Data","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T10:22:06.462020Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/1806.00582"},"observation_digest":"sha256:02775405cf9398479ce20bfb3c3fd1e3436c59e79dc6b21fe9f1066d386fbb61","observation_id":"5ed08ba6-1cac-4046-8539-77ed97a21f69","resolution":{"observed_at":"2026-05-16T10:22:06.497747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-14T14:08:44.259306Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.03673","last_updated":"2019-08-10T02:54:17Z","snapshot_observed_at":"2026-08-18T20:23:02.922415Z","submitted_at":"2019-08-10T02:54:17Z","title":"Recent Advances in Deep Learning for Object Detection","version":1},"reference_index":176,"source":"pdf_text","source_observed_at":"2026-08-14T14:08:44.259306Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/1908.03673"},"observation_digest":"sha256:4291c4d6fc06e57d6734cbc3fc1d41789f807730f87bbb5491ac226346ccac5f","observation_id":"cec23e4e-a5ec-468b-a1ef-24a81b36cc77","resolution":{"observed_at":"2026-08-14T14:08:44.259306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":"1712.01887","doi":"10.48550/arxiv.1712.01887","metadata_source":"pith","pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training","venue":"cs.CV","work_id":"d6d95b2f-ca12-43e9-bf95-2bc1d987d1a5","year":2017},"citing_paper":{"arxiv_id":"2303.05330","last_updated":"2023-03-09T15:21:47Z","snapshot_observed_at":"2026-08-14T23:27:40.350006Z","submitted_at":"2023-03-09T15:21:47Z","title":"Cloudless-Training: A Framework to Improve Efficiency of Geo-Distributed ML Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-24T09:15:33.705393Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2303.05330"},"observation_digest":"sha256:99d9d8d7eb4f8a63017507694505308d3c45a3695a48d34b2a0226f76f7a54ff","observation_id":"0b30077a-2717-4bd8-83e4-21cf3772c139","resolution":{"observed_at":"2026-05-24T09:16:06.455602Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-12T10:15:28.492178Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.19430","last_updated":"2025-05-20T09:53:52Z","snapshot_observed_at":"2026-08-12T12:58:18.519976Z","submitted_at":"2024-11-29T01:46:30Z","title":"Core Placement Optimization of Many-core Brain-Inspired Near-Storage Systems for Spiking Neural Network Training","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T10:15:28.492178Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2411.19430"},"observation_digest":"sha256:68ac86d026690c42a3521300d1889f863d62457c7e6fb7739db3fa1432240015","observation_id":"cd3dde52-7b2a-409d-aa56-34e5ba7b7931","resolution":{"observed_at":"2026-08-12T10:15:28.492178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-11T10:21:35.691985Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.16779","last_updated":"2024-12-21T21:24:58Z","snapshot_observed_at":"2026-08-15T03:43:41.325564Z","submitted_at":"2024-12-21T21:24:58Z","title":"Fed-ZOE: Communication-Efficient Over-the-Air Federated Learning via Zeroth-Order Estimation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T10:21:35.691985Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2412.16779"},"observation_digest":"sha256:f8a19a668bd05b4464f1bfa89b13350554664cbfd607dfd62351b3c5221f2daf","observation_id":"42347ea1-afe5-42e5-98c6-dfe36892bbce","resolution":{"observed_at":"2026-08-11T10:21:35.691985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-10T22:47:35.053063Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.00732","last_updated":"2025-01-01T05:28:58Z","snapshot_observed_at":"2026-08-16T00:52:43.815596Z","submitted_at":"2025-01-01T05:28:58Z","title":"Gradient Compression and Correlation Driven Federated Learning for Wireless Traffic Prediction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:47:35.053063Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2501.00732"},"observation_digest":"sha256:e89149f562fffca302bbb74c028b20eaaef83381828249fd92953ba086193863","observation_id":"03d3c6f0-2037-46a4-8a21-aa73d6109528","resolution":{"observed_at":"2026-08-10T22:47:35.053063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-09T23:17:19.793574Z","title":"Bo Liu, Rachita Chhaparia, Arthur Douillard, Satyen Kale, Andrei A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18512","last_updated":"2025-01-30T17:23:50Z","snapshot_observed_at":"2026-08-17T14:32:18.997308Z","submitted_at":"2025-01-30T17:23:50Z","title":"Streaming DiLoCo with overlapping communication: Towards a Distributed Free Lunch","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T23:17:19.793574Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2501.18512"},"observation_digest":"sha256:dcf82c8451c49129e521aa592dd48009603da038a88ccb2399c74dcc814cd620","observation_id":"37201c48-22da-4c05-ab9d-9fa16b5750bc","resolution":{"observed_at":"2026-08-09T23:17:19.793574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-09T06:02:19.086968Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.03092","last_updated":"2025-02-05T11:31:21Z","snapshot_observed_at":"2026-08-15T21:29:22.906415Z","submitted_at":"2025-02-05T11:31:21Z","title":"E-3SFC: Communication-Efficient Federated Learning with Double-way Features Synthesizing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T06:02:19.086968Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2502.03092"},"observation_digest":"sha256:238aadfa7c105d64db2bf3bdc6578a1d01ab361e9e40bcefdac2da85fe6fda5e","observation_id":"6ddfb64d-eaf0-4243-93af-79fef21a54a4","resolution":{"observed_at":"2026-08-09T06:02:19.086968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-11T20:27:44.223372Z","title":"Available: https://arxiv.org/abs/1712.01887v3","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-19T03:24:05.115076Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.223372Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:912fcacab94ca578d85554113f007ff517b9ed39b80e0881ac0aa5fe5b06220a","observation_id":"ddd575dc-c3f1-4931-9dbc-870bd0949c09","resolution":{"observed_at":"2026-08-11T20:27:44.223372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-15T23:58:55.184891Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.03388","last_updated":"2025-05-06T10:10:18Z","snapshot_observed_at":"2026-08-17T23:13:36.874256Z","submitted_at":"2025-05-06T10:10:18Z","title":"Memory-Efficient Distributed Unlearning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T23:58:55.184891Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2505.03388"},"observation_digest":"sha256:a90ef66e755c8400f8f31f71a09e2cad083bee410643ba4aacf9098e3d3e34fd","observation_id":"08c8de30-94ba-41a7-9005-06b0d67809e2","resolution":{"observed_at":"2026-08-15T23:58:55.184891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-15T20:44:29.643250Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.12242","last_updated":"2025-08-04T23:26:10Z","snapshot_observed_at":"2026-08-15T23:45:44.013107Z","submitted_at":"2025-05-18T05:38:49Z","title":"ZenFlow: Enabling Stall-Free Offloading Training via Asynchronous Updates","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:44:29.643250Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2505.12242"},"observation_digest":"sha256:cb9554f373fd83689d4c414b20f7a898b9cff7c19087580d1fe626dee658d24a","observation_id":"f16f335e-27c7-498f-b289-ee8e36b2f8a3","resolution":{"observed_at":"2026-08-15T20:44:29.643250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-07T13:58:00.222082Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23801","last_updated":"2025-05-26T20:58:13Z","snapshot_observed_at":"2026-08-14T20:21:04.309305Z","submitted_at":"2025-05-26T20:58:13Z","title":"SEMFED: Semantic-Aware Resource-Efficient Federated Learning for Heterogeneous NLP Tasks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:58:00.222082Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2505.23801"},"observation_digest":"sha256:2eb85622f62ee68f9befc76804dec95039b6afc0e7a7991f2d13008dfda8e12a","observation_id":"4a138edc-3637-4bdd-b3e3-05fe24fe21bf","resolution":{"observed_at":"2026-08-07T13:58:00.222082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-07T11:51:15.067642Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.01254","last_updated":"2026-07-04T05:17:09Z","snapshot_observed_at":"2026-08-15T09:48:35.365049Z","submitted_at":"2025-06-02T02:11:22Z","title":"Memory-Efficient FastText: A Comprehensive Approach Using Double-Array Trie Structures and Mark-Compact Memory Management","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:15.067642Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2506.01254"},"observation_digest":"sha256:4d0c6b325b1749dd98f3ac90a4cc3681c46776c9243ef41ba53da77ed54ee788","observation_id":"769d2595-d9d7-4fc0-8ca2-daec7d6b5789","resolution":{"observed_at":"2026-08-07T11:51:15.067642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-07T11:55:14.033583Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.01260","last_updated":"2026-07-09T08:54:09Z","snapshot_observed_at":"2026-08-14T23:29:06.877369Z","submitted_at":"2025-06-02T02:19:22Z","title":"Subspace Networks: Scaling Decentralized Training with Communication-Efficient Model Parallelism","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T11:55:14.033583Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2506.01260"},"observation_digest":"sha256:740f474fa448d5dd4443944c4aea8a63ff79f1effb297523088504a551118efc","observation_id":"e8cf2029-b266-4302-bfb0-99f8904247e0","resolution":{"observed_at":"2026-08-07T11:55:14.033583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-07T05:41:16.704750Z","title":"arXiv preprint arXiv:1712.01887 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07430","last_updated":"2025-06-09T05:04:20Z","snapshot_observed_at":"2026-08-16T11:00:42.553341Z","submitted_at":"2025-06-09T05:04:20Z","title":"Scalable Neural Quantum State based Kernel Polynomial Method for Optical Properties from the First Principle","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:16.704750Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2506.07430"},"observation_digest":"sha256:4a1ab5eed53d406fbf4df865bda816e8e6e84c731435b581d0c6169263dbcf23","observation_id":"4c6b1992-403b-47f4-84e0-615b580da0ed","resolution":{"observed_at":"2026-08-07T05:41:16.704750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":"1712.01887","doi":"10.48550/arxiv.1712.01887","metadata_source":"pith","pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training","venue":"cs.CV","work_id":"d6d95b2f-ca12-43e9-bf95-2bc1d987d1a5","year":2017},"citing_paper":{"arxiv_id":"2506.11563","last_updated":"2026-05-06T22:11:53Z","snapshot_observed_at":"2026-08-11T16:32:28.305431Z","submitted_at":"2025-06-13T08:17:07Z","title":"A Survey of Personalized Federated Foundation Models for Privacy-Preserving Recommendation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-19T09:28:32.185398Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2506.11563"},"observation_digest":"sha256:41ee6d2ac1d5f80577de2a73f7394760c92eec754477360781148690fcd684a2","observation_id":"61fb8007-abab-4ea0-83c4-e04b85979771","resolution":{"observed_at":"2026-05-19T09:32:16.512825Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-15T18:58:25.103644Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.18259","last_updated":"2025-06-23T03:19:05Z","snapshot_observed_at":"2026-08-15T18:50:38.422083Z","submitted_at":"2025-06-23T03:19:05Z","title":"Edge Association Strategies for Synthetic Data Empowered Hierarchical Federated Learning with Non-IID Data","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T18:58:25.103644Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2506.18259"},"observation_digest":"sha256:803873d37251baf23404b8bc5e31a637894458d4f22d8974db9bba1713009567","observation_id":"f0aebcd5-0bc1-4205-82bf-f4f2654d1306","resolution":{"observed_at":"2026-08-15T18:58:25.103644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-06T20:56:37.872506Z","title":"Deep gradient compression: Reducing the communication bandwidth for dis- tributed training","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.07114","last_updated":"2025-07-02T11:07:20Z","snapshot_observed_at":"2026-08-14T23:29:04.775468Z","submitted_at":"2025-07-02T11:07:20Z","title":"Distributed Training under Packet Loss","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:56:37.872506Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2507.07114"},"observation_digest":"sha256:5f3b3347a1bbfa20bcf0d3f778544051cdc37b79aa25de3be52ba576a039cd70","observation_id":"c014e535-acdb-47cc-ab10-f7294873730f","resolution":{"observed_at":"2026-08-06T20:56:37.872506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-06T15:31:31.685541Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.15816","last_updated":"2025-07-21T17:21:16Z","snapshot_observed_at":"2026-08-17T15:53:36.795746Z","submitted_at":"2025-07-21T17:21:16Z","title":"Federated Split Learning with Improved Communication and Storage Efficiency","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:31.685541Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2507.15816"},"observation_digest":"sha256:8f180c6082c099f188ffe05255cc50a7d2cef77d08de6605f37d2399d413b3bb","observation_id":"24b9d6d5-9bf0-416b-92fd-a0f0f37e0975","resolution":{"observed_at":"2026-08-06T15:31:31.685541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-06T15:55:07.994037Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.17772","last_updated":"2025-07-19T17:02:15Z","snapshot_observed_at":"2026-08-10T00:19:40.590376Z","submitted_at":"2025-07-19T17:02:15Z","title":"Caching Techniques for Reducing the Communication Cost of Federated Learning in IoT Environments","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:07.994037Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2507.17772"},"observation_digest":"sha256:86a1e627c15c38a6e9693a03e94c50cd4405d86682d8b01a986d6c0c859f8b09","observation_id":"c6870054-96e4-480e-98d4-870bec6528c9","resolution":{"observed_at":"2026-08-06T15:55:07.994037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":"1712.01887","doi":"10.48550/arxiv.1712.01887","metadata_source":"pith","pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training","venue":"cs.CV","work_id":"d6d95b2f-ca12-43e9-bf95-2bc1d987d1a5","year":2017},"citing_paper":{"arxiv_id":"2509.03472","last_updated":"2026-04-15T20:18:20Z","snapshot_observed_at":"2026-08-13T01:10:37.465737Z","submitted_at":"2025-09-03T16:51:26Z","title":"DPQuant: Efficient and Differentially-Private Model Training via Dynamic Quantization Scheduling","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T19:09:04.217591Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2509.03472"},"observation_digest":"sha256:29f5d376920acecb59a02f0b862a55c01ddd128e03245d921e8b81ac0cd9ab37","observation_id":"2a419403-8544-49a7-837c-028c121386b3","resolution":{"observed_at":"2026-05-18T19:11:46.558528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-04T21:12:52.601296Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08195","last_updated":"2025-09-09T23:59:20Z","snapshot_observed_at":"2026-08-18T23:02:38.802679Z","submitted_at":"2025-09-09T23:59:20Z","title":"Sketched Gaussian Mechanism for Private Federated Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T21:12:52.601296Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2509.08195"},"observation_digest":"sha256:ecd5a49a2db423f7ba8a6a7f6fae6b361302c5b9bee40408d2a20870095664d3","observation_id":"4fd12059-a8be-43c1-b2c4-3f461ff46945","resolution":{"observed_at":"2026-08-04T21:12:52.601296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-04T21:06:26.340168Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08233","last_updated":"2025-09-10T02:19:56Z","snapshot_observed_at":"2026-08-14T20:31:36.327522Z","submitted_at":"2025-09-10T02:19:56Z","title":"Strategies for Improving Communication Efficiency in Distributed and Federated Learning: Compression, Local Training, and Personalization","version":1},"reference_index":144,"source":"arxiv_source","source_observed_at":"2026-08-04T21:06:26.340168Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2509.08233"},"observation_digest":"sha256:e19c7fdfee552949330d7d73467cdf33b1b74d96355dc43d9e5bd11d5077c172","observation_id":"2f54f043-1329-4539-904d-01e09994e0d7","resolution":{"observed_at":"2026-08-04T21:06:26.340168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":"1712.01887","doi":"10.48550/arxiv.1712.01887","metadata_source":"pith","pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training","venue":"cs.CV","work_id":"d6d95b2f-ca12-43e9-bf95-2bc1d987d1a5","year":2017},"citing_paper":{"arxiv_id":"2602.00407","last_updated":"2026-05-06T23:56:25Z","snapshot_observed_at":"2026-08-11T14:29:38.308770Z","submitted_at":"2026-01-30T23:51:49Z","title":"Fed-Listing: Federated Label Distribution Inference in Graph Neural Networks","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-16T08:57:52.519507Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2602.00407"},"observation_digest":"sha256:f9a2dd28eaad17581a9d20fa7ab673e9880653d92042d07a7339394a52c9d4a8","observation_id":"2c895bdd-976a-4ab3-96ac-d9ee8f467488","resolution":{"observed_at":"2026-05-16T09:00:46.985742Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":"1712.01887","doi":"10.48550/arxiv.1712.01887","metadata_source":"pith","pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training","venue":"cs.CV","work_id":"d6d95b2f-ca12-43e9-bf95-2bc1d987d1a5","year":2017},"citing_paper":{"arxiv_id":"2604.02990","last_updated":"2026-04-03T11:54:23Z","snapshot_observed_at":"2026-08-15T13:35:07.828889Z","submitted_at":"2026-04-03T11:54:23Z","title":"FedSQ: Optimized Weight Averaging via Fixed Gating","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T20:09:24.740736Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2604.02990"},"observation_digest":"sha256:256e95da5957478d6749871b8ae938f62c0d29c79c6d1568199e9f7d6b833247","observation_id":"8c717c70-dee4-4a97-810b-9f2badc4d26a","resolution":{"observed_at":"2026-05-13T20:13:13.960049Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":"1712.01887","doi":"10.48550/arxiv.1712.01887","metadata_source":"pith","pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training","venue":"cs.CV","work_id":"d6d95b2f-ca12-43e9-bf95-2bc1d987d1a5","year":2017},"citing_paper":{"arxiv_id":"2604.17371","last_updated":"2026-04-19T10:55:04Z","snapshot_observed_at":"2026-08-14T01:33:27.082251Z","submitted_at":"2026-04-19T10:55:04Z","title":"Leveraging Kernel Symmetry for Joint Compression and Error Mitigation in Edge Model Transfer","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T06:13:02.774782Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2604.17371"},"observation_digest":"sha256:66d4acc2a36cd5625a3773eee378a5cc520c8f497ffff85a46dae3a0eb729d89","observation_id":"495a2f1d-f61c-4930-9216-a27bff2fd72d","resolution":{"observed_at":"2026-05-10T06:31:31.262749Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":"1712.01887","doi":"10.48550/arxiv.1712.01887","metadata_source":"pith","pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training","venue":"cs.CV","work_id":"d6d95b2f-ca12-43e9-bf95-2bc1d987d1a5","year":2017},"citing_paper":{"arxiv_id":"2604.23426","last_updated":"2026-04-25T19:43:05Z","snapshot_observed_at":"2026-08-14T10:02:02.097946Z","submitted_at":"2026-04-25T19:43:05Z","title":"Enhanced Privacy and Communication Efficiency in Non-IID Federated Learning with Adaptive Quantization and Differential Privacy","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T08:24:14.745888Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2604.23426"},"observation_digest":"sha256:f6d8df2e192c66b83b8d580a9dded4998392503e38353e3f61827d6457edf094","observation_id":"222dd35b-1a7d-4f93-a5ff-96c1f3c2fcc6","resolution":{"observed_at":"2026-05-11T20:41:09.408534Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":"1712.01887","doi":"10.48550/arxiv.1712.01887","metadata_source":"pith","pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training","venue":"cs.CV","work_id":"d6d95b2f-ca12-43e9-bf95-2bc1d987d1a5","year":2017},"citing_paper":{"arxiv_id":"2604.24088","last_updated":"2026-04-27T06:27:31Z","snapshot_observed_at":"2026-08-12T12:37:06.254147Z","submitted_at":"2026-04-27T06:27:31Z","title":"TACO: Efficient Communication Compression of Intermediate Tensors for Scalable Tensor-Parallel LLM Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-08T01:36:41.804171Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2604.24088"},"observation_digest":"sha256:56ee08b059f312d8c0e865ff73adfecd8e6894d420a3eb5277511ddd1e272753","observation_id":"82eb6d58-002b-44cf-a019-9762026b7011","resolution":{"observed_at":"2026-05-11T23:06:20.759902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":"1712.01887","doi":"10.48550/arxiv.1712.01887","metadata_source":"pith","pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training","venue":"cs.CV","work_id":"d6d95b2f-ca12-43e9-bf95-2bc1d987d1a5","year":2017},"citing_paper":{"arxiv_id":"2605.01989","last_updated":"2026-07-04T22:41:43Z","snapshot_observed_at":"2026-08-14T16:48:12.101366Z","submitted_at":"2026-05-03T17:47:53Z","title":"DBLP: Phase-Aware Bounded-Loss Transport for Burst-Resilient Distributed ML Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-09T17:25:11.543592Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2605.01989"},"observation_digest":"sha256:a0f766352539aa238eb91bfe1fbf848b7847fad1e2f255763b8ac4d066040162","observation_id":"b0db4bf4-94bd-413b-94dc-b2210d1e86c6","resolution":{"observed_at":"2026-05-11T16:21:07.197048Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":"1712.01887","doi":"10.48550/arxiv.1712.01887","metadata_source":"pith","pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training","venue":"cs.CV","work_id":"d6d95b2f-ca12-43e9-bf95-2bc1d987d1a5","year":2017},"citing_paper":{"arxiv_id":"2605.07795","last_updated":"2026-05-08T14:32:41Z","snapshot_observed_at":"2026-08-21T00:55:30.588261Z","submitted_at":"2026-05-08T14:32:41Z","title":"Scalable Distributed Stochastic Optimization via Bidirectional Compression: Beyond Pessimistic Limits","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-11T02:52:53.588595Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2605.07795"},"observation_digest":"sha256:aa0c7a23e5c17ddc7a07cdf3ceb20742827bac29543337709bc51a4d10e68359","observation_id":"746e95e0-8e91-47c3-898b-6b5846bb411f","resolution":{"observed_at":"2026-05-11T03:05:54.764286Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":"1712.01887","doi":"10.48550/arxiv.1712.01887","metadata_source":"pith","pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training","venue":"cs.CV","work_id":"d6d95b2f-ca12-43e9-bf95-2bc1d987d1a5","year":2017},"citing_paper":{"arxiv_id":"2605.08871","last_updated":"2026-05-09T10:46:59Z","snapshot_observed_at":"2026-08-11T12:27:08.580370Z","submitted_at":"2026-05-09T10:46:59Z","title":"Rennala MVR: Improved Time Complexity for Parallel Stochastic Optimization via Momentum-Based Variance Reduction","version":1},"reference_index":160,"source":"arxiv_source","source_observed_at":"2026-05-12T01:51:20.003552Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2605.08871"},"observation_digest":"sha256:c4a82944087f4973a26c35bf5d77b796acafbc83b44a65f848b0b910322f9bd7","observation_id":"f590372f-405a-47e7-97b4-3058cb53c6db","resolution":{"observed_at":"2026-05-12T07:51:30.623392Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":"1712.01887","doi":"10.48550/arxiv.1712.01887","metadata_source":"pith","pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training","venue":"cs.CV","work_id":"d6d95b2f-ca12-43e9-bf95-2bc1d987d1a5","year":2017},"citing_paper":{"arxiv_id":"2605.13434","last_updated":"2026-05-13T12:27:22Z","snapshot_observed_at":"2026-08-14T23:38:08.370551Z","submitted_at":"2026-05-13T12:27:22Z","title":"Rescaled Asynchronous SGD: Optimal Distributed Optimization under Data and System Heterogeneity","version":1},"reference_index":267,"source":"arxiv_source","source_observed_at":"2026-05-14T19:31:12.149482Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2605.13434"},"observation_digest":"sha256:776854bc4a31ae0b42575edd31cea09850c988067df612b0d2546810b2a2a68d","observation_id":"00d97344-f878-4bc3-bd73-1645f62d08a5","resolution":{"observed_at":"2026-05-14T19:32:52.048733Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":"1712.01887","doi":"10.48550/arxiv.1712.01887","metadata_source":"pith","pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training","venue":"cs.CV","work_id":"d6d95b2f-ca12-43e9-bf95-2bc1d987d1a5","year":2017},"citing_paper":{"arxiv_id":"2605.16311","last_updated":"2026-05-04T13:29:55Z","snapshot_observed_at":"2026-08-16T11:54:25.827061Z","submitted_at":"2026-05-04T13:29:55Z","title":"SignMuon: Communication-Efficient Distributed Muon Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T23:45:51.070668Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2605.16311"},"observation_digest":"sha256:692febd70a9e866001aedcb02c1d5c9784f412e30554390668483e129d9732c4","observation_id":"57808c18-8948-40d3-8ee5-ae66e5ad0eae","resolution":{"observed_at":"2026-05-20T23:49:15.245026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":"1712.01887","doi":"10.48550/arxiv.1712.01887","metadata_source":"pith","pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training","venue":"cs.CV","work_id":"d6d95b2f-ca12-43e9-bf95-2bc1d987d1a5","year":2017},"citing_paper":{"arxiv_id":"2605.18174","last_updated":"2026-05-18T10:18:02Z","snapshot_observed_at":"2026-08-15T08:55:48.785673Z","submitted_at":"2026-05-18T10:18:02Z","title":"Ringmaster LMO: Asynchronous Linear Minimization Oracle Momentum Method","version":1},"reference_index":162,"source":"arxiv_source","source_observed_at":"2026-05-20T13:08:52.912250Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2605.18174"},"observation_digest":"sha256:ac290e1ed40df987ae205ce2037547fdffba50976e801a0d6783aa1025706efa","observation_id":"f3ad827c-57de-4c76-807a-02a00c30f0b2","resolution":{"observed_at":"2026-05-20T13:13:18.463265Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":"1712.01887","doi":"10.48550/arxiv.1712.01887","metadata_source":"pith","pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training","venue":"cs.CV","work_id":"d6d95b2f-ca12-43e9-bf95-2bc1d987d1a5","year":2017},"citing_paper":{"arxiv_id":"2605.20866","last_updated":"2026-05-20T08:01:45Z","snapshot_observed_at":"2026-08-13T16:04:20.229116Z","submitted_at":"2026-05-20T08:01:45Z","title":"LOSCAR-SGD: Local SGD with Communication-Computation Overlap and Delay-Corrected Sparse Model Averaging","version":1},"reference_index":164,"source":"arxiv_source","source_observed_at":"2026-05-21T05:49:28.713982Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2605.20866"},"observation_digest":"sha256:3188f16ee038e6835f050bb175a79f65a741d1f649a2f5c47fdc24f20ef621aa","observation_id":"76a53691-91c3-4410-b383-fe17a28379da","resolution":{"observed_at":"2026-05-21T05:49:40.574766Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":"1712.01887","doi":"10.48550/arxiv.1712.01887","metadata_source":"pith","pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training","venue":"cs.CV","work_id":"d6d95b2f-ca12-43e9-bf95-2bc1d987d1a5","year":2017},"citing_paper":{"arxiv_id":"2605.22644","last_updated":"2026-05-21T15:50:40Z","snapshot_observed_at":"2026-08-16T20:55:32.393949Z","submitted_at":"2026-05-21T15:50:40Z","title":"Why SGD is not Brownian Motion: A New Perspective on Stochastic Dynamics","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-05-22T08:06:52.309619Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2605.22644"},"observation_digest":"sha256:43396a53989ba2ba6d6a68599c6a0c8871bb55628e88404bcc0e98988f9bd98a","observation_id":"493599fb-7080-4da8-a202-15fd88e5836c","resolution":{"observed_at":"2026-05-22T08:11:17.506023Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":"1712.01887","doi":"10.48550/arxiv.1712.01887","metadata_source":"pith","pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training","venue":"cs.CV","work_id":"d6d95b2f-ca12-43e9-bf95-2bc1d987d1a5","year":2017},"citing_paper":{"arxiv_id":"2606.24942","last_updated":"2026-06-22T20:50:05Z","snapshot_observed_at":"2026-08-14T10:31:56.697309Z","submitted_at":"2026-06-22T20:50:05Z","title":"Quantum-Resilient Decentralized AI Economies: Proof-of-Useful-Work and Post-Quantum Security","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T07:34:47.006198Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2606.24942"},"observation_digest":"sha256:b959b6561aa4f1899c0d1cd609592831509f5fd24c34fca480f19562fa2074f4","observation_id":"dc1949e0-241e-407c-baab-90b9320b6201","resolution":{"observed_at":"2026-07-04T11:49:50.880600Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":"1712.01887","doi":"10.48550/arxiv.1712.01887","metadata_source":"pith","pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training","venue":"cs.CV","work_id":"d6d95b2f-ca12-43e9-bf95-2bc1d987d1a5","year":2017},"citing_paper":{"arxiv_id":"2607.01678","last_updated":"2026-07-02T04:10:42Z","snapshot_observed_at":"2026-07-07T00:07:13.555571Z","submitted_at":"2026-07-02T04:10:42Z","title":"SCAPE: Accurate and Efficient LLM Training with Extreme Sparse Communication","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-03T17:56:52.510949Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2607.01678"},"observation_digest":"sha256:02bb4ba848991d9bca346a3079641a08b45f662a42aaa2bd2fb3d57c92cf1af0","observation_id":"f9a84408-9d1e-4a9f-9db6-ab99da4f5d8b","resolution":{"observed_at":"2026-07-03T17:58:46.567641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-07-11T15:21:14.811340Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.04676","last_updated":"2026-07-06T05:06:37Z","snapshot_observed_at":"2026-08-17T19:11:55.907649Z","submitted_at":"2026-07-06T05:06:37Z","title":"Adaptive Space-efficient Collectives for Dynamic and Unstructured Sparsity on GPU Platforms","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T15:21:14.811340Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2607.04676"},"observation_digest":"sha256:6271ead757127acc7959fd167786c791321319bd73918eb96b8f3c2f71b396c7","observation_id":"c2d0a988-d809-4a31-a29e-4b8125460c84","resolution":{"observed_at":"2026-07-11T15:21:14.811340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":"1712.01887","doi":"10.48550/arxiv.1712.01887","metadata_source":"pith","pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training","venue":"cs.CV","work_id":"d6d95b2f-ca12-43e9-bf95-2bc1d987d1a5","year":2017},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-15T04:18:15.955265Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:0af994d02fc8d9a08a1dfe708d3d4676ea7871b9b2ab7b462a8640a3f7d34772","observation_id":"cd1c83f9-abf0-49e7-af9b-d7af0fb478c3","resolution":{"observed_at":"2026-07-09T09:16:06.510183Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:34.86728+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-01T09:16:47.330488Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.22743","last_updated":"2026-07-23T01:50:54Z","snapshot_observed_at":"2026-08-18T18:27:13.884020Z","submitted_at":"2026-07-23T01:50:54Z","title":"QFedPolyp: A Communication- and Inference-Efficient Federated Learning Framework for Polyp Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T09:16:47.330488Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2607.22743"},"observation_digest":"sha256:28b5eae312f7b5558a67a26a6d8637af4e95b99da60e13678b66f36befbf8c48","observation_id":"7f6dd9ff-fd3c-4ea7-96ba-db17f07b05f4","resolution":{"observed_at":"2026-08-01T09:16:47.330488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1712.01887/citation-record","integrity":"/paper/1712.01887/integrity","json":"/paper/1712.01887/citation-record.json","paper":"/paper/1712.01887"},"outbound":[],"paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T15:24:54.289687Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 41 inbound Pith citation observations for arXiv:1712.01887."}