{"as_of":"2026-08-13T22:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:804985831b5b9b156bea69badcddc75e6f63241882de79c895a7a0ed3642b862","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T20:27:44.483880Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.07634/citation-record","integrity":"/paper/2502.07634/integrity","json":"/paper/2502.07634/citation-record.json","paper":"/paper/2502.07634"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:46.138420Z","title":"Document-Level Machine Translation with Large Language Models,","venue":null,"work_id":"27fe4d73-0881-457b-8b58-efa3bf79f502","year":2023},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.063463Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:a68863e573ca844bdf33e38d77bfa383a4bca5e45f9511e15fd85927aff952e4","observation_id":"493f9d5d-61bd-4d7c-af87-d2d76b64cf89","resolution":{"observed_at":"2026-08-11T20:27:46.142498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:44.079609Z","title":"Optimizing Statistical Machine Translation for Text Simplification,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.079609Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:ea1337a43d64b8ce82731e11d81f01893acaabb3995670930f4048a0cb6d2486","observation_id":"3f604a5c-8fa9-4d15-862a-9eae3d5f724c","resolution":{"observed_at":"2026-08-11T20:27:44.079609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:46.126038Z","title":"Neural machine translation by jointly learning to align and translate,","venue":null,"work_id":"0dde4d8e-e487-4a7c-a0e9-3f529e6e3c4b","year":2015},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.086175Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:003ee88073a2c9153fa21728570a413ceabb6656ed31094a4405e1d0c81ae71a","observation_id":"5ac47f92-e967-483d-854f-f8e190fbd85d","resolution":{"observed_at":"2026-08-11T20:27:46.130443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2019-1167","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:44.821862Z","title":"Guided source separation meets a strong ASR backend: Hitachi/Paderborn university joint investigation for dinner party ASR,","venue":null,"work_id":"8cfd75e5-a022-4ffb-a66d-68ba30140d9e","year":2019},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.114908Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:1cddce395c1e6c5e6e612ead1f61304d7a7058e25c7e01eae1cb233ab2ec5e55","observation_id":"4100f471-6dac-408a-a2c5-d43b3f95558d","resolution":{"observed_at":"2026-08-11T20:27:44.827268Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2019.88622","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:45.846881Z","title":"An Enhanced Human Speech Emotion Recognition Using Hybrid of PRNN and KNN,","venue":null,"work_id":"4b0bc5a6-3b7e-4e5f-a541-885f675feab8","year":2019},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.124609Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:afec145ab4de4e1f70d88f5595a83a72f7ed9adbec0d0774e836b47713fd37d9","observation_id":"ed0c5df4-e019-4e1e-9017-aa83fd6a6368","resolution":{"observed_at":"2026-08-11T20:27:45.853974Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0473","last_updated":"2016-05-19T21:53:22Z","snapshot_observed_at":"2026-08-12T12:07:33.202888Z","submitted_at":"2014-09-01T16:33:02Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.0473","snapshot_observed_at":"2026-08-11T20:27:44.093607Z","title":"Available: https://arxiv.org/abs/1409.0473v7","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.093607Z"},"links":{"cited_paper":"/paper/1409.0473","citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:0e465068db5c8ac634a27121036298cc601316ac529786ae290f735d4708a6f3","observation_id":"ce40d383-c3e6-4215-ba8b-4f6bbb44ace3","resolution":{"observed_at":"2026-08-11T20:27:44.093607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s41870-020-00513-w","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:44.805001Z","title":"Low-cost ultrasonic based object detection and collision avoidance method for autonomous robots,","venue":null,"work_id":"022a8200-cdc0-4cc3-be06-8558a5d93b74","year":2021},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.137396Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:acc65e10de87bae50d9d35e435054816d686c15852b7c6bf036e3d272430d843","observation_id":"8c462adb-6c91-4dca-9d83-57d6bd02ee8c","resolution":{"observed_at":"2026-08-11T20:27:44.810618Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:46.114081Z","title":"A Multitask, Multilingual, Multimodal Evaluation of ChatGPT on Reasoning, Hallucination, and Interactivity,","venue":null,"work_id":"194f7993-f544-4e4f-bf91-4567877487fe","year":2023},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.142529Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:5da136a4537d6fa0c2933398ba2deac1a5b26db3ba3b5100720fb91f6731a96d","observation_id":"bae6f356-8662-4635-a7b3-ceabd43f17d6","resolution":{"observed_at":"2026-08-11T20:27:46.118082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:44.131245Z","title":"Few-shot object detection via feature reweighting,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.131245Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:94693a7e17ee24469d3004d631dd7c082452f1d6834cea3c846814b8cc3d866a","observation_id":"7b7273a8-fd42-44f7-9ca8-daf70d2c2184","resolution":{"observed_at":"2026-08-11T20:27:44.131245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:44.159747Z","title":"Deep learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.159747Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:c211e4ad168cf9387a0f46fba7ca91461af23cc8b50d8e368f0f94fbe729c7ee","observation_id":"2a4da6ee-78e6-4ee4-b511-c042d6722e21","resolution":{"observed_at":"2026-08-11T20:27:44.159747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:46.102509Z","title":"Neural GPUs learn algorithms,","venue":null,"work_id":"ae5933fe-40cf-4a1f-93fa-ed761da7cfb0","year":2016},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.168667Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:54f37f3f253caf22736c005497dd54a2c1ed0cac3dc1137131c8bdd8f5d22ab3","observation_id":"d4411203-f053-40e0-9ca7-8c2b684e6db2","resolution":{"observed_at":"2026-08-11T20:27:46.106371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04023","last_updated":"2023-11-28T09:01:12Z","snapshot_observed_at":"2026-08-07T14:17:12.140094Z","submitted_at":"2023-02-08T12:35:34Z","title":"A Multitask, Multilingual, Multimodal Evaluation of ChatGPT on Reasoning, Hallucination, and Interactivity","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04023","snapshot_observed_at":"2026-08-11T20:27:44.148133Z","title":"Available: https://arxiv.org/abs/2302.04023v2","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.148133Z"},"links":{"cited_paper":"/paper/2302.04023","citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:9c84ff36501adef512144852a98bf659aa4178b4bc059772d1b7182844eaeead","observation_id":"6149c48d-8ca9-4758-aa80-2785a8b75bbc","resolution":{"observed_at":"2026-08-11T20:27:44.148133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:44.154963Z","title":"Incorporating Visual Information in Audio Based Self-Supervised Speaker Recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.154963Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:cb4b53470a3681af7c74c3a3794b1230008d5d2f787d81c5738d04559c83d6e6","observation_id":"48d0d54e-bdc0-4173-9934-b3354d1e17dc","resolution":{"observed_at":"2026-08-11T20:27:44.154963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:44.197693Z","title":"Clustered Federated Learning: Model-Agnostic Distributed Multitask Optimization under Privacy Constraints,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.197693Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:1575c753a110940f3719ae00ddbbd95d584d64c7070b2bd127da8aeb9bfe1735","observation_id":"526e9762-e8bb-4ef2-8c9d-ffe072c235fd","resolution":{"observed_at":"2026-08-11T20:27:44.197693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:46.089555Z","title":"IMPALA: Scalable Distributed Deep-RL with Importance Weighted Actor-Learner Architectures,","venue":null,"work_id":"c2f17e06-1fb3-4943-814b-bb49b22e1dbb","year":2018},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.202868Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:6799707028c321965eacf7f4f15cadc3cac7e28451ae521b7bccd5bfb59e2577","observation_id":"5ea27801-1a0b-4c27-b25c-7c233b2d5baf","resolution":{"observed_at":"2026-08-11T20:27:46.094852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.08228","last_updated":"2016-03-15T00:20:54Z","snapshot_observed_at":"2026-08-13T13:10:16.883465Z","submitted_at":"2015-11-25T21:17:43Z","title":"Neural GPUs Learn Algorithms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.08228","snapshot_observed_at":"2026-08-11T20:27:44.174736Z","title":"Available: https://arxiv.org/abs/1511.08228v3","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.174736Z"},"links":{"cited_paper":"/paper/1511.08228","citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:05a990f1babed7d2500f2de3e99725e74f7d293b99ceb1919d9be7d717a7ef7f","observation_id":"e740cc8e-1fd6-41aa-8d84-de1bec0c8cf2","resolution":{"observed_at":"2026-08-11T20:27:44.174736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:44.183194Z","title":"Pre-trained models for natural language processing: A survey,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.183194Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:29c38554237f6efac7df8bbe4331de62fe5cdc1680b0a5ebbeca0fb61d41c04d","observation_id":"484dfc70-0344-4cae-8fda-19b2ce93e4c7","resolution":{"observed_at":"2026-08-11T20:27:44.183194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.06567","last_updated":"2018-04-20T18:38:34Z","snapshot_observed_at":"2026-08-13T21:54:24.790625Z","submitted_at":"2017-12-18T18:22:05Z","title":"Deep Neuroevolution: Genetic Algorithms Are a Competitive Alternative for Training Deep Neural Networks for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.06567","snapshot_observed_at":"2026-08-11T20:27:44.190767Z","title":"Deep Neuroevolution: Genetic Algorithms Are a Competitive Alternative for Training Deep Neural Networks for Reinforcement Learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.190767Z"},"links":{"cited_paper":"/paper/1712.06567","citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:87a3cffe67e714d74fa05687878caee873852b435aa9639feafbd2702c07b1ee","observation_id":"b2111f65-dfae-40b1-902b-068daf8a78c8","resolution":{"observed_at":"2026-08-11T20:27:44.190767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2019.00748","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:45.329112Z","title":"Quantization networks,","venue":null,"work_id":"646b7de9-7805-437f-81a8-1f52808318bd","year":2019},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.238622Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:474d03ca3193b8ae1e29e7baa487f1c16cefae791dc649d7d662dfedee5bc44c","observation_id":"5e2d771a-d6f0-4c75-9645-0507e3c1c043","resolution":{"observed_at":"2026-08-11T20:27:45.335792Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:44.244592Z","title":"1-bit stochastic gradient descent and its application to data-parallel distributed training of speech DNNs,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.244592Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:4b6a32db2b5d0938cba6f92728bcd3661c9acd7be88171395445a8e43f053570","observation_id":"ba125e50-7933-481b-ad02-2812f04ad564","resolution":{"observed_at":"2026-08-11T20:27:44.244592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:46.150612Z","title":"This reduction is accomplished through the use of randomized rounding, which stochastically assigns gradient values to a set of discrete quantisation levels","venue":null,"work_id":"2931d5c4-7b98-473d-93ab-35f89f95f19a","year":null},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.054913Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:82cde56e970c903e78ea426e7aa503621ee96400fdb54ee50b9b90f6057aa7de","observation_id":"ace356d5-e458-4b19-946c-bb45146ac00b","resolution":{"observed_at":"2026-08-11T20:27:46.155247Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:44.207892Z","title":"An Incentive Mechanism Design for Efficient Edge Learning by Deep Reinforcement Learning Approach,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.207892Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:6a7e25da54baef5560237d4ccbba9e072e9cf280655c8385e8dc24ad8c41c6ec","observation_id":"d291b844-9670-45de-98b4-b3941debcbca","resolution":{"observed_at":"2026-08-11T20:27:44.207892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:46.077227Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training,","venue":null,"work_id":"5a4bf1a8-6243-4c52-8b81-9cda0c66c2a5","year":2018},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.216619Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:9896a284528250a8e68b086f1b76180c3dcf8c0b4e6193165df80d43e92c39d5","observation_id":"f6fbedf9-5e2c-446a-86df-237edbf6aeb3","resolution":{"observed_at":"2026-08-11T20:27:46.081354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.engstruct.2017.11.018","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:44.716541Z","title":"Computer vision for SHM of civil infrastructure: From dynamic response measurement to damage detection – A review,","venue":null,"work_id":"d306b2c0-5ce2-473e-ae05-66eb5d78c115","year":2018},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.273604Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:cd6f424a2f30593a4b9f2a8e8016d13d4ab6fbc94adc3fd0f9c9b8df5698e1cc","observation_id":"0ee40370-2341-41e9-ac46-c6bf961e2dff","resolution":{"observed_at":"2026-08-11T20:27:44.722395Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:44.284909Z","title":"Rethinking the Inception Architecture for Computer Vision,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.284909Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:19d3ec10cca9ea3aac5c2842e123f7b6727a4230918a289aa4680d07393c378c","observation_id":"5616a656-6253-4b29-a192-5e0bbb7678ae","resolution":{"observed_at":"2026-08-11T20:27:44.284909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:46.065074Z","title":"QSGD: Communication-efficient SGD via gradient quantization and encoding,","venue":null,"work_id":"57f5b803-5b51-4ce6-9e41-6669db2c626a","year":2017},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.254736Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:4afc581cf13ce78fa4c5b42d0e0611ed1aeeedb5f27dfe0dd30a17d4a8691505","observation_id":"ebffb303-7c37-4e9c-b684-b0392ffdfc29","resolution":{"observed_at":"2026-08-11T20:27:46.069441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:44.261164Z","title":"Multiagent systems: a survey from a machine learning perspective,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.261164Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:46ca475b4cb8176f2091503f9a8007c90e3f8cb059c3e20939e3de1efb45073e","observation_id":"f95f761c-2a75-4323-919b-1b0c53faca62","resolution":{"observed_at":"2026-08-11T20:27:44.261164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:44.265556Z","title":"A survey on deep learning and its applications,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.265556Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:3ccc9a42c0eb25299cf0807b2f0e57b1244761fa579efa42e1336c263b374284","observation_id":"7f9e6dc2-07b4-447c-aa8a-b1dd01bfc956","resolution":{"observed_at":"2026-08-11T20:27:44.265556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:44.310957Z","title":"PyTorch Distributed: Experiences on Accelerating Data Parallel Training,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.310957Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:8c75253baa68fa7365d7561a51b8968cb4b159676d6e126729401e59f7a69ff5","observation_id":"e55c9032-6182-4c4b-bf8b-2f5a05d7ea87","resolution":{"observed_at":"2026-08-11T20:27:44.310957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:46.049164Z","title":"Beyond Data and Model Parallelism for Deep Neural Networks,","venue":null,"work_id":"c41e5583-4ad0-4c00-ac1c-cdfb6395e015","year":2018},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.316600Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:1aca951fb2d505fd67496188cdab02361afa48a7f4944c87485acd187ab78418","observation_id":"b6107a81-8db8-48e4-8939-51ee12909a30","resolution":{"observed_at":"2026-08-11T20:27:46.054132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:44.298346Z","title":"A comaparative study of GPU programming models and architectures using neural networks,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.298346Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:2394378164bc65085f1e95c00112c6f2f3717d73c27075f00ff87a2b66d8d1b8","observation_id":"31a564b8-fb89-4449-a417-7bc83e958818","resolution":{"observed_at":"2026-08-11T20:27:44.298346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0277.28027","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:45.144323Z","title":"Models and Languages for Parallel Computation,","venue":null,"work_id":"193ea331-9353-4503-af54-258ab6f20bcf","year":1998},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.305837Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:9441a2c8be12883d3ca364c878432fd6825f5493745ab50d6a26705b190cbaf0","observation_id":"01b0467f-7cf3-4eae-a1a9-36b2d901fa5b","resolution":{"observed_at":"2026-08-11T20:27:45.151537Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:46.034879Z","title":"TicTac: Accelerating Distributed Deep Learning with Communication Scheduling,","venue":null,"work_id":"8b483a76-12e2-4e7b-b1be-cf928d310cbb","year":2018},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.350313Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:26c791282a75fa81bc1d223dc0cc34bc4d0aef009d42736777dc6aacd555719e","observation_id":"43532b44-7a96-4bed-9f69-9baffb1b433e","resolution":{"observed_at":"2026-08-11T20:27:46.039596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:46.022913Z","title":"Gradient sparsification for communication-efficient distributed optimization,","venue":null,"work_id":"cbe1d3ae-df28-499c-aaf9-215433850365","year":2018},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.360066Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:16ac8838db8ebfd98e43eb9c3c2fe234205bf2ad7a50aabe8ae0fedf845e5229","observation_id":"f31736aa-8d4c-41fc-89a5-e40169a03133","resolution":{"observed_at":"2026-08-11T20:27:46.027219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.05358","last_updated":"2018-07-14T08:44:31Z","snapshot_observed_at":"2026-08-01T22:07:23.820799Z","submitted_at":"2018-07-14T08:44:31Z","title":"Beyond Data and Model Parallelism for Deep Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.05358","snapshot_observed_at":"2026-08-11T20:27:44.327177Z","title":"Available: http://arxiv.org/abs/1807.05358","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.327177Z"},"links":{"cited_paper":"/paper/1807.05358","citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:096bcae3744aa498bc845c584d37e4aa51d311e5e2f71495fa2a1e9a0d57a236","observation_id":"0676aae4-d8e1-4056-9bdb-1c4c6b814320","resolution":{"observed_at":"2026-08-11T20:27:44.327177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3465170","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:44.674287Z","title":"Centralized, Distributed, and Everything in between: Reviewing Access Control Solutions for the IoT,","venue":null,"work_id":"d7184f48-7d63-415a-bb79-648c4f188274","year":2022},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.333360Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:413dcb256aadbf0429ea75f721a522795da1a490fe38d8620ab1d3e64798b124","observation_id":"624fcf87-7b82-4d7f-826f-66f43d08e22a","resolution":{"observed_at":"2026-08-11T20:27:44.679806Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-642-31513-8_43","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-13T11:03:48.094449Z","title":"Synchronization in distributed systems,","venue":"Advances in intelligent systems and computing","work_id":"b849ecb9-91b1-4c21-bf77-85b9df86bcfb","year":2012},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.345247Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:88a97ce011281956ef08926fccf0e878dedce7c20f31d3458e1c6b85e167b4f2","observation_id":"e3843f20-c150-49a8-9370-9223dce0178b","resolution":{"observed_at":"2026-08-11T20:27:44.663676Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:45.996592Z","title":"Sparsified SGD with memory,","venue":null,"work_id":"99420362-a728-4a06-a033-781ed2b7b996","year":2018},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.381993Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:72fa1a80653cd2690caef2f028ed05284e0199feee9cc6caf8300e55e397dec8","observation_id":"8087a9cd-2df9-49f5-ab25-7bd718b04b15","resolution":{"observed_at":"2026-08-11T20:27:46.000732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v32i1.11728","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:44.604761Z","title":"AdaComp : Adaptive Residual Gradient Compression for Data-Parallel Distributed Training,","venue":null,"work_id":"b14d5494-9a9e-4a60-9317-75f47ee9d9ce","year":2018},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.393673Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:699d13ba1c54336f64922ce031d06d63572640fa1b5e3f0c61a5e54c5fd0f27b","observation_id":"89bcaf38-ae4f-4c8b-abd4-d88712ff39be","resolution":{"observed_at":"2026-08-11T20:27:44.610218Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v32i1.11623","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:44.641489Z","title":"Adaptive quantization for deep neural network,","venue":null,"work_id":"4cbb1827-764a-4ebc-b973-a040fdf0be2c","year":2018},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.365732Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:4787bf98633c933e85a124811dd774451d68ca1029eff9798d485b539e606b83","observation_id":"d81c9b46-ccad-41a1-8094-b714272a65b7","resolution":{"observed_at":"2026-08-11T20:27:44.646776Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1088/1361-6560/aca876","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:44.622264Z","title":"Characterisation of a split gradient coil design induced systemic imaging artefact on 0.35 T MR-linac systems,","venue":null,"work_id":"7d8853b4-a8e8-4178-b481-d4be4dd7aaa9","year":2023},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.370849Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:e6702afd72ac37b85dccdb4ac1d1676609d65278e870b602efff547d3f83141b","observation_id":"2edbabfa-0693-45ca-9dbd-70a950da6a69","resolution":{"observed_at":"2026-08-11T20:27:44.630423Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:46.009574Z","title":"Sparse online learning via truncated gradient,","venue":null,"work_id":"ba76d099-a087-4ca4-b335-6da86b23bf17","year":2008},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.376295Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:86589b49f2481a8949401f0434f10ff8e95b1152b909f6ad80053fd596b2bbec","observation_id":"fb621819-b61a-4fdd-9879-aca8ba19e681","resolution":{"observed_at":"2026-08-11T20:27:46.014159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:45.956672Z","title":"Long short-term memory,","venue":null,"work_id":"a2e2aaed-978d-4629-b1a8-8f7f07d336c4","year":1997},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.419966Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:e453d7df36ba8ac8a9d548209271a9e37b6ecc7d6038958e5c59e2c166979aad","observation_id":"6efe77f9-2fec-494f-bfe6-85456f2704e8","resolution":{"observed_at":"2026-08-11T20:27:45.961290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:45.939147Z","title":"TernGrad: Ternary gradients to reduce communication in distributed deep learning,","venue":null,"work_id":"0e164e7d-2dd9-4042-b973-e4de681356e9","year":2017},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.432253Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:a11a0df266d13bf81fe14e752e0c716c63edd08b2ce59a5a71b56633ba5c87cb","observation_id":"52f78d5c-1cb1-4e90-808c-4cae973770d0","resolution":{"observed_at":"2026-08-11T20:27:45.944403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:44.399127Z","title":"Communication-Efficient Data Parallel Distributed Deep Learning: A Comprehensive Survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.399127Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:47b016a2a00205b182dd006f4a6baf87dfff206bb7ab1d4290c0025bf2f8ee11","observation_id":"c2001f63-7254-430a-99a6-2f99e01fb892","resolution":{"observed_at":"2026-08-11T20:27:44.399127Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:45.983437Z","title":"From Text to Transformation: A Comprehensive Review of Large Language Models’ Versatility,","venue":null,"work_id":"274619af-9e8c-4072-9901-140100762cde","year":2024},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.403606Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:9153b8a2ed2e6e8799144f7edac889e4670db2150e8e8bb9bf31da2676319eb7","observation_id":"31c81f4d-418b-440d-b3f8-70675a1831a5","resolution":{"observed_at":"2026-08-11T20:27:45.987706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16142","last_updated":"2024-02-25T16:47:59Z","snapshot_observed_at":"2026-08-13T04:10:33.888536Z","submitted_at":"2024-02-25T16:47:59Z","title":"From Text to Transformation: A Comprehensive Review of Large Language Models' Versatility","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16142","snapshot_observed_at":"2026-08-11T20:27:44.409543Z","title":"Available: https://arxiv.org/abs/2402.16142v1","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.409543Z"},"links":{"cited_paper":"/paper/2402.16142","citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:a6b62fcbb35ba9ea2d6eedfd2ab943315229691d51df469b23374b55e2b45c1c","observation_id":"3287e550-6094-42ae-9921-6c40f03c2623","resolution":{"observed_at":"2026-08-11T20:27:44.409543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:45.970425Z","title":"The resurgence of structure in deep neural networks,","venue":null,"work_id":"07dacbdb-6f2e-4018-ad4e-f5ff7890219b","year":2019},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.414765Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:6597c116c0f94a021d20ca479f0a00ec95855d26643069ce8d78eee56874115e","observation_id":"ae624c76-7cc2-4b5d-966b-f0e592601331","resolution":{"observed_at":"2026-08-11T20:27:45.974922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:45.911079Z","title":"Compressed Communication for Distributed Deep Learning: Survey and Quantitative Evaluation,","venue":null,"work_id":"1313a520-9a5a-47a8-85cc-064d5881d254","year":2020},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.470697Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:c230238024a4439f8156d1b60ad35d8c5550a570008c983f1fc5aa6af5385abf","observation_id":"46ea5458-fd7b-4e91-93b9-fd8a4599af01","resolution":{"observed_at":"2026-08-11T20:27:45.915440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:45.897850Z","title":"Building a large annotated corpus of English: the Penn Treebank (1993),","venue":null,"work_id":"f73cdde6-fcaa-4d8a-bc2e-ab4476508e05","year":1993},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.477913Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:9267d366036db5b01e18ae68f99cfe8527b371973914fcd5f5fa2997b6412039","observation_id":"190810a0-7d34-469c-891b-5f1fdfce67c4","resolution":{"observed_at":"2026-08-11T20:27:45.902272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:45.884294Z","title":"Accumulated gradient normalization,","venue":null,"work_id":"8b2926fd-9970-449f-abb8-f12f5dd066fa","year":2017},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.483880Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:ea98503460a822a24203deffa6e5c3ddd762af07fb21c22f134b690b385fddb9","observation_id":"bb50e076-3e27-42b6-8bf0-ae6618654156","resolution":{"observed_at":"2026-08-11T20:27:45.888395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:45.924104Z","title":"DoReFa-Net: Training Low Bitwidth Convolutional Neural Networks with Low Bitwidth Gradients,","venue":null,"work_id":"15f0d9cc-d5df-4b26-b6a7-4c6ebd28a92f","year":2016},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.439741Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:f4fe34f0f052d7c10044de1e62bc063e83e6378e7d38f774b5f6b08d21acb71c","observation_id":"9cb6cb03-c573-4ca2-83cf-4c9043becb93","resolution":{"observed_at":"2026-08-11T20:27:45.929377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06160","last_updated":"2018-02-02T01:43:54Z","snapshot_observed_at":"2026-07-06T05:00:35.763958Z","submitted_at":"2016-06-20T15:02:31Z","title":"DoReFa-Net: Training Low Bitwidth Convolutional Neural Networks with Low Bitwidth Gradients","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06160","snapshot_observed_at":"2026-08-11T20:27:44.445751Z","title":"Available: https://arxiv.org/abs/1606.06160v3","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.445751Z"},"links":{"cited_paper":"/paper/1606.06160","citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:2fa4af53d4127bce1351fbae62cb28a06a1bb5d5d4510f4e563f436d89267df8","observation_id":"f60e801e-ba99-4f55-bf98-354de4a493ea","resolution":{"observed_at":"2026-08-11T20:27:44.445751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2015-354","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:44.572430Z","title":"Scalable distributed DNN training using commodity GPU cloud computing,","venue":null,"work_id":"0fd06258-10c0-47a0-b398-233730040f16","year":2015},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.455828Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:c33ce4138544d69f1880152264f60a9f5b90e1de7b13d751e78a24a952004d6c","observation_id":"385e5844-e6a7-4920-a258-d9bd962f174e","resolution":{"observed_at":"2026-08-11T20:27:44.578339Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/mlhpc.2016.004","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:44.550516Z","title":"Communication Quantization for Data-Parallel Training of Deep Neural Networks,","venue":null,"work_id":"7f3cf468-e370-4a54-afc9-1d02131ad3b9","year":2017},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.460276Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:d79b985cbc44c30bb69d6b630908af667204ba887291419b4abf189f545a3037","observation_id":"39179931-32ba-421a-9499-e77142ca8cf3","resolution":{"observed_at":"2026-08-11T20:27:44.558586Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:44.465664Z","title":"Sparse communication for distributed gradient descent,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.465664Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:116978e708b952dd9e7c9aa5c7ea3a43eebc20bcfd36dce4f4dce567a3cbf755","observation_id":"292ec962-3d27-4f55-a12c-804a57224bfc","resolution":{"observed_at":"2026-08-11T20:27:44.465664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:44.425203Z","title":"Available: https://ieeexplore.ieee.org/abstract/document/6795963/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.425203Z"},"links":{"citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:162d681ca83c9f7093950511da6e44ecbd930e1d00362c40e384fda632f15d53","observation_id":"674bc383-05c4-48f5-a75b-1acdefa18ce0","resolution":{"observed_at":"2026-08-11T20:27:44.425203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02210","last_updated":"2023-10-24T14:00:21Z","snapshot_observed_at":"2026-08-13T12:09:02.796208Z","submitted_at":"2023-04-05T03:49:06Z","title":"Document-Level Machine Translation with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02210","snapshot_observed_at":"2026-08-11T20:27:44.072021Z","title":"Available: https://arxiv.org/abs/2304.02210v1","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.072021Z"},"links":{"cited_paper":"/paper/2304.02210","citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:74acb85021026a04621eac024b2fa554e08e5f6384017b6012523426466c1bfa","observation_id":"531488fa-2f05-4acd-a85d-27b561b45c2f","resolution":{"observed_at":"2026-08-11T20:27:44.072021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01887","last_updated":"2020-06-23T03:28:30Z","snapshot_observed_at":"2026-08-07T09:53:59.286406Z","submitted_at":"2017-12-05T19:48:11Z","title":"Deep Gradient Compression: Reducing the Communication Bandwidth for Distributed Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01887","snapshot_observed_at":"2026-08-11T20:27:44.223372Z","title":"Available: https://arxiv.org/abs/1712.01887v3","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:44.223372Z"},"links":{"cited_paper":"/paper/1712.01887","citing_paper":"/paper/2502.07634"},"observation_digest":"sha256:efbd935c22fd4c601b33e9d0e90ed99d14a0ad511bf5b74574303c7e549d42d9","observation_id":"ddd575dc-c3f1-4931-9dbc-870bd0949c09","resolution":{"observed_at":"2026-08-11T20:27:44.223372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.07634","last_updated":"2024-12-07T22:55:55Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T13:10:40.970250Z","submitted_at":"2024-12-07T22:55:55Z","title":"Efficient Distributed Training through Gradient Compression with Sparsification and Quantization Techniques"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":2,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":24,"verified_exact":11,"verified_fuzzy":20},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2502.07634."}