{"as_of":"2026-08-09T02:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d89c184cd18124cf942a6ed0d7326ecc5300a71282967c819217921e1d393f73","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:33:09.283416Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.18563/citation-record","integrity":"/paper/2505.18563/integrity","json":"/paper/2505.18563/citation-record.json","paper":"/paper/2505.18563"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:13.025605Z","title":"Lamda: Language models for dialog applications,","venue":null,"work_id":"8038c8b5-1fac-4dea-b876-39951c7e431f","year":null},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:04.360167Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:c190b34c7fbcc0ccbd7ffae34cca2876cee8c91c15c3bb42cf242f3be99fe622","observation_id":"1b16e1ef-9415-4003-aa77-449a7e2e1fc3","resolution":{"observed_at":"2026-08-07T14:33:13.028880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:13.016146Z","title":"Software- defined network assimilation: bridging the last mile towards centralized network configuration management with nassim,","venue":null,"work_id":"e907afd5-c00a-4263-9874-4284d2b1ac67","year":2022},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:04.480331Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:bbf9e7b148c3d08d2a072a3b811c28c822e97eb63d844a7e08e2d9e9838ddceb","observation_id":"02c42822-2011-4d44-8a9d-91aa8f60608e","resolution":{"observed_at":"2026-08-07T14:33:13.019865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:13.006564Z","title":"Netllm: Adapting large language models for networking,","venue":null,"work_id":"8aff3a40-7d3c-4611-aabf-2407cf0272e4","year":2024},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:04.572128Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:6c52fee364488644f5b4b74e0d56f845ee8677250899cb4c73f56f911ec60544","observation_id":"7394f8b4-4d7d-43d9-be79-6cd4c137d5b4","resolution":{"observed_at":"2026-08-07T14:33:13.009768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.995971Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":"a7f52e82-efb4-4c9b-a26a-c618485664ac","year":2023},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:04.673961Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:754a491d1c25132e7f0d00dfe5a5d9578e082ab375e63ee4218508b2b94fdd3a","observation_id":"0ad9e34f-df9e-4de4-9261-21f8535d1703","resolution":{"observed_at":"2026-08-07T14:33:12.999753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.986149Z","title":"Language models are few-shot learners,","venue":null,"work_id":"66c078be-3bbe-40b1-a0ca-29617f51be04","year":2020},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:04.745238Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:86eca7cd18a3019b9cd37ad361875d287a26b21e4d702c3c60db5216caba8764","observation_id":"f702503a-9e72-4ed9-8673-3232dafe8785","resolution":{"observed_at":"2026-08-07T14:33:12.989667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.976542Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":"7f5b5b3b-a23d-4b62-8e76-44d547eb3b2f","year":2021},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:04.835108Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:2a4bb37436b333ded7df4d75eda55879d9f9b422d9f286a9181e76965ee12040","observation_id":"97014f19-5034-4ac3-b7e0-dba8b33bf6f1","resolution":{"observed_at":"2026-08-07T14:33:12.979925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.967548Z","title":"You only look once: Unified, real-time object detection,","venue":null,"work_id":"e387f5e5-a319-4252-a2f8-b7400a059adb","year":2016},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:04.899000Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:e1a5d1219bd7341ccb83ab208f953ac439134d8cd94926bec666e1f0086498eb","observation_id":"40c0a9ee-b5d8-4fe5-ab97-de1576beca71","resolution":{"observed_at":"2026-08-07T14:33:12.970717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.956958Z","title":"Accelerating model training in multi-cluster environments with consumer-grade gpus,","venue":null,"work_id":"a129fe17-2e9b-43e8-ba47-297652346ec1","year":2024},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:05.000334Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:9247aab117c28685c5f63fd91b07a09ce0ea5a8ee1256331f2e96d4998c1f6bc","observation_id":"6720b734-7f20-4baf-a23d-8a94754854b7","resolution":{"observed_at":"2026-08-07T14:33:12.960959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.948017Z","title":"Crux: Gpu-efficient communication scheduling for deep learning training,","venue":null,"work_id":"f7c334e7-caad-400f-91de-8bd9f7956d38","year":2024},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:05.098228Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:af8c6952b90dd74f074cd4ffc9914e5d06038c009fac1ed76b906c29f84ec52d","observation_id":"a69a6ddd-5b04-4e0d-9519-2f9418da3606","resolution":{"observed_at":"2026-08-07T14:33:12.951209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.939139Z","title":"MegaScale: Scaling large language model training to more than 10,000 GPUs,","venue":null,"work_id":"c8d4480d-33d0-4078-af1c-91e8853edb96","year":2024},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:05.173635Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:3fe7b8821fc56cc743c3f3a45957ce43026cd3400fb33b8f7a46df0281f13468","observation_id":"15ac1d75-6a3a-45d0-928d-5680e32563e8","resolution":{"observed_at":"2026-08-07T14:33:12.942249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01378","last_updated":"2024-10-29T11:24:30Z","snapshot_observed_at":"2026-08-08T19:43:47.317337Z","submitted_at":"2024-07-01T15:32:28Z","title":"Beyond Throughput and Compression Ratios: Towards High End-to-end Utility of Gradient Compression","version":2},"cited_work":{"arxiv_id":"2407.01378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.01378","snapshot_observed_at":"2026-08-07T14:33:10.696622Z","title":"Beyond Throughput and Compression Ratios: Towards High End-to-end Utility of Gradient Compression","venue":"cs.LG","work_id":"c720889d-ac78-4f16-9b7b-2a7eaa686169","year":2024},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:05.263177Z"},"links":{"cited_paper":"/paper/2407.01378","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:fcc8ac850d4a35b22d0cc8cca0420a5dd40c5aeeb9e00afb759de8cbfc4febb1","observation_id":"4ec3f4ce-21e0-4688-a093-31c5d6ba4b4e","resolution":{"observed_at":"2026-08-07T14:33:10.803961Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03158","last_updated":"2025-07-31T13:53:50Z","snapshot_observed_at":"2026-08-09T00:20:17.156468Z","submitted_at":"2024-02-05T16:27:59Z","title":"Optimal and Near-Optimal Adaptive Vector Quantization","version":2},"cited_work":{"arxiv_id":"2402.03158","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03158","snapshot_observed_at":"2026-08-07T14:33:10.437367Z","title":"Optimal and Near-Optimal Adaptive Vector Quantization","venue":"cs.LG","work_id":"e820f836-9d49-4d61-b061-3bd923b74dfe","year":2024},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:05.355547Z"},"links":{"cited_paper":"/paper/2402.03158","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:0ba8df0fa4e155e7b9d4c192ebde00f5aafacf9170d98bc7c100a3594a9c4860","observation_id":"660b1518-15a4-463c-8e75-2399b1d5d1ed","resolution":{"observed_at":"2026-08-07T14:33:10.495984Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.929338Z","title":"Terngrad: Ternary gradients to reduce communication in distributed deep learning,","venue":null,"work_id":"3326cd5f-def5-4007-b7a1-fab3943bd926","year":null},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:05.461090Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:a99181652e7b5fbc65f7428da1a5c0d91944d6c333acc4138d9e1fce214e7043","observation_id":"7a1b3fba-1e85-441d-83f2-76e9a546105b","resolution":{"observed_at":"2026-08-07T14:33:12.932782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08545","last_updated":"2024-03-05T21:40:25Z","snapshot_observed_at":"2026-07-06T14:52:42.809602Z","submitted_at":"2023-02-16T19:48:20Z","title":"THC: Accelerating Distributed Deep Learning Using Tensor Homomorphic Compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08545","snapshot_observed_at":"2026-08-07T14:33:05.623994Z","title":"Thc: Accelerating distributed deep learning using tensor homomorphic compression,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:05.623994Z"},"links":{"cited_paper":"/paper/2302.08545","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:b65830b3dd7720afd5162fe4bd4afc69931d8b50d6e9c99e99830b7c93ef0a36","observation_id":"f24faac5-a4fd-4fb4-b585-e4bddcef9e40","resolution":{"observed_at":"2026-08-07T14:33:05.623994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.920307Z","title":"Sparse communication for distributed gradient descent,","venue":null,"work_id":"ade39d4d-37f1-4eda-ad7e-ad8500e3ebce","year":2017},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:05.719509Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:7dfdbaa851f21d50a43de6b83007929e084c4c3181aa8953e84f321935318649","observation_id":"9414227c-d76b-4e8e-b74f-cd54e3ebbf12","resolution":{"observed_at":"2026-08-07T14:33:12.923440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.911229Z","title":"Deep gradient compression: Reducing the communication bandwidth for distributed training,","venue":null,"work_id":"182d5862-a1d3-418e-8eb5-127ca92b8da7","year":2018},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:05.824995Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:05bfeb33ec7ba71bd553239e0578833a5364038d8eaa456bd5f9cd9bfd2e612d","observation_id":"a580c70b-d1f2-424a-aa98-3f10561c8d9b","resolution":{"observed_at":"2026-08-07T14:33:12.914298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.13727","last_updated":"2020-02-18T14:13:56Z","snapshot_observed_at":"2026-08-03T23:32:37.116762Z","submitted_at":"2019-05-31T17:25:13Z","title":"PowerSGD: Practical Low-Rank Gradient Compression for Distributed Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.13727","snapshot_observed_at":"2026-08-07T14:33:05.904277Z","title":"Powersgd: Practical low-rank gradient compression for distributed optimization,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:05.904277Z"},"links":{"cited_paper":"/paper/1905.13727","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:a9ac59a1e7b504012dd94ba1ed6d3c856912af6e590ad10eb9f63511782571fc","observation_id":"e2d0e15c-5da9-4404-adb1-92cbbe2c74de","resolution":{"observed_at":"2026-08-07T14:33:05.904277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.900455Z","title":"Grace: A compressed communication framework for distributed machine learning,","venue":null,"work_id":"01322058-3e5e-4824-9b47-c778f2b60d56","year":2021},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:05.976327Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:2530e3041f4dbac2ef540310b83344ce8078b28de0161a319ef92c3c8ac8de8a","observation_id":"f7ee06a5-28c6-4166-a4c9-d63d20e7873e","resolution":{"observed_at":"2026-08-07T14:33:12.903920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.891186Z","title":"Efficient sparse collective communication and its application to accelerate distributed deep learning,","venue":null,"work_id":"c82ced6d-d490-45db-829d-096b655d3a5d","year":2021},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:06.059999Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:3b967e6d2c8d644d115f7dc87583cbce9163af0498865b3edd1648b5b1d6d818","observation_id":"4709eb89-bbbb-41ec-b027-f9267ef15a97","resolution":{"observed_at":"2026-08-07T14:33:12.894496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13254","last_updated":"2024-12-14T00:20:13Z","snapshot_observed_at":"2026-08-04T20:47:56.981407Z","submitted_at":"2023-09-23T04:32:48Z","title":"Empowering Distributed Training with Sparsity-driven Data Synchronization","version":2},"cited_work":{"arxiv_id":"2309.13254","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.13254","snapshot_observed_at":"2026-08-07T14:33:10.226932Z","title":"Empowering Distributed Training with Sparsity-driven Data Synchronization","venue":"cs.LG","work_id":"a94746f9-d1f7-4db2-a1d4-8d65cb9156d3","year":2023},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:06.137841Z"},"links":{"cited_paper":"/paper/2309.13254","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:8644815f3712f7be94f8bd4e7d7fb8f563f7d4f5a2e39a23c67f8863f60b539c","observation_id":"2537ae0a-8c51-4093-aae5-d706f2c0d8b8","resolution":{"observed_at":"2026-08-07T14:33:10.293013Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.881555Z","title":"Embrace: Accelerating sparse communication for distributed training of deep neural networks,","venue":null,"work_id":"bc485ac4-6437-4ce5-9db5-70ec59c88882","year":2023},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:06.209610Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:0f44c679c088e0a77b56efd68b562126d478b14518b7d9add2afc6634c2c4b4f","observation_id":"46aa9f87-30d4-41ed-bffd-49ac97ae2787","resolution":{"observed_at":"2026-08-07T14:33:12.884913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.872445Z","title":"Hi-speed dnn training with espresso: Unleashing the full potential of gradient compression with near-optimal usage strategies,","venue":null,"work_id":"2b059ce5-5ca2-4143-b720-61e02461ee2b","year":2023},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:06.276642Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:ee2f8dad466aebef6780f5bfdc51752ca20752a5344f371a11b43d23fd34382e","observation_id":"06ba9546-6f63-4b94-ae5d-eb54e8c08417","resolution":{"observed_at":"2026-08-07T14:33:12.875489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.863151Z","title":"Mccs: A service-based approach to collective communication for multi- tenant cloud,","venue":null,"work_id":"e31f5e2b-9587-42f0-ab47-0643be3f104b","year":2024},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:06.378282Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:48b7aee1ba2cf864e7d681d061adeb3c106f05a6f19bed36939239b2740e2f98","observation_id":"22cd188f-e60a-4168-956b-d21feef6b59d","resolution":{"observed_at":"2026-08-07T14:33:12.866365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.702300Z","title":"Swing: Short- cutting rings for higher bandwidth allreduce,","venue":null,"work_id":"c434e3ac-a821-4df2-adb1-82ddd799713d","year":2024},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:06.460867Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:7c408a2b63e55b21f3c8eab3500da7f77938b762a9ff0c98948bc730fee36c8d","observation_id":"ef1cb3be-3835-4b1c-bb81-caca54b4bb62","resolution":{"observed_at":"2026-08-07T14:33:12.776047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.557388Z","title":"Scaling distributed machine learning with the parameter server,","venue":null,"work_id":"73f61a02-026a-4ee7-9a49-1df486e2e20d","year":2014},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:06.532262Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:ada3b74ab549b588563ec7a25aebf86c5433f36fd35a8e4a77ebf3bf10596f8b","observation_id":"4479651a-a866-4b78-bd8a-49317d198bbc","resolution":{"observed_at":"2026-08-07T14:33:12.636800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.307859Z","title":"Pytorch 2: Faster machine learning through dynamic python bytecode transformation and graph compilation,","venue":null,"work_id":"1a72a79a-e0e1-4d9b-8d89-7b9b00255e4f","year":2024},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:06.612420Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:78b75d14396f009d24dc4f3d9b04d990c4ebfcf301c5b026b9c01a8c8b498497","observation_id":"f3239e28-1721-4bf8-8d1d-0c4116ded69c","resolution":{"observed_at":"2026-08-07T14:33:12.385243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.152091Z","title":"Learning multiple layers of features from tiny images,","venue":null,"work_id":"38975d7b-de07-4406-8548-b0dcee1b718b","year":2009},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:06.682424Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:c729c8f0b380a00cff394eace2867db6971ffaeb36817b55825a0fbfb5c1e875","observation_id":"ec05e3e5-aa0a-404b-a502-5423fb4fbad9","resolution":{"observed_at":"2026-08-07T14:33:12.211594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-07-06T03:53:32.549552Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-07T14:33:06.781146Z","title":"Very deep convolutional networks for large-scale image recognition,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:06.781146Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:51cd731f2ffbf92b609eaf4db7d01c25b2098c7bc384289620095fa41895638e","observation_id":"68352ec8-5c49-4c41-90db-1451e8fc49d6","resolution":{"observed_at":"2026-08-07T14:33:06.781146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03385","last_updated":"2015-12-10T19:51:55Z","snapshot_observed_at":"2026-07-06T04:39:28.429064Z","submitted_at":"2015-12-10T19:51:55Z","title":"Deep Residual Learning for Image Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03385","snapshot_observed_at":"2026-08-07T14:33:06.832443Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:06.832443Z"},"links":{"cited_paper":"/paper/1512.03385","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:9b51baeb02da824efdcad66009fe91fbf62ed657775363c29a156a0adb5700ac","observation_id":"29a5d79a-a9ee-418d-b885-49b8877bc7fd","resolution":{"observed_at":"2026-08-07T14:33:06.832443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:12.043411Z","title":"Learning both weights and connections for efficient neural networks,","venue":null,"work_id":"29a64f07-0513-4037-aa25-40271a6c0cc2","year":2015},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:06.927417Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:30a18b0a7c24323d5762dc08669786bdc78335c06487035c75d3632f2c5fbfd6","observation_id":"3c16b236-6aad-4096-a90a-ff047dd730b5","resolution":{"observed_at":"2026-08-07T14:33:12.117984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:11.921067Z","title":"Pruning filters for efficient convnets,","venue":null,"work_id":"c42349d8-3761-46d5-9cf0-6bbd14dc4211","year":2017},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:07.031745Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:64f918e5bba3ae75303f39b5fa977cd6993541fbb882d1e03ac460b2a15b7b72","observation_id":"8c6163a6-2948-4970-a0eb-0f8a4b423fd9","resolution":{"observed_at":"2026-08-07T14:33:11.974867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:11.767297Z","title":"Pruning convolutional neural networks for resource efficient inference,","venue":null,"work_id":"b42a5687-5372-49bb-aed4-53fc1182b174","year":2017},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:07.058902Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:adda2e24b46ae7d67264b3cbba210e0e809b100e8bbb1ef135a5be087dc5de24","observation_id":"aa9ae124-1a0b-4850-8648-05823f84458c","resolution":{"observed_at":"2026-08-07T14:33:11.835003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:11.607453Z","title":"The lottery ticket hypothesis: Finding sparse, trainable neural networks,","venue":null,"work_id":"0f0dbb1d-4380-49a8-a01d-2411dd84b7b6","year":2019},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:07.065895Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:c466264d10313ba3a2503bea6471eaaf32809a0ccaf628e364485d7b69f2154f","observation_id":"178f5eae-2081-4793-af0b-8ce5660f1d23","resolution":{"observed_at":"2026-08-07T14:33:11.725087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:11.420127Z","title":"Earlybert: Efficient bert training via early-bird lottery tickets,","venue":null,"work_id":"89c38d1d-7b1d-46c1-9402-cfcc9bf4cd46","year":2021},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:07.185904Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:0e8103ccff585d1496d093f0caca4df542ee3cb81c92187c661eb84d3de5de42","observation_id":"edd56c52-c9cd-49b3-a35b-63d5a590ede8","resolution":{"observed_at":"2026-08-07T14:33:11.475502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:11.293185Z","title":"When to prune? a policy towards early structural pruning,","venue":null,"work_id":"0408ea68-6218-454e-85f0-670a6600b1df","year":2022},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:07.274785Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:aaba89a77cfcebe82afc7a9a74fc26477e7693fb6e72067feb70e06ae581a139","observation_id":"c4d30ed4-1b4a-4db1-bdba-bfcab31b904a","resolution":{"observed_at":"2026-08-07T14:33:11.347953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.00414","last_updated":"2019-07-19T14:59:45Z","snapshot_observed_at":"2026-07-06T07:49:47.294073Z","submitted_at":"2019-05-01T17:57:26Z","title":"Similarity of Neural Network Representations Revisited","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.00414","snapshot_observed_at":"2026-08-07T14:33:07.453865Z","title":"Similarity of neural network representations revisited,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:07.453865Z"},"links":{"cited_paper":"/paper/1905.00414","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:92453bf323992f701ec5513960485acb24cd2ff89019a9c0f7e96b0417fd0ef8","observation_id":"e3598b0d-dd44-4edc-87cf-65be90744cb3","resolution":{"observed_at":"2026-08-07T14:33:07.453865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.04934","last_updated":"2024-01-27T17:07:46Z","snapshot_observed_at":"2026-08-07T08:29:22.239111Z","submitted_at":"2023-04-11T02:12:02Z","title":"Model Sparsity Can Simplify Machine Unlearning","version":13},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.04934","snapshot_observed_at":"2026-08-07T14:33:07.577411Z","title":"Model sparsity can simplify machine unlearning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:07.577411Z"},"links":{"cited_paper":"/paper/2304.04934","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:1f51d65876a058893265c45b86743a63e4d807289b7651450ea65037b43ca65c","observation_id":"e4be9c19-7374-4467-97ce-d73aa8f2c4bd","resolution":{"observed_at":"2026-08-07T14:33:07.577411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02025","last_updated":"2024-03-15T15:28:11Z","snapshot_observed_at":"2026-07-06T16:27:07.155310Z","submitted_at":"2023-10-03T13:05:36Z","title":"DeepZero: Scaling up Zeroth-Order Optimization for Deep Model Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02025","snapshot_observed_at":"2026-08-07T14:33:07.641230Z","title":"Deepzero: Scaling up zeroth-order optimization for deep model training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:07.641230Z"},"links":{"cited_paper":"/paper/2310.02025","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:30d8cb6e5097677a62e74ea996ebdee2e23ebbf58a96964276f9f0d6aca11485","observation_id":"977b89b3-1b0d-42b5-a137-606f9053807d","resolution":{"observed_at":"2026-08-07T14:33:07.641230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14737","last_updated":"2024-03-21T13:54:36Z","snapshot_observed_at":"2026-07-31T08:52:38.648008Z","submitted_at":"2024-03-21T13:54:36Z","title":"FedMef: Towards Memory-efficient Federated Dynamic Pruning","version":1},"cited_work":{"arxiv_id":"2403.14737","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.14737","snapshot_observed_at":"2026-08-07T14:33:09.842586Z","title":"FedMef: Towards Memory-efficient Federated Dynamic Pruning","venue":"cs.LG","work_id":"dbc51b48-35e9-4988-bfc8-a1051894ffc7","year":2024},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:07.827582Z"},"links":{"cited_paper":"/paper/2403.14737","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:c3add2437ce9376680033e01f7af4f1d04d9de6d18c3c0ba10b67560d7f6702d","observation_id":"5531f0b4-2c7b-4375-a194-6241cb0d90e3","resolution":{"observed_at":"2026-08-07T14:33:10.010083Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.02507","last_updated":"2022-08-04T07:37:07Z","snapshot_observed_at":"2026-07-06T13:38:40.554369Z","submitted_at":"2022-08-04T07:37:07Z","title":"ZeroFL: Efficient On-Device Training for Federated Learning with Local Sparsity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.02507","snapshot_observed_at":"2026-08-07T14:33:08.014894Z","title":"Zerofl: Efficient on-device training for federated learning with local sparsity,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:08.014894Z"},"links":{"cited_paper":"/paper/2208.02507","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:f8d12ecda0645555dded7ec19ada45e4f6fd05d8cfc8feef8f1ff763d5c32d15","observation_id":"a1e18b4a-ad6d-4010-abd0-81ec12e8042d","resolution":{"observed_at":"2026-08-07T14:33:08.014894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09824","last_updated":"2021-12-18T02:26:38Z","snapshot_observed_at":"2026-07-06T12:20:09.242116Z","submitted_at":"2021-12-18T02:26:38Z","title":"Federated Dynamic Sparse Training: Computing Less, Communicating Less, Yet Learning Better","version":1},"cited_work":{"arxiv_id":"2112.09824","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.09824","snapshot_observed_at":"2026-08-07T14:33:09.496629Z","title":"Federated Dynamic Sparse Training: Computing Less, Communicating Less, Yet Learning Better","venue":"cs.LG","work_id":"e9626034-ba03-4f40-9904-3b6270777c56","year":2021},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:08.206537Z"},"links":{"cited_paper":"/paper/2112.09824","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:f42e453b60878a647cc0110715cda7c87c214b1fcf9b65dda28910ecbff2350c","observation_id":"a8b4ffed-e768-441e-bc14-042c92e7d805","resolution":{"observed_at":"2026-08-07T14:33:09.687915Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.01977","last_updated":"2023-07-11T13:09:37Z","snapshot_observed_at":"2026-07-06T14:26:40.492700Z","submitted_at":"2022-12-05T01:58:45Z","title":"Distributed Pruning Towards Tiny Neural Networks in Federated Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.01977","snapshot_observed_at":"2026-08-07T14:33:08.315250Z","title":"Distributed pruning towards tiny neural networks in federated learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:08.315250Z"},"links":{"cited_paper":"/paper/2212.01977","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:d81489ebf815bd82c4c0386d9010ad26d29742ea182a36a94ff44c2fc7980ca6","observation_id":"0f972ac8-43ec-42de-80a7-0cbee178e8ed","resolution":{"observed_at":"2026-08-07T14:33:08.315250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0575","last_updated":"2015-01-30T01:23:59Z","snapshot_observed_at":"2026-07-06T03:53:12.119259Z","submitted_at":"2014-09-01T22:29:38Z","title":"ImageNet Large Scale Visual Recognition Challenge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.0575","snapshot_observed_at":"2026-08-07T14:33:08.453842Z","title":"Imagenet large scale visual recognition challenge,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:08.453842Z"},"links":{"cited_paper":"/paper/1409.0575","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:a5890340244d712330ed51439942c31a1210299062a7436a9a1e3a9e5e6d53cc","observation_id":"f2dfc3e8-e0e1-4ed3-a4ef-7c1095a32b0f","resolution":{"observed_at":"2026-08-07T14:33:08.453842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:11.211092Z","title":"Tiny imagenet visual recognition challenge,","venue":null,"work_id":"711a6be5-4fda-478a-8864-eca22403cce1","year":null},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:08.684087Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:cac664ae70d341bbe1939d6221285c5bcd82adcfbdf34ad05c6f58af25c72ff0","observation_id":"08e9e393-0a91-4574-8f6d-197804569981","resolution":{"observed_at":"2026-08-07T14:33:11.225143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.07376","last_updated":"2020-08-07T00:02:33Z","snapshot_observed_at":"2026-08-03T13:48:05.558970Z","submitted_at":"2020-02-18T05:14:47Z","title":"Picking Winning Tickets Before Training by Preserving Gradient Flow","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.07376","snapshot_observed_at":"2026-08-07T14:33:09.091356Z","title":"Picking winning tickets before training by preserving gradient flow,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:09.091356Z"},"links":{"cited_paper":"/paper/2002.07376","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:945101394c99a921d94420084a935b19372506049216c393ccb1e43a779ad669","observation_id":"ea803949-0526-4e7c-9a97-99374dd142f1","resolution":{"observed_at":"2026-08-07T14:33:09.091356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:10.927869Z","title":"Nvidia collective communications library (nccl),","venue":null,"work_id":"526540eb-8a50-490c-865b-1990fc573919","year":2024},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:09.283416Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:82a0b421384991cc89ea1b4c75f6d6a03a2141c6d25245a30695359992ac35bc","observation_id":"e51246c9-3a45-43a1-b1a9-c44c796cc09d","resolution":{"observed_at":"2026-08-07T14:33:11.026796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:33:11.120614Z","title":"Available: https://api.semanticscholar.org/CorpusID: 16664790","venue":null,"work_id":"f6a42bb6-6456-42dc-9b09-b0eea75563a5","year":null},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:08.873107Z"},"links":{"citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:d092e457c4d2f26515ca49d4f149a182ef3b0dda81daf0566626ec2089c345dc","observation_id":"3ba89639-9951-4bca-a99a-a2af97db07f3","resolution":{"observed_at":"2026-08-07T14:33:11.162717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.07878","last_updated":"2017-12-29T02:51:48Z","snapshot_observed_at":"2026-08-04T02:15:05.508326Z","submitted_at":"2017-05-22T17:42:15Z","title":"TernGrad: Ternary Gradients to Reduce Communication in Distributed Deep Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.07878","snapshot_observed_at":"2026-08-07T14:33:05.545231Z","title":"Available: https://arxiv.org/abs/1705.07878","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:05.545231Z"},"links":{"cited_paper":"/paper/1705.07878","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:1ea4eea5144f1e6bafc100e9c36938d36e9a2d9b6bedbc7deb1dbce6790bf98e","observation_id":"dd5850b4-e66a-4141-8a24-ed4516cc1ca6","resolution":{"observed_at":"2026-08-07T14:33:05.545231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08239","snapshot_observed_at":"2026-08-07T14:33:04.403728Z","title":"Available: https://arxiv.org/abs/2201.08239","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:04.403728Z"},"links":{"cited_paper":"/paper/2201.08239","citing_paper":"/paper/2505.18563"},"observation_digest":"sha256:3ce013cf02a64f4615f332917639e619da1ecd846b029b01e5a4734aaa9d4091","observation_id":"eccd5bca-28b6-453b-a1f2-f0907fcf9127","resolution":{"observed_at":"2026-08-07T14:33:04.403728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.18563","last_updated":"2025-05-24T07:06:36Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-07T14:27:16.669960Z","submitted_at":"2025-05-24T07:06:36Z","title":"PacTrain: Pruning and Adaptive Sparse Gradient Compression for Efficient Collective Communication in Distributed Deep Learning"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":5,"verified_fuzzy":31},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2505.18563."}