{"as_of":"2026-08-17T10:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:986e8f4c456858ebebf02b2c1a54e33ae31708516eddcb91470c57a179a3ed27","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T12:23:19.004428Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T00:27:43.845408Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T00:30:33.076250Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"cited_work":{"arxiv_id":"2412.14335","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.14335","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv:2412.14335 [cs.AR]https://arxiv.org/ abs/2412.14335","venue":null,"work_id":"c448bf53-8d3f-4ac1-91c7-539ccfd41cb9","year":null},"citing_paper":{"arxiv_id":"2511.06605","last_updated":"2026-04-10T17:41:06Z","snapshot_observed_at":"2026-08-02T17:48:25.735846Z","submitted_at":"2025-11-10T01:28:58Z","title":"DMA-Latte: Expanding the Reach of DMA Offloads to Latency-bound ML Communication","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T00:27:43.845408Z"},"links":{"cited_paper":"/paper/2412.14335","citing_paper":"/paper/2511.06605"},"observation_digest":"sha256:c7aa4cead83f7c57e5b843412b77c04d8ffe62f92a0c7d2f5a41adafac913734","observation_id":"a6d06ad2-aa27-4edc-8a66-4da6323f8d25","resolution":{"observed_at":"2026-05-18T00:30:33.078708Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.14335/citation-record","integrity":"/paper/2412.14335/integrity","json":"/paper/2412.14335/citation-record.json","paper":"/paper/2412.14335"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:18.468135Z","title":"A bridging model for parallel computation,","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.468135Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:1765085294030d3dc933de28ab9a1a4c5ed1f73f5f27ee7512d894488c408306","observation_id":"890877d4-5f77-49ac-b521-e89d0ff47993","resolution":{"observed_at":"2026-08-11T12:23:18.468135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:18.500285Z","title":"Pytorch fsdp: Experiences on scaling fully sharded data parallel,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.500285Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:0f38d044d6db0aeed0e2c6ed506e269a9246e1c55a78a84149a511216e8e2dea","observation_id":"d1a0b163-db15-42ec-8fb3-c4784c7ce237","resolution":{"observed_at":"2026-08-11T12:23:18.500285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12757","last_updated":"2025-05-25T14:08:01Z","snapshot_observed_at":"2026-08-16T13:24:27.966260Z","submitted_at":"2024-08-22T23:00:40Z","title":"NanoFlow: Towards Optimal Large Language Model Serving Throughput","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12757","snapshot_observed_at":"2026-08-11T12:23:18.596808Z","title":"Nanoflow: Towards optimal large language model serving throughput,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.596808Z"},"links":{"cited_paper":"/paper/2408.12757","citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:f14654a5a3a7f524b88b5b5d023dabe4701f49e76f7c7a22624c210b75997b75","observation_id":"3c7b4e4f-8200-4234-ad70-3c5a017746e5","resolution":{"observed_at":"2026-08-11T12:23:18.596808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T12:23:18.637910Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.637910Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:3dbfb425ba9a9d7d1839873a7870c5dafcd847d6075c56d7517ed9fbcedbe2eb","observation_id":"c32deaf5-bd94-4184-bdab-1ec72303a5b3","resolution":{"observed_at":"2026-08-11T12:23:18.637910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:19.790248Z","title":"{ARK}:{GPU-driven} code execution for distributed deep learning,","venue":null,"work_id":"4a5b58a0-db0c-4e08-961d-96f74a4d4c55","year":2023},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.651544Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:0fdae855c2a6119cd0615c06ffda35d45435682cb76f6b25f9ecf103560ef450","observation_id":"1ae43603-382f-4fc8-968c-5d3e08f8b168","resolution":{"observed_at":"2026-08-11T12:23:19.799105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:19.779231Z","title":"11.1 amd instincttm mi300 series modular chiplet package – hpc and ai accelerator for exa-class systems,","venue":null,"work_id":"b2ed6a68-390b-4bd1-87d0-7e342d46ad9e","year":2024},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.658910Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:8baedfa986ad7df60d3ec549e70630e298834a2050ec43ff8e90260d6d5f0530","observation_id":"e6ebe5e3-331a-4d90-98ad-863da059bdbe","resolution":{"observed_at":"2026-08-11T12:23:19.783250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:19.768712Z","title":"AMD Instinct™MI300X Accelerator: Packaging and Architecture Co-Optimization,","venue":null,"work_id":"ddc526e7-8146-4311-a41b-4dd7677e75d1","year":2024},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.670888Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:79c42d871e73c00da4613ec614e4c420689affc57cc37109585ba7a1f10ad609","observation_id":"6a1f410e-90f4-4d51-b122-aa53bde69838","resolution":{"observed_at":"2026-08-11T12:23:19.772487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:19.757697Z","title":"The AMD CDNA™ 3 architecture,","venue":null,"work_id":"56b6e5ef-132b-44c9-804e-74420804bb98","year":2024},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.681382Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:e2ece8547868268ff4d9c5ab10df64e636782ed7beb52a5d06628ada5cac9995","observation_id":"1dd6be83-e635-4c87-9d31-354fad14baf0","resolution":{"observed_at":"2026-08-11T12:23:19.761505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:19.746797Z","title":"HSA Runtime API and runtime for ROCm,","venue":null,"work_id":"a27c3d9c-9aa3-4ed4-b6f6-b52f767a53be","year":2024},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.690115Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:5cf5376d93b7c132324f837a9090ed207494d56f12b3750d601b5cdc3ac21f98","observation_id":"c75bc5a0-a566-4c90-846e-9ad51407dc64","resolution":{"observed_at":"2026-08-11T12:23:19.750820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:19.734849Z","title":"HIP: C++ Heterogeneous-Compute Interface for Portability,","venue":null,"work_id":"a340da35-fcd8-4f8a-b9c5-a9c52e608106","year":2024},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.698583Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:50953c0a165c9d9d033f09e2903b8ac083a42e31d3a1620e028bc36f05d7717e","observation_id":"ba5d4042-d53e-4154-9a86-8291b703c223","resolution":{"observed_at":"2026-08-11T12:23:19.739086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:19.723212Z","title":"Tale of two cs: Computation vs. communication scaling for future transformers on future hardware,","venue":null,"work_id":"3777798d-fee0-49be-81c2-f81afe6ee803","year":2023},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.703200Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:adcd5c59ef1462c1f14f124343098edc969a29aa51d6e285802f792b89600467","observation_id":"243312cf-886f-423c-86bb-63307a79a35f","resolution":{"observed_at":"2026-08-11T12:23:19.727367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:19.712510Z","title":"AMD ROCm™ Software,","venue":null,"work_id":"56969e6b-05d8-477b-877d-c71640d2b5db","year":2024},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.707350Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:4d817e900419930cd0b46e7a3199835ce908657ff03fd6fb4123db6521ea1f74","observation_id":"35802812-fcae-49fc-96f9-f86b8d45709e","resolution":{"observed_at":"2026-08-11T12:23:19.716251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:19.697708Z","title":"ROCm/rocBLAS: Next generation BLAS implementation for ROCm platform,","venue":null,"work_id":"f215fff6-9929-44ea-9213-f2ad0ce24ddb","year":2024},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.711930Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:fbe70ff0013bf07bb5d66b36d037aa4334e34a0530f9079959003f5599c32f7b","observation_id":"f858a095-6ea6-4c4f-8ac3-3a7610b2952d","resolution":{"observed_at":"2026-08-11T12:23:19.703069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:19.686690Z","title":"ROCm Communication Collectives Library (RCCL)","venue":null,"work_id":"c9d104e4-bfae-4b32-8400-aac32fe61a93","year":null},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.716063Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:c157c4d4f97988bc959accc91d2a7501b4a7afeec625fc1252432ef8f1a3d87b","observation_id":"66cd9b53-7e39-4089-b23f-8874fe049d04","resolution":{"observed_at":"2026-08-11T12:23:19.690679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:19.675896Z","title":"ROCm: HIPStream,","venue":null,"work_id":"628c31b4-cdbf-4a56-a814-862e58a8d108","year":2024},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.720394Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:1a344cc8c107d8c0c54ad78ee9b572eeb3cf6fdfdb07cd236d7f2579080fe89e","observation_id":"6927e377-6619-403c-9cde-3c0acd2c1728","resolution":{"observed_at":"2026-08-11T12:23:19.679660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:19.664447Z","title":"rocprof — ROC Profiler Documentation,","venue":null,"work_id":"961e6feb-c5cf-49a1-8aa1-725e3e1e3e24","year":2024},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.724462Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:431835b15c5ed2bbc00b00d64ef0fca5abc47dae2187b6be8471f767cc006ebf","observation_id":"5cdb2bd9-e3db-4143-9029-4dceaab0961b","resolution":{"observed_at":"2026-08-11T12:23:19.668818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:19.654367Z","title":"AMD Instinct™ MI300X Accelerator Perfor- mance Validation Guide,","venue":null,"work_id":"eff0f01e-bbfd-4754-8c3f-d6d10f480105","year":2024},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.728339Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:bcee85feaf884b50ebf1debd04b1b627958a03f62b36821d1fa7131c084c6b39","observation_id":"2c930b0c-a81c-455d-aa56-f678e87621f8","resolution":{"observed_at":"2026-08-11T12:23:19.658083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:19.643788Z","title":"ROCm: ROCR-Runtime,","venue":null,"work_id":"3fafee15-bc02-44ec-a887-41adcfcdba09","year":2024},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.732671Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:aaa7fbffdddc0b8e6fd921a68ab8e93d04bc6243d28428f35c24d44e8bf5c93b","observation_id":"a8f051b4-d58a-4f55-9839-7cdb3ccaf05a","resolution":{"observed_at":"2026-08-11T12:23:19.647582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:19.633160Z","title":"T3: Transparent tracking & triggering for fine-grained overlap of compute & collectives,","venue":null,"work_id":"ae4a096b-5543-4e76-a0a7-57868444ebbb","year":2024},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.736987Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:a29b646b0eb216c36ff40154058e1382705e5d8e18afb26f523448ce284876dc","observation_id":"19addbb6-178a-457f-b8f0-8dbceae946c7","resolution":{"observed_at":"2026-08-11T12:23:19.637138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05596","last_updated":"2022-07-21T18:21:36Z","snapshot_observed_at":"2026-08-16T17:28:17.146479Z","submitted_at":"2022-01-14T18:36:04Z","title":"DeepSpeed-MoE: Advancing Mixture-of-Experts Inference and Training to Power Next-Generation AI Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.05596","snapshot_observed_at":"2026-08-11T12:23:18.741039Z","title":"Deepspeed-moe: Advancing mixture-of-experts inference and training to power next-generation ai scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.741039Z"},"links":{"cited_paper":"/paper/2201.05596","citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:a6767c7a79e3f396b2920cdddd821bf4685364817e856052dd36d267573edb3a","observation_id":"f1ba0c67-19ca-41da-a15f-04e42cd467ac","resolution":{"observed_at":"2026-08-11T12:23:18.741039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:19.622622Z","title":"TimeGraph: GPU Scheduling for Real-Time Multi-Tasking Environments,","venue":null,"work_id":"6dbea630-1144-4da1-a1a1-418bea39eb5f","year":2011},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.745563Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:cdbc5f5acc96c55c51ffd21587e57e8d9fdc13a5fbc7afd94307e53d21cccc35","observation_id":"918f3ca6-b710-4094-97a6-603550ca0fb0","resolution":{"observed_at":"2026-08-11T12:23:19.626380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:19.611631Z","title":"MSC- CLang: Microsoft Collective Communication Language,","venue":null,"work_id":"811d104b-8492-4538-aa9e-60234950b1af","year":2023},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.749301Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:d9b8e54b1c0f40f2e3a2db09bf9ee7680fa296320865de18009e1b21bbcbf5cb","observation_id":"79aa09f4-c0dc-4557-bc57-6e0ea243859b","resolution":{"observed_at":"2026-08-11T12:23:19.615472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:19.600381Z","title":"Available: https://github.com/NVIDIA/nccl","venue":null,"work_id":"c68ed59b-ff84-4bf0-a9f4-39cab8b5d936","year":null},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.752792Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:e52e0f0fc834e7c9f3095299b8fe8045c78389fa754bd33ef5c262847ce20e6d","observation_id":"b6541107-eac4-40d7-9ec4-7267ff685389","resolution":{"observed_at":"2026-08-11T12:23:19.604358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:19.589274Z","title":"TACCL: Guiding Collective Algorithm Synthesis using Communication Sketches,","venue":null,"work_id":"f57fb605-62e9-4e42-ab97-2c949faeadb0","year":2023},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.756341Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:0fde067e81b191f73d864c44bb994a60b132ab1c9baa914cf865540e0d1f32e3","observation_id":"d7372df3-5cb9-4ae8-828a-430e2ab53fb6","resolution":{"observed_at":"2026-08-11T12:23:19.593400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:19.577965Z","title":"MSCCL++: A GPU-driven communication stack for scalable AI applications","venue":null,"work_id":"dfd234ba-7013-4f97-8f08-a911b0b2f684","year":null},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.795376Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:e3be51ed7fba97f99d1db0e8d320400908a139c7d1136865026b2ce32e8499e8","observation_id":"5c965cdf-de6a-4e2e-a15c-201a20225f60","resolution":{"observed_at":"2026-08-11T12:23:19.581937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00091","last_updated":"2019-05-31T21:51:16Z","snapshot_observed_at":"2026-08-14T16:22:46.075072Z","submitted_at":"2019-05-31T21:51:16Z","title":"Deep Learning Recommendation Model for Personalization and Recommendation Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.00091","snapshot_observed_at":"2026-08-11T12:23:18.838572Z","title":"Deep learning recommendation model for personalization and recommenda- tion systems,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.838572Z"},"links":{"cited_paper":"/paper/1906.00091","citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:1b36d18af73acca1370c4db7fffa26ec9b899bbe71260a30aa85e72dc72acc8e","observation_id":"33a9f01b-36cd-481c-abf5-2b04b1c5de54","resolution":{"observed_at":"2026-08-11T12:23:18.838572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:19.566398Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Mod- els Using Model Parallelism,","venue":null,"work_id":"7d1a8e93-f5d1-4f9b-846a-57e79b4fc619","year":2019},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.888958Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:b2ccff078a641209a846c25af8ff6232318238534f480b2340227a355c0fdd09","observation_id":"c3c9734d-8040-4f14-ac61-bcea09cbcb98","resolution":{"observed_at":"2026-08-11T12:23:19.570814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:18.917412Z","title":"Enabling Compute-Communication Overlap in Distributed Deep Learning Training Platforms,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.917412Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:727017165cbc96d3b264f0bf61ff3b5629ef15006d0afa573d33e3ad90224a56","observation_id":"93de37ab-023d-4849-9713-109d1645eaee","resolution":{"observed_at":"2026-08-11T12:23:18.917412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:19.554772Z","title":"The Case for GPGPU Spatial Multitasking,","venue":null,"work_id":"3c9cb349-c80c-4400-8ddd-2225b4425781","year":2012},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.936810Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:ae9bf660d58bb58c526c957e37cca5726cafca18d4da6e7763df4fe6f98141c2","observation_id":"febf812d-6ccd-40b8-b15f-3c2bfb32a186","resolution":{"observed_at":"2026-08-11T12:23:19.559159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:19.542231Z","title":"Improving GPGPU energy-efficiency through concurrent kernel execution and DVFS,","venue":null,"work_id":"3ed039a9-5e99-42b5-a8c9-bbee6483dd08","year":2015},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.941351Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:0a705fe748f707cd6fde421dcc8f5d9dd8f8d3cacc18068ff694984f057f0baa","observation_id":"f1ed9c9e-0e3f-42c4-9330-7a15f54fc25a","resolution":{"observed_at":"2026-08-11T12:23:19.546408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:19.529742Z","title":"Improving GPGPU Concurrency with Elastic Kernels,","venue":null,"work_id":"d706be04-a744-433e-baaf-e8debff31bd0","year":2013},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.945764Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:b76cd529c41ebf6b0e3763dfc76e06376aca3f6048fb15bec257bb2ad39a4212","observation_id":"0de2b38d-dcb5-4768-81ea-ba7fe669f6cb","resolution":{"observed_at":"2026-08-11T12:23:19.533927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:19.517107Z","title":"Rammer: Enabling Holistic Deep Learning Compiler Optimizations with rTasks,","venue":null,"work_id":"912fcf23-9cfd-4de7-a5cb-6a6a7a0ecc39","year":2020},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.950054Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:479aab42176e59a2a0dd0eb4ad675c146006b0f58f8f203b7d5e991f406b6e41","observation_id":"6ba035e1-6067-4d66-82c6-0c07a7857b84","resolution":{"observed_at":"2026-08-11T12:23:19.521377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02227","last_updated":"2024-09-03T18:55:32Z","snapshot_observed_at":"2026-08-16T13:21:38.228078Z","submitted_at":"2024-09-03T18:55:32Z","title":"Global Optimizations & Lightweight Dynamic Logic for Concurrency","version":1},"cited_work":{"arxiv_id":"2409.02227","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.02227","snapshot_observed_at":"2026-08-11T12:23:19.244524Z","title":"Global Optimizations & Lightweight Dynamic Logic for Concurrency","venue":"cs.AR","work_id":"fd2e8796-aaf0-44d8-b0bb-a79c7e740cdd","year":2024},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.954391Z"},"links":{"cited_paper":"/paper/2409.02227","citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:98c996abf9c43df66fbcca1b8d37f618c1499216ab38cc5455833fdd8240f98c","observation_id":"a3a604e8-475b-4bff-abd0-253409ab8303","resolution":{"observed_at":"2026-08-11T12:23:19.250779Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:19.504364Z","title":"An In-Network Architecture for Accelerating Shared-Memory Multiprocessor Collec- tives,","venue":null,"work_id":"7eab52dd-0d91-49c9-8489-941a427d0a88","year":2020},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.966166Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:a3464394c1cd6fba7f2e10553a493ba813cac7c041336a0160404c823600ec3d","observation_id":"fb53f232-3849-4ca5-ae25-0ac468d29a7e","resolution":{"observed_at":"2026-08-11T12:23:19.508949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:19.491128Z","title":"Introducing Async Tensor Parallelism in PyTorch,","venue":null,"work_id":"e032578b-7229-408b-a726-367732e69812","year":2024},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.970195Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:814e27b43e2131d725f19692b4b9914360bbebfb43fef9f395018b86c0e0443d","observation_id":"1925a9da-25db-43c4-948d-e6befcaffe78","resolution":{"observed_at":"2026-08-11T12:23:19.496119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06942","last_updated":"2024-04-23T11:55:01Z","snapshot_observed_at":"2026-08-16T15:33:48.347943Z","submitted_at":"2023-05-11T16:20:51Z","title":"Optimizing Distributed ML Communication with Fused Computation-Collective Operations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06942","snapshot_observed_at":"2026-08-11T12:23:18.976636Z","title":"Optimizing distributed ml communication with fused computation-collective opera- tions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.976636Z"},"links":{"cited_paper":"/paper/2305.06942","citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:10783c604e4a575b9098dc5b2f4e05dabcab4e6a515f29c43ad1b27f511264fd","observation_id":"0a16a08d-0815-4c5e-98c6-19f098eae38b","resolution":{"observed_at":"2026-08-11T12:23:18.976636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:18.988507Z","title":"Breaking the Computation and Communication Abstraction Barrier in Distributed Machine Learning Workloads,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.988507Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:22dfb5b3df80727f7b31081e35fdd48cfa27b363c76bdb3aa1a568b5b3dfaf92","observation_id":"25d52610-b9b8-4db3-917c-45ac4402b6f3","resolution":{"observed_at":"2026-08-11T12:23:18.988507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:19.004428Z","title":"Overlap Communication with Dependent Computation via Decomposition in Large Deep Learning Models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:19.004428Z"},"links":{"citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:c3542308fdbf2da7c9897234bad13a0a94c88c2acd0d8f70969b922e678a500c","observation_id":"54b67e22-4c11-4532-a4be-47ce55e0e45e","resolution":{"observed_at":"2026-08-11T12:23:19.004428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-11T12:23:18.559962Z","title":"Available: https://arxiv.org/abs/2304.11277","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:18.559962Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2412.14335"},"observation_digest":"sha256:70a58f6c8410c52a2449a2c78b5df2b4dd19bb02ef1cab65b5c05ecc285aa1ab","observation_id":"babe03a7-517b-4b39-9cf5-f1d3e8580eb1","resolution":{"observed_at":"2026-08-11T12:23:18.559962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.14335","last_updated":"2025-04-25T05:08:45Z","latest_version":2,"primary_category":"cs.AR","snapshot_observed_at":"2026-08-17T05:26:26.769085Z","submitted_at":"2024-12-18T21:09:08Z","title":"Optimizing ML Concurrent Computation and Communication with GPU DMA Engines"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":27},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 1 inbound Pith citation observation for arXiv:2412.14335."}