{"as_of":"2026-08-07T23:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6801e70d65d8cf4dafa57c9b7fc3bd8d2b28a14323db6ab3fe8730b936875456","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T21:25:20.987873Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16100/citation-record","integrity":"/paper/2607.16100/integrity","json":"/paper/2607.16100/citation-record.json","paper":"/paper/2607.16100"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:13.775104Z","title":"Deepseek-v3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:13.775104Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:5cb737e517ee809a583c4548e8dd593aa4a90571607b5545b0e103677ab6d97a","observation_id":"4a9ad259-59ce-4d54-81d1-e51c4da5b342","resolution":{"observed_at":"2026-08-01T21:25:13.775104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:13.912073Z","title":"Deepseek-v3/r1 671b deployment guide: Gpu require- ments,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:13.912073Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:5aab262db4e0c97e5bee4824ab00000ff5a7e1ade29ea4466bc56b6a85b96097","observation_id":"0b3788ff-7317-43c7-938d-9aa9caffd13f","resolution":{"observed_at":"2026-08-01T21:25:13.912073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:14.061863Z","title":"Efficient memory management for large language model serving with pagedattention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:14.061863Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:1c2315855dd4bf18fd45f8b225996eb4963b8ae4e06c6b40458cbcaf0e8c3fff","observation_id":"6e35e9c3-5090-4f82-99a9-a745e6e9b133","resolution":{"observed_at":"2026-08-01T21:25:14.061863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:14.205913Z","title":"State of ai: An empirical 100 trillion token study with openrouter,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:14.205913Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:219b3658ace673b69f841fafa62331ede243b38ac2ee5638cd380722f88c8417","observation_id":"afbebda9-16f1-445a-8503-05689076a4b6","resolution":{"observed_at":"2026-08-01T21:25:14.205913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:14.336839Z","title":"Sglang: efficient execution of structured language model programs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:14.336839Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:6ed56e37db6374fc9d6c5504c42ee61b4fee297045b9cd063f445eee88238454","observation_id":"c8f2e045-189d-482d-a104-95b85da321dd","resolution":{"observed_at":"2026-08-01T21:25:14.336839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:14.520829Z","title":"Tensorrt-llm: A library for optimizing large language model inference,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:14.520829Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:7aafc890f615102a53a151a9bfd8a03d81ade636f4f1f0e302b3a604d11f4efb","observation_id":"f3903cc2-f50f-4753-8ce8-39a453417ea1","resolution":{"observed_at":"2026-08-01T21:25:14.520829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:14.834402Z","title":"CoreWeave Pricing: Instance Pricing,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:14.834402Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:853a3d73f37e292f7dd912f5f7912c05133a6c86d827df458dde5e28d36ec23f","observation_id":"1038d302-deab-4ff1-8a98-511433a776a5","resolution":{"observed_at":"2026-08-01T21:25:14.834402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:15.004162Z","title":"Scaling-up pytorch inference: Serving billions of daily nlp inferences with onnx runtime,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:15.004162Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:b023dc80f937fdcf62994941e6569c51cd00428e46da82f58d5b3ecb447c3c1b","observation_id":"09056ba9-bbfb-4762-973b-7222605e7748","resolution":{"observed_at":"2026-08-01T21:25:15.004162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:15.133947Z","title":"Understanding data movement in tightly coupled heterogeneous systems: A case study with the grace hopper superchip,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:15.133947Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:649ddc697e8ded361431fabb51647727fdebe37cbbbc15364f41a7d029c644da","observation_id":"e789aa8c-d279-4c85-84b0-cf6a4576cf83","resolution":{"observed_at":"2026-08-01T21:25:15.133947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:15.320821Z","title":"Demystifying NCCL: An In-Depth Analysis of GPU Communication Protocols and Algorithms ,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:15.320821Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:5ec92823012256422b49294ccb1a7f9c4e1e42f2244368d9192a84ba3066772e","observation_id":"ba6e4d6b-f423-46cb-a0eb-4d6c06e43fee","resolution":{"observed_at":"2026-08-01T21:25:15.320821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:15.476182Z","title":"NVSHMEM communication library,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:15.476182Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:0b9f21dad3fb2c3fd58a893436001ba7667ee6ec1851e0ada67a12fd676ae72e","observation_id":"e5220af4-d77e-4356-afdb-85ce704bc8c2","resolution":{"observed_at":"2026-08-01T21:25:15.476182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:15.616175Z","title":"ROCm Communication Collectives Library (RCCL) Documentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:15.616175Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:0d027010718950cd2f1ce49bbe57a0de52fb685d80c86523437d2d0172c7e29a","observation_id":"f7731326-971c-4750-b79f-2deac8501581","resolution":{"observed_at":"2026-08-01T21:25:15.616175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:15.792579Z","title":"AMD ROCm Documentation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:15.792579Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:d69778561fead900cc162a5e356b42dd88f085aa6cd0caf6bb85fc158e9d9710","observation_id":"af79158d-7236-4e53-a8a2-d0bf6213a478","resolution":{"observed_at":"2026-08-01T21:25:15.792579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:15.907979Z","title":"Accessed: February 2026","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:15.907979Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:4d2bf7a2cabce19e18d2c431d4a7825073b6336325b5f537dbe98306c3baf36e","observation_id":"7d36d779-647d-4b94-b44a-7a884e24b51c","resolution":{"observed_at":"2026-08-01T21:25:15.907979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:16.056139Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:16.056139Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:38e2ee1a032142c31c31b48ec9131ce9b9ec55bfa272f4c6e0131ca2c189483b","observation_id":"f4b5d931-844d-4bb2-b6c4-bc1ca39339b5","resolution":{"observed_at":"2026-08-01T21:25:16.056139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:16.165890Z","title":"An introduction to cuda-aware mpi,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:16.165890Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:4bfd994445af851caa0a39e2e33befb69b1583e4425e11be1803eac03e7a3013","observation_id":"f1ca6079-e9d0-4b9a-9fd3-08e37a72c1ad","resolution":{"observed_at":"2026-08-01T21:25:16.165890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:16.359083Z","title":"Enabling fast inference and resilient training with nccl 2.27,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:16.359083Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:a7fe014379edddc9250d5fc233417365f7f5fd274289187ff415495153f1caa5","observation_id":"ae8a94c5-8d78-4b20-abc1-adb893da5acd","resolution":{"observed_at":"2026-08-01T21:25:16.359083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:16.494336Z","title":"Gpu-initiated networking for nccl,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:16.494336Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:a4c58507a284a77c98701ed09ccd8bc3850076f3fa9d0de478af15f0f6005a34","observation_id":"a34d0e29-9dd8-496f-aa53-0b6ec32830d7","resolution":{"observed_at":"2026-08-01T21:25:16.494336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:16.661046Z","title":"NVIDIA, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:16.661046Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:79d4126e792976852e97c5685a50988d30a3b15a4194bb4d35babe0cc5a93fda","observation_id":"39a171ef-35a5-41c5-aca5-eb4f25696c3f","resolution":{"observed_at":"2026-08-01T21:25:16.661046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:16.784410Z","title":"Fusing communication and compute with new device api and copy engine collectives in nvidia nccl 2.28,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:16.784410Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:ec5d5c8748704fa2bfe31551434b4a26483cc7112d3493304d02dacdc6380587","observation_id":"eb7c6918-a749-4e52-9d5b-c23d4e978426","resolution":{"observed_at":"2026-08-01T21:25:16.784410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:16.857736Z","title":"PyTorch Foundation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:16.857736Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:d3590cd28b16f7364af4d2e8f99af0c556eba14095ad83aba6fca8f3d64bd1ac","observation_id":"d9f3656d-35c1-48a9-bc7b-29758dbb8a80","resolution":{"observed_at":"2026-08-01T21:25:16.857736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:16.919904Z","title":"NHR@FAU, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:16.919904Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:6518a09061d4e5e4115f17518c452120e3c580d7fa93fded4a9f814e48bf7894","observation_id":"6553156a-7e56-4d0e-a740-6027b92cbe45","resolution":{"observed_at":"2026-08-01T21:25:16.919904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01703","last_updated":"2019-12-03T22:06:05Z","snapshot_observed_at":"2026-07-06T08:41:49.632205Z","submitted_at":"2019-12-03T22:06:05Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01703","snapshot_observed_at":"2026-08-01T21:25:16.982682Z","title":"Pytorch: An imperative style, high- performance deep learning library,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:16.982682Z"},"links":{"cited_paper":"/paper/1912.01703","citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:7d8c90054cb30ca680d83f0ac4398125e8358afcae605b65df28bc5bdd20c906","observation_id":"472f42f1-784e-4951-96e8-a644b2f1a4ec","resolution":{"observed_at":"2026-08-01T21:25:16.982682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:17.085329Z","title":"TensorFlow: Large-scale machine learning on heterogeneous systems,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:17.085329Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:82055d1e6d4a9936bc4ff717910d054f672815da013ff7f350ab5917968ceddc","observation_id":"1b5388cb-f193-45bd-85b0-93ad50f1a373","resolution":{"observed_at":"2026-08-01T21:25:17.085329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:17.160785Z","title":"NVIDIA Corporation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:17.160785Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:3a182b898a2cf5359ffb6a91fcf674389380c313aef3ae04c727dcde6bd14edc","observation_id":"88c2afe9-aa80-4fc4-a87d-596cccc7a504","resolution":{"observed_at":"2026-08-01T21:25:17.160785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:17.331377Z","title":"NVIDIA Corporation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:17.331377Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:a4923dabc7b96fb8db6b03d83e75ca41cbfa63271e1cf816f613cd957b4687a9","observation_id":"b3a6a6a7-957e-44d1-ae52-321de4b59c6c","resolution":{"observed_at":"2026-08-01T21:25:17.331377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:17.416705Z","title":"Llm inference beyond a single node: From bottlenecks to mitigations with fast all-reduce communication,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:17.416705Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:b1214cc0a5cfbf32bfae74d04ffc9ec62ef6acf5288e9d34a3950d44117cbafd","observation_id":"8c77e832-ca44-4a66-9721-44529684ea50","resolution":{"observed_at":"2026-08-01T21:25:17.416705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:17.512162Z","title":"Msccl++: Rethinking gpu communication abstractions for ai inference,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:17.512162Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:007cbbc0301ce485082616e6f5a65a061821421ce20ea925c7e1c5d82b0da202","observation_id":"5e9e99dc-cd28-492c-9afa-81c4ee1ec49f","resolution":{"observed_at":"2026-08-01T21:25:17.512162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:17.600194Z","title":"Nvidia gtc 2025 - built for reasoning, vera rubin, kyber, cpo, dynamo inference, jensen math, feynman,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:17.600194Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:6c90f17e212391a693d89d58e1dc749da03a10fb06bd7f36fd05763bd48e4366","observation_id":"555e25db-a80a-457d-a863-9cd2a6899968","resolution":{"observed_at":"2026-08-01T21:25:17.600194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:17.688668Z","title":"Colossus: xai’s supercomputer for grok,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:17.688668Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:92b1c9192ef3c823ad73495950ff45218fc9feb4b931ffeb2d5dfe688f9febc7","observation_id":"07f573ca-22b3-4bc6-8073-ee66872fefe8","resolution":{"observed_at":"2026-08-01T21:25:17.688668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:17.756420Z","title":"Recent improvement to open mpi allreduce and the impact to application performance,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:17.756420Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:5a0736cdc0f102e78ef97933c6d26f6ce7d1d109ee1b12f584c4d4d9f89659de","observation_id":"84ec75fb-c0dc-46ea-83d4-410030bb12c2","resolution":{"observed_at":"2026-08-01T21:25:17.756420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:17.859961Z","title":"Revisiting the time cost model of allreduce,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:17.859961Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:c50628addf938dcece48870e6de819765e2c9726a1ec309428e9a22a01b1b7e8","observation_id":"749fc5d6-ab5c-4ce0-b39b-d74a13e3be6f","resolution":{"observed_at":"2026-08-01T21:25:17.859961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:17.951226Z","title":"xccl: A survey of industry-led collective communication libraries for deep learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:17.951226Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:c1310bbeb5e3cb52aba28cfdb527b2d2df76d32424a317c6e374708bc5659bae","observation_id":"fafed51a-9d45-45a3-a82e-2b0eddf758a9","resolution":{"observed_at":"2026-08-01T21:25:17.951226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:18.026695Z","title":"Hear: Homomorphically encrypted allreduce,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:18.026695Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:d9e4d8962ca890c3776f729443617295a70af572930e056de972b9c5b4c744e7","observation_id":"f7d1e527-d487-4679-9914-4503d0286d0f","resolution":{"observed_at":"2026-08-01T21:25:18.026695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:18.218838Z","title":"A survey of mpi usage in the us exascale computing project,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:18.218838Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:34adb8598640ceb0b11e720dc2ee14d508049491f80e9b929c1c3ee025e61eb5","observation_id":"fac11bdf-0895-49b3-8972-47ca79be7a87","resolution":{"observed_at":"2026-08-01T21:25:18.218838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:18.463178Z","title":"A large-scale study of mpi usage in open-source hpc applications,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:18.463178Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:01884cad292946ec1dea349419fd9c6e6a8c09c7d2c970a9032d46343f32255d","observation_id":"7a162cce-669a-4284-ad8d-842c61632797","resolution":{"observed_at":"2026-08-01T21:25:18.463178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:18.590758Z","title":"Short-circuiting rings for low-latency allreduce,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:18.590758Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:5c2d81b837b538f5eaff1244fd5a526de7e1e5a15fd22a5fdc7053f0c7b38ccb","observation_id":"a0ae434e-702d-4a55-9279-4ed928885529","resolution":{"observed_at":"2026-08-01T21:25:18.590758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:18.684480Z","title":"Cuda c++ programming guide","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:18.684480Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:9145a082f9663ffd603a0c71d0b618aa979b1cbb7caa238a2e749a096595b103","observation_id":"f41d774e-b592-4c46-a878-9c84b31b3ad8","resolution":{"observed_at":"2026-08-01T21:25:18.684480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:18.772103Z","title":"Parallel thread execution isa version 8.0","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:18.772103Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:3355aad7a38cd9890aaa774b4ade560e0db09c99dd33a89c782d86c8bb61aca6","observation_id":"0252082f-c101-40bb-ae82-dc161755edab","resolution":{"observed_at":"2026-08-01T21:25:18.772103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:18.845547Z","title":"vllm container (version 26.02-py3),","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:18.845547Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:92b04479ebb4e556631cdd2c9b7e88a7e9d7aad793781efbc8e06ee7a879551f","observation_id":"afb4469f-2c07-4271-a037-cdab3a06269b","resolution":{"observed_at":"2026-08-01T21:25:18.845547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:18.896433Z","title":"Network-offloaded bandwidth-optimal broadcast and allgather for distributed ai,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:18.896433Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:7998d3a81fb85a1ef3cfd39508642c3ec8fe02307be98eb5045e2ea6135ed6ce","observation_id":"784214d7-9123-4747-8d89-936f6bdeeace","resolution":{"observed_at":"2026-08-01T21:25:18.896433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:19.083488Z","title":"Comparative analysis of large language model inference serving systems: A performance study of vllm and huggingface tgi,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:19.083488Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:3c90445a59fd39cb8d13093c7f7321cc45da412d114614e537cd0fd23ed010cb","observation_id":"2f37d146-a83d-4999-ac3a-30f47a9a516a","resolution":{"observed_at":"2026-08-01T21:25:19.083488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:19.181539Z","title":"vllm – technology radar entry,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:19.181539Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:ac28fb6f2326f1153e4c7bb327ed6b82af8cc08935611695e8d372fcba34b820","observation_id":"8701c828-c2be-4774-8eba-d71b78d59efd","resolution":{"observed_at":"2026-08-01T21:25:19.181539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:19.273592Z","title":"The huge potential implications of long-context inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:19.273592Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:ef2297c16e63941e1c61f61b436898de819a7c2aaac9c9337880122b162426dd","observation_id":"323375ca-c4ab-487e-ba67-eee2cd45c0fe","resolution":{"observed_at":"2026-08-01T21:25:19.273592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1406.2024","last_updated":"2014-06-08T20:52:15Z","snapshot_observed_at":"2026-07-06T03:45:47.981395Z","submitted_at":"2014-06-08T20:52:15Z","title":"Hilfer fractional advection-diffusion equations with power-law initial condition; a Numerical study using variational iteration method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.2024","snapshot_observed_at":"2026-08-01T21:25:19.006976Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:19.006976Z"},"links":{"cited_paper":"/paper/1406.2024","citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:1acd5accefe8e954f6ecec23c2b5162a3b00487450a02f7e488ef0f397245e29","observation_id":"0ffa4cbf-30c7-47a0-80ab-8881c503fa2b","resolution":{"observed_at":"2026-08-01T21:25:19.006976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:19.440969Z","title":"Chain of agents: Large language models collaborating on long-context tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:19.440969Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:1405d8e4429ad189f95ea95746fb7f644a4ef87d3e2ad7de5170eb17c0d0b612","observation_id":"c1127a6f-4641-49b7-aa98-7e64e2d365ea","resolution":{"observed_at":"2026-08-01T21:25:19.440969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:19.528704Z","title":"Breaking the boundaries of long- context llm inference: Adaptive kv management on a single commodity gpu,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:19.528704Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:63334e2dd9f99719a41cdba3e79f065724e39b7b75676e8d36be0ec4ffac73bf","observation_id":"9748d69e-2b66-4ed0-b867-61dc58a6b85b","resolution":{"observed_at":"2026-08-01T21:25:19.528704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:19.629418Z","title":"Prefill-decode disaggregation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:19.629418Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:0af60f616f5887a2eebedd9f58f1ceed95fe5bbbcd73114a6cfdc9e7cb66d5e1","observation_id":"1d5f83da-1bb3-438b-abbe-41a0e30dcfb5","resolution":{"observed_at":"2026-08-01T21:25:19.629418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:19.382129Z","title":"Is long context all you need? leveraging llm’s extended context for nl2sql,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:19.382129Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:666ab460f8f7ae0bed1c730c141bf6004a6030e512092b0021be6ebda852af1c","observation_id":"8aafc676-e597-4ac0-ac20-bcf8c7c6341d","resolution":{"observed_at":"2026-08-01T21:25:19.382129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:19.766032Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:19.766032Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:70c78f1e4393cc8dff6943d9cb93330672d4a81f6701ab9a9deb2c0eae775d79","observation_id":"7e090cab-d299-4f45-92fe-6193df7732e8","resolution":{"observed_at":"2026-08-01T21:25:19.766032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:19.916482Z","title":"Accessed: March 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:19.916482Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:016195792e8a20e77cfd9ebc478718319e8bc23918902023fc4a59b278d21466","observation_id":"874e5964-549e-489c-a52b-7356e2e0dc95","resolution":{"observed_at":"2026-08-01T21:25:19.916482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1177/10943420241271017","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Amrex and pyamrex: Looking beyond the exas- cale computing project,","venue":"The International Journal of High Performance Computing Applications","work_id":"5636d821-c46f-4c0e-8d4d-bb6311ce5ed6","year":2024},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:19.998763Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:07935476ff6ef6d363079def03fef32ca77e6b8b2e4484e6ca2791caddd0d98a","observation_id":"4f1b716c-61c9-489b-b789-8d1fbb58b7ae","resolution":{"observed_at":"2026-08-01T21:28:32.655939Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:19.670034Z","title":"Slo-aware compute resource allocation for prefill-decode disaggregated llm inference,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:19.670034Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:c52e2874706387ee6e12dc8078734f07c8cfbf73eceb88437fa0582bd0b7154c","observation_id":"91ae64af-c590-47a8-b86f-c6d071eaf952","resolution":{"observed_at":"2026-08-01T21:25:19.670034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:20.252829Z","title":"Qmcpack: an open source ab initio quantum monte carlo package for the electronic structure of atoms, molecules and solids,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:20.252829Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:6a10052c49441aeac5075c93c2eb7788e6884bd5b932e97a6ee5aa07017368fe","observation_id":"2a329e9e-4041-45be-90bd-4bc80afa968c","resolution":{"observed_at":"2026-08-01T21:25:20.252829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:19.821885Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:19.821885Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:78e8e6f43bb8cde5015fdaa60e514301292b006b6ef41b74750e113b54f2e051","observation_id":"d3c997e9-79f3-4624-b9f7-6a224d926070","resolution":{"observed_at":"2026-08-01T21:25:19.821885Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:20.385515Z","title":"NVIDIA HPCG Benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:20.385515Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:28fa6469715b589644b3406eb53aa25c95e1e47dc1baec01dff1594ea196edc4","observation_id":"6005d775-7c55-4096-9985-7542cd1c6bc9","resolution":{"observed_at":"2026-08-01T21:25:20.385515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:20.464831Z","title":"Accessed: March 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:20.464831Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:18025c90f299865bce5c3cb8b44cf993db38c97019cb560d752e119adf372355","observation_id":"7a2f491e-e59a-479f-8ee1-c644e10c9fc3","resolution":{"observed_at":"2026-08-01T21:25:20.464831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:20.077961Z","title":"AMReX issue #4821: Device-initiated collectives in NCCL/RCCL","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:20.077961Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:4cd65f011a7e63e94884e5f53ac069d7df201d0a7adef1a0f85ba069f8d5c0b7","observation_id":"be738fcb-82d0-463c-96d2-c14d401588b6","resolution":{"observed_at":"2026-08-01T21:25:20.077961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:20.626672Z","title":"New research infrastructure: ’alps’ supercomputer inaugurated,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:20.626672Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:df034a2a05cffc381cda0c94d8a821ccdccdb69708d69db009fa2f1a09f7d63b","observation_id":"4702eab3-4a03-4345-9f35-ca16d8197c20","resolution":{"observed_at":"2026-08-01T21:25:20.626672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:20.731027Z","title":"Flashinfer: Efficient and customizable attention engine for llm inference serving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:20.731027Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:02add0087a047b784016510a16f2c233260d09b0d27531fe4a1fa04f89ea397c","observation_id":"1f8ab145-110b-45b5-b5cf-879508324856","resolution":{"observed_at":"2026-08-01T21:25:20.731027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:20.332056Z","title":"Qmcpack issue #4654,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:20.332056Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:82bc80b75b3800b316fe82f94299b6c668e6707ef68fa98f0666e93f2b8dfa6a","observation_id":"cd35d561-5800-452b-ba99-0071dc64e305","resolution":{"observed_at":"2026-08-01T21:25:20.332056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:20.853881Z","title":"Nccl ep: Towards a unified expert parallel communication api for nccl,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:20.853881Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:200d9834751af3899c5a2b42d17418bc4945c7bf928f4a94d8b7efbf88c11a62","observation_id":"90e64a8e-5e91-4298-a3e9-ab2d51c5fe27","resolution":{"observed_at":"2026-08-01T21:25:20.853881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:20.934999Z","title":"Enhancing dis- tributed inference performance with the nvidia inference transfer library,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:20.934999Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:44351ebef6f6dee565559f29b8777a1fe8c22b408283445c3146060f056ceae4","observation_id":"02d42690-5e33-42c5-80e1-106ff10d1444","resolution":{"observed_at":"2026-08-01T21:25:20.934999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:20.549073Z","title":"The elpa library: scal- able parallel eigenvalue solutions for electronic structure theory and computational science,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:20.549073Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:c212afa3265718676ab8b9a06d9217cb1820be356fa8f6fafea5b10c5bfeb452","observation_id":"29b8628c-a227-432b-84c2-a7050299050e","resolution":{"observed_at":"2026-08-01T21:25:20.549073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:20.804322Z","title":"Deepep: an efficient expert-parallel communication library,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:20.804322Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:e91c5e547322939d6697b1c5850d0911a3a21d3583c6a2ae2abcbda8186a5f0c","observation_id":"0836cd97-20e2-42c9-abfe-54893ca7b307","resolution":{"observed_at":"2026-08-01T21:25:20.804322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:20.987873Z","title":"Gpt-5.4 chatbot,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:20.987873Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:01e9c1146959de75a64c9d5d3430fa499c6425cd54ca35143721b55934a1989a","observation_id":"aa173ed3-ed6f-40fd-bc13-383abd1e9ad4","resolution":{"observed_at":"2026-08-01T21:25:20.987873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:18.335994Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:18.335994Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:12c65d9c1b83a93babf2acad0b8a7349022f7fb9b2cd32fdb0ca935812e0d285","observation_id":"ae2cf742-ceec-41a6-b499-f3cdccdb1871","resolution":{"observed_at":"2026-08-01T21:25:18.335994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:18.096674Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:18.096674Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:5317086b812b3263a6917d20465d3c100862b86ca0b56add327515e2be4d5c52","observation_id":"6947ed3d-468a-4bd4-b977-0ba2f5b4af63","resolution":{"observed_at":"2026-08-01T21:25:18.096674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:17.236864Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:17.236864Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:78973ce38a452c9fa5306d18dce1eb650e5dbee594f79d4f00b172031afef5c8","observation_id":"f0c5898d-7da4-438e-8d51-52d3a6726d18","resolution":{"observed_at":"2026-08-01T21:25:17.236864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:25:20.176773Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T21:25:20.176773Z"},"links":{"citing_paper":"/paper/2607.16100"},"observation_digest":"sha256:0d22a6ff5b376ec565b24b09b1ff9087a63a25b52a1a0e7a1fd0a49777b146c2","observation_id":"78451cc0-945c-465e-902a-fe41b4d093f9","resolution":{"observed_at":"2026-08-01T21:25:20.176773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16100","last_updated":"2026-07-17T16:36:43Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-07T13:43:07.943144Z","submitted_at":"2026-07-17T16:36:43Z","title":"Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":68,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2607.16100."}