{"as_of":"2026-08-06T03:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:306bb76d8099f25f1a311407d71f3c4356808cdd5da382ce7833f835ef39ae2b","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T03:40:12.723229Z","state":"measured"},{"denominator":86,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":86,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.23115/citation-record","integrity":"/paper/2607.23115/integrity","json":"/paper/2607.23115/citation-record.json","paper":"/paper/2607.23115"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:10.999156Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:10.999156Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:52b2374aa6b3a7cb7ccea447be1609f11420002d8bd3278b02cd68b62179e4df","observation_id":"e81fbd40-63ff-4fc2-bd55-05114131724b","resolution":{"observed_at":"2026-08-01T03:40:10.999156Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.005260Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.005260Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:2caa203a0893f4304aca70df4d50cb0a14d2a9abbce2c8cd38d661738a284aca","observation_id":"4da32b21-7b4a-4b7e-b44f-f20dc4ec28b5","resolution":{"observed_at":"2026-08-01T03:40:11.005260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.010282Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.010282Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:4d6a67b87c8b46a1a26c4a8a114b5a8aae15cc6928b3ee39813d61d19b4d64da","observation_id":"a5039eec-7bfa-4d8e-85b5-96275f47ad23","resolution":{"observed_at":"2026-08-01T03:40:11.010282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.016717Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.016717Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:184b0603ad61c2d241ad25e930e8ecc5052def0d54212a30d990489d912e6a80","observation_id":"ee08d559-9968-4f12-9b7c-842efcc8f3e2","resolution":{"observed_at":"2026-08-01T03:40:11.016717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.021558Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.021558Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:ac68aa0e3cdf18004a36c6907c38181323e60414738594917e450cbb38e9fc5c","observation_id":"75dcedb9-39d9-49cb-8803-3983dd7e0a82","resolution":{"observed_at":"2026-08-01T03:40:11.021558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.026430Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.026430Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:a80e5eec01270701a3d3ae431575b1867a14ed7f9a28844106f30cf0e3a11585","observation_id":"acf32578-7480-4dd9-8ee9-a728a93cabdc","resolution":{"observed_at":"2026-08-01T03:40:11.026430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.031727Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.031727Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:4aa36e96705debebc747e3c3c86eb8ffbfd69f0b9b4fae96cf3a2a5168e63938","observation_id":"398ec4d2-4f66-46a8-8a2b-aebc9527be8d","resolution":{"observed_at":"2026-08-01T03:40:11.031727Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.035939Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.035939Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:f53e359bacb0f87fed412ec31456532e6419bc9a3c9ae28713e81571f8dc1d17","observation_id":"d6d493f9-cf75-428d-9f6b-79d4780f6d6c","resolution":{"observed_at":"2026-08-01T03:40:11.035939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.040074Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.040074Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:5326d97afd724a0ecae0c3c60749d5abc75704e7f6e98eccc67c1de297c1969a","observation_id":"f91212a2-8ee2-4d32-b5d3-de5ef048aaf6","resolution":{"observed_at":"2026-08-01T03:40:11.040074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.044193Z","title":"Scissionlite: Accelerating distributed deep learning with lightweight data compression for iiot.IEEE Transac- tions on Industrial Informatics, 20(10):11950–11960, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.044193Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:2b469c705cf8c8f527a44b95751123fac6a21c8961a95b1aa55ad5648d9d2f5a","observation_id":"faf139c7-f5ae-4003-a1d8-05b1a98d601e","resolution":{"observed_at":"2026-08-01T03:40:11.044193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.048531Z","title":"Tooth: Toward optimal balance of video {QoE} and redundancy cost by {Fine- Grained}{FEC} in cloud gaming streaming","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.048531Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:d763e7833c0269a1c49877a8d57cbfddfb8edaef2231c566e1f8d5b5e865f39a","observation_id":"cfd4fa3d-553e-4145-a395-0831c5726fd3","resolution":{"observed_at":"2026-08-01T03:40:11.048531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.053431Z","title":"Crux: Gpu-efficient communication scheduling for deep learning training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.053431Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:cade0face3f8a6832223df15c4599bec9dd2d858f967228cb689feac3c087571","observation_id":"a98f0dba-9b93-43cf-930d-3a588ffe6c00","resolution":{"observed_at":"2026-08-01T03:40:11.053431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.057720Z","title":"Eva: Cost- efficient cloud-based cluster scheduling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.057720Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:04bf82a1b7d78af01f7504495eaff43d4ca4acca601040d1b274586879ae17c9","observation_id":"7aba9b77-b011-46a8-995d-5a2d2eb23de6","resolution":{"observed_at":"2026-08-01T03:40:11.057720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.061940Z","title":"Kernel oper- ations on the gpu, with autodiff, without memory over- flows.Journal of Machine Learning Research, 22(74):1– 6, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.061940Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:95492c84ad8a63f9c151c9d15b800c6561aa034ec9e97df939954c0161be1eae","observation_id":"5af2baa5-b736-4b88-9b16-8515905d1d06","resolution":{"observed_at":"2026-08-01T03:40:11.061940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.066423Z","title":"Remote procedure call as a managed system service","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.066423Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:33fad29e6fd5359381698efab0b73195003bd5d0bb717384dfd51f849f3ee8cd","observation_id":"7bbd9110-e6f2-46af-85ee-526807ff3686","resolution":{"observed_at":"2026-08-01T03:40:11.066423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.070517Z","title":"Multiplexing dynamic deep learn- ing workloads with slo-awareness in gpu clusters","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.070517Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:6cca6f97fc1677bccf0c5ef537e685dfe884bf7e542ffb2ebcf37b7d79a47327","observation_id":"591726b1-51c1-47dc-b966-fdb425e9b7e1","resolution":{"observed_at":"2026-08-01T03:40:11.070517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.074609Z","title":"{GRACE}:{Loss- Resilient}{Real-Time} video through neural codecs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.074609Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:950ef93b3eef46cc3b03651c1c1e597ba93eb05f1faf116b0a07ada2926f29a9","observation_id":"45221d94-c5ea-4cb3-a447-c93037871049","resolution":{"observed_at":"2026-08-01T03:40:11.074609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.078564Z","title":"Flashattention: Fast and memory- efficient exact attention with io-awareness.Advances in neural information processing systems, 35:16344– 16359, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.078564Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:0818d901c281248446aae7af6f4ed1ac988b60b113dcb36de26b4745325f8963","observation_id":"7379fdeb-82e1-4252-8bb5-d5414e62298a","resolution":{"observed_at":"2026-08-01T03:40:11.078564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.083135Z","title":"Oneadapt: Fast adapta- tion for deep learning applications via backpropagation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.083135Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:a30c66fbca81f08c6260f1249c76ab33ed00dc569c3ff19b37661d797593426c","observation_id":"e4812f51-687c-4fc5-a585-03122aa6c47f","resolution":{"observed_at":"2026-08-01T03:40:11.083135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.087432Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.087432Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:eb20f6c02f2e7085fc43475315188344ff409369613924373ff1ceb653ecd5af","observation_id":"85a1258d-f65f-47ea-86ae-05737e63e0c4","resolution":{"observed_at":"2026-08-01T03:40:11.087432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.091621Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.091621Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:cec714828d2f048d0ec93edd3d319c64400ebea965eb9372bd5a52f2a998a5b5","observation_id":"6b7fc549-6faf-42cb-82e9-bc59ca50a6b4","resolution":{"observed_at":"2026-08-01T03:40:11.091621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.095749Z","title":"Dgsf: Disaggregated gpus for serverless functions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.095749Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:50046b3a7a17c116a98086b48b5fab8489da8d8999536e67793a581142834c70","observation_id":"379c6fbb-fec8-47e1-9d20-3021728b2615","resolution":{"observed_at":"2026-08-01T03:40:11.095749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.099856Z","title":"Rdma over ethernet for distributed training at meta scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.099856Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:f11eb51241e5404a53f30ecd34043e1de473684a0d58ac5d0dc4ae4931e5662a","observation_id":"818656c9-a51e-4238-b955-4067ca201da4","resolution":{"observed_at":"2026-08-01T03:40:11.099856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.104095Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.104095Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:eb937c278548a61ba3cc24efb39ebcf5e9627f9809f9b9cd0c1b057fdb6dcb17","observation_id":"d63b93d0-c65c-4979-947e-2eec9e855e89","resolution":{"observed_at":"2026-08-01T03:40:11.104095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.108698Z","title":"A gpgpu transparent virtualization component for high performance computing clouds","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.108698Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:74e99cb2e69614135ecda796cb4cd4fb0a7a0ab086550698dcca694cfe90a527","observation_id":"ee927be3-9751-4415-8937-0d7a837b8199","resolution":{"observed_at":"2026-08-01T03:40:11.108698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.113329Z","title":"Shin, Yibo Zhu, Myeongjae Jeon, Junjie Qian, Hongqiang Liu, and Chuanxiong Guo","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.113329Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:35a1b29588913186aa14564b8630ab928c42c21541b00a1fb0c4da05d7f7408c","observation_id":"ab9ae254-bd5c-408d-9972-c3ec21c2066f","resolution":{"observed_at":"2026-08-01T03:40:11.113329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.120130Z","title":"Kace: Kernel-aware colocation for effi- cient gpu spatial sharing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.120130Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:0915a40e930db7b75e510dd04362c6608d6b6e79d089cd2ef553f02e82272cdb","observation_id":"9e82ee4d-322c-478b-b98b-eddd16370dcd","resolution":{"observed_at":"2026-08-01T03:40:11.120130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.125670Z","title":"Microsecond-scale preemption for concurrent GPU-accelerated DNN inferences","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.125670Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:dfa3f6e949d904483caab34f2936cc14548ad4e1ce477d7d838bcb1fb11a66b3","observation_id":"b4ca0d1e-f0ff-4e5f-a691-c506cc9959ad","resolution":{"observed_at":"2026-08-01T03:40:11.125670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.130167Z","title":"Multi-agent collaborative infer- ence via dnn decoupling: Intermediate feature compres- sion and edge learning.IEEE Transactions on Mobile Computing, 22(10):6041–6055, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.130167Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:35f1bb43a3f56007e9bce6c01b36146064aa1d440b4cd4e51012d1734bd90b7a","observation_id":"834d32cb-73f6-4e79-96b7-042367f4f229","resolution":{"observed_at":"2026-08-01T03:40:11.130167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.134612Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.134612Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:8ca397e94ee6dc1826a01a92ebb547db044d8c600e889cd455418a31d3e2c094","observation_id":"6a4fff8d-2f02-44bf-a2e0-5806d25bd8c6","resolution":{"observed_at":"2026-08-01T03:40:11.134612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.138890Z","title":"In 20th USENIX Symposium on Networked Systems Design and Implementation (NSDI 23), pages 87–101, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.138890Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:e9fb09cc1ec646098fc777258b098c19b7d5d112e762f70519bf2621a998b8b5","observation_id":"6af4123f-65db-4204-9fe1-e3ee783c1dfa","resolution":{"observed_at":"2026-08-01T03:40:11.138890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.143422Z","title":"Charlie Hu, Xiaojun Lin, and Nan Deng","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.143422Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:2d58d9a93fd9dbb51b04635d8c9014f5d605e45d3ca2f7aba9a5bdb0a6c55e4e","observation_id":"895f8f53-7860-40f3-8e5f-32e8a2ff6f53","resolution":{"observed_at":"2026-08-01T03:40:11.143422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.147743Z","title":"A house united within itself: Slo-awareness for on-premises containerized ml inference clusters via faro","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.147743Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:e43ad4c84857f29586e0ce30d5db81cc056faeb0e82fb8c00c30aacf4d0328de","observation_id":"a12eb9f5-097c-4c74-ade9-57c9a012db8c","resolution":{"observed_at":"2026-08-01T03:40:11.147743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.152064Z","title":"Mor- ley Mao","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.152064Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:79111c24b659d85206a68327bc5f664678d71e462b6c40ac5ff9efc983ef8e3a","observation_id":"817605af-c388-4aec-bca1-2b9a568f9d27","resolution":{"observed_at":"2026-08-01T03:40:11.152064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.156399Z","title":"Deepum: Tensor migration and prefetching in unified memory","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.156399Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:6a74bccea4c7b1ad4083e9ea0dcc84269997cce0dad92e03d5f9da4627feca34","observation_id":"6d512668-de1e-402f-84e4-697d9c7ef85a","resolution":{"observed_at":"2026-08-01T03:40:11.156399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.161088Z","title":"A neural-network- based realization of in-network computation for the in- ternet of things","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.161088Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:7b71dcce5959d7e537e3577d0a731e680d910ed856c678a6b5fe8ffb52eeee7e","observation_id":"b6ab778c-3b3f-4b23-b486-80fd42e4dd23","resolution":{"observed_at":"2026-08-01T03:40:11.161088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.165512Z","title":"{SuperServe}:{Fine-Grained} inference serving for unpredictable workloads","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.165512Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:8bb0603ddce033c2b2f23d1cc74934285d5b6e63ac70f5a5cf44156bb0f6d59b","observation_id":"5ee45b07-34d1-42ca-b61d-e5cee2fea889","resolution":{"observed_at":"2026-08-01T03:40:11.165512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.169742Z","title":"A survey on in-network computing: Programmable data plane and technology specific applications.IEEE Communications Surveys & Tutorials, 25(1):701–761, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.169742Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:97e8474a65df4e9a005e826fc97cfc503a6843f45579ee623c9cedd5cec3aa7c","observation_id":"54e34d1c-f630-4ea1-b661-51f6b00f7317","resolution":{"observed_at":"2026-08-01T03:40:11.169742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.173949Z","title":"Navigator: Dynamic multi-kernel scheduling to improve gpu per- formance","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.173949Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:f98713734f72e761505a9e31a12d2d99c25cabd9b553362bbaaa123fb4c6d931","observation_id":"d438c829-33e9-49ed-9b5d-8fc735a80211","resolution":{"observed_at":"2026-08-01T03:40:11.173949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.178278Z","title":"Efficient memory manage- ment for large language model serving with pagedatten- tion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.178278Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:610b04181658ec7a9e745b71c33484aa43eba73e6f88a532af5d67c6b62de815","observation_id":"57aef14b-de47-4fa5-a3d9-552485dd5783","resolution":{"observed_at":"2026-08-01T03:40:11.178278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.182444Z","title":"Forecasting gpu performance for deep learning train- ing and inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.182444Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:c07b8b26a9fc4b264e2d74e63d1a420f3ca0a3e910ee32bf5ad52f0dbd53b810","observation_id":"2784287b-4418-4329-bb95-87bea9ede7f6","resolution":{"observed_at":"2026-08-01T03:40:11.182444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.186651Z","title":"A survey on large language model acceleration based on kv cache management, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.186651Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:b305e2906ff9e5821d63bcf74f9f55924a3ce0499e9315f8fd4d84371f492d52","observation_id":"93854fcd-8bc9-495f-8ba3-0e35228838d0","resolution":{"observed_at":"2026-08-01T03:40:11.186651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.190669Z","title":"THC: Accelerating distributed deep learning using ten- sor homomorphic compression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.190669Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:ddab7f0330a42e4046ac5cccf2e313dbcf71d6bc92808ab45eee5adaf8ea928c","observation_id":"59f34cb6-8c73-46c1-bac8-e7ddd46290ff","resolution":{"observed_at":"2026-08-01T03:40:11.190669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05459","last_updated":"2024-05-08T06:16:23Z","snapshot_observed_at":"2026-08-02T13:57:57.119489Z","submitted_at":"2024-01-10T09:25:45Z","title":"Personal LLM Agents: Insights and Survey about the Capability, Efficiency and Security","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05459","snapshot_observed_at":"2026-08-01T03:40:11.195265Z","title":"Personal llm agents: Insights and survey about the capability, efficiency and security","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.195265Z"},"links":{"cited_paper":"/paper/2401.05459","citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:7a9d7576d0313173b52b4bb052ab3fd2e19f72086915779da283d0b1de185dba","observation_id":"8832f8da-a903-4fa7-a36e-7e876239de19","resolution":{"observed_at":"2026-08-01T03:40:11.195265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.199805Z","title":"Incbricks: To- ward in-network computation with an in-network cache","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.199805Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:1747c50d1d40ab488a60974da2c62dd3ee72b91bc50d7bea7e91980c762f97a4","observation_id":"4f757e3e-db2e-4b27-86fc-7c7bf30891d0","resolution":{"observed_at":"2026-08-01T03:40:11.199805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.204037Z","title":"Cachegen: Kv cache compression and streaming for fast large lan- guage model serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.204037Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:4cb15a644f0d15e1f084837064ca5bcb77a951eacf9f5d4c54396256ec5b3739","observation_id":"9cc3512f-8635-4f4a-a61d-ab588b7d3118","resolution":{"observed_at":"2026-08-01T03:40:11.204037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.209596Z","title":"A convnet for the 2020s","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.209596Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:6a250a0681884fb255738cc243b6240f1f4b53bcc307736e5decf0c87c945cfc","observation_id":"74a2a691-484f-422e-ad78-ae137fa5c5cf","resolution":{"observed_at":"2026-08-01T03:40:11.209596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02170","last_updated":"2024-11-15T04:30:04Z","snapshot_observed_at":"2026-07-06T16:27:11.151651Z","submitted_at":"2023-10-03T16:05:48Z","title":"A Dynamic LLM-Powered Agent Network for Task-Oriented Agent Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02170","snapshot_observed_at":"2026-08-01T03:40:11.216782Z","title":"Dynamic llm-agent network: An llm-agent collab- oration framework with agent team optimization.arXiv preprint arXiv:2310.02170, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.216782Z"},"links":{"cited_paper":"/paper/2310.02170","citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:51306c553869755b899dc83715d602b520e24a876a9442b3ef8039ebfbd489f1","observation_id":"d225d4c4-314e-4207-a6cf-e764f6337ada","resolution":{"observed_at":"2026-08-01T03:40:11.216782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.228099Z","title":"A survey of storage systems in the rdma era.IEEE Transac- tions on Parallel and Distributed Systems, 33(12):4395– 4409, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.228099Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:72976037a7f1b4b6917b9687159c83557ab475baaa6950e6efc15a3e445f3951","observation_id":"5147f1f6-46fc-4e50-8ab4-02134dfaec9b","resolution":{"observed_at":"2026-08-01T03:40:11.228099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.240104Z","title":"Skyserve: Serving ai mod- els across regions and clouds with spot instances","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.240104Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:0200fa2bcf2dce9fab29d3909272b29f2f06c02ca87e5c12dc908e1fa96e5171","observation_id":"803fc393-b9d1-4a27-9bda-af2fae79b699","resolution":{"observed_at":"2026-08-01T03:40:11.240104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.252541Z","title":"Efficient scheduling policies for Microsecond-Scale tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.252541Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:b6ecec2de9c4db836ac1f41f76a40fce9a508c48359da2f029f3014e6fdf12fd","observation_id":"3f7e2269-9f65-4a92-9f83-c07e307cbf42","resolution":{"observed_at":"2026-08-01T03:40:11.252541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.266736Z","title":"To- ward performance-portable petsc for gpu-based exascale systems.Parallel Computing, 108:102831, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.266736Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:90d141a589fd2fa87ba27205e095fd304d71963ef5557ac0b4f8ab6dea31622c","observation_id":"5bf9d1f6-3277-4920-99de-e1685840341c","resolution":{"observed_at":"2026-08-01T03:40:11.266736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.285770Z","title":"Porting warpx to gpu- accelerated platforms.Parallel Computing, 108:102833, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.285770Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:d34111a2d46da0d55f4e2e81cedb0136341277a8268e810b55cac26cb2e3553b","observation_id":"5220bb3a-f75b-48e1-ad6c-dcef1b447bc0","resolution":{"observed_at":"2026-08-01T03:40:11.285770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.314644Z","title":"Jellyfish: Timely inference serving for dynamic edge networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.314644Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:08f3ef10fac537e0434336f0a1b370ecb0f0f3451354b07bb6645363835b82bc","observation_id":"ba9cc23b-1df0-4c96-a5f0-166389d8f973","resolution":{"observed_at":"2026-08-01T03:40:11.314644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.330029Z","title":"Bringing umap closer to the speed of light with gpu acceleration","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.330029Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:d027496db72f0912c3731280c7af8e77c3c93b88d4fdd227d308678caed1d91b","observation_id":"0bf2f227-ab26-4dc9-9b0a-8a3d888cce04","resolution":{"observed_at":"2026-08-01T03:40:11.330029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.337088Z","title":"Nvidia nvswitch: The world’s highest- bandwidth on-node switch","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.337088Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:9822d412b1fb6e21e14b2b24680431485f3b148fd0d4d35c0a849725562e0128","observation_id":"e333a6ea-f011-4074-9c60-244140e14361","resolution":{"observed_at":"2026-08-01T03:40:11.337088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.344509Z","title":"Gemel: Model merging for memory-efficient,real-time video analytics at the edge","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.344509Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:112a8f9f1e946794d32f8a0c249d84f3a83971c366df4697a8c469558c229b00","observation_id":"e97e016e-0e66-4ac1-a005-0ec3c96f368a","resolution":{"observed_at":"2026-08-01T03:40:11.344509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-01T03:40:11.352874Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.352874Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:a04eeb96ac28f972aaf88f06fb6fb854a3025fd0e1f8cd0303fe1cc6014abfaa","observation_id":"ba9ad0f5-3866-4e5e-8ef5-184567811aed","resolution":{"observed_at":"2026-08-01T03:40:11.352874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.364647Z","title":"{CASSINI}:{Network-Aware} job scheduling in machine learning clusters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.364647Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:96845d6b8fc67c0ec1f4fc74876ae00b8219f3e1038523f6c13d7381761b1028","observation_id":"5e56c7da-083f-4b4d-9639-22c3682c3071","resolution":{"observed_at":"2026-08-01T03:40:11.364647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.372960Z","title":"Sentinel: Efficient tensor migration and allocation on heterogeneous memory systems for deep learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.372960Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:ed809affb82a3dc21c2a3c914f7eec5d439fbb430e61b2eb0f1b151b81b40588","observation_id":"b84179bc-e235-4d4c-ba79-78842ad7de83","resolution":{"observed_at":"2026-08-01T03:40:11.372960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.379969Z","title":"Enabling large dynamic neural net- work training with learning-based memory manage- ment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.379969Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:ae20434b6a8a0a2e3dbe8e56d4dbea5c8067ce6ae10668c5cc4be203506f39ea","observation_id":"2900bced-7c98-4149-8e37-75d00f579e1d","resolution":{"observed_at":"2026-08-01T03:40:11.379969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.387513Z","title":"{Cloud-LoRa}: Enabling cloud radio access {LoRa} networks using reinforce- ment learning based {Bandwidth-Adaptive} compres- sion","venue":null,"work_id":null,"year":1959},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.387513Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:6fc0642ce70110e414f74013ede140a494f4004c300a1f300fef44c2f465eb95","observation_id":"748e008d-6c97-475a-b8f2-1ed5e89acc24","resolution":{"observed_at":"2026-08-01T03:40:11.387513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.394196Z","title":"Exploiting simultaneous communications to accelerate data parallel distributed deep learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.394196Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:2bd6a5a7820dcbe6f48104e25fa568e98bb96768ce6ebfe94dedb81e0aa26df1","observation_id":"b275ef95-bf4f-448f-9b27-da8cd39c9bc1","resolution":{"observed_at":"2026-08-01T03:40:11.394196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.400877Z","title":"Orion: Interference-aware, fine-grained gpu sharing for ml ap- plications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.400877Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:64f9163f570f52a9b9c9f47af0cca2c6a43d5a3708e78466f68cfdeeb5cd1d7e","observation_id":"693cf1f8-96ac-43b0-b349-607ef9f9dd10","resolution":{"observed_at":"2026-08-01T03:40:11.400877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.416566Z","title":"gremote: Cloud ren- dering on gpu resource pool based on api-forwarding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.416566Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:b79c69d89cf20d9db1b84c42b40b7189f2af54235925a680cf48a72464e26782","observation_id":"1e32dc8d-be47-41bc-89af-2f2e08ef8975","resolution":{"observed_at":"2026-08-01T03:40:11.416566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.440322Z","title":"Lammps-a flexible simu- lation tool for particle-based materials modeling at the atomic, meso, and continuum scales.Computer physics communications, 271:108171, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.440322Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:c948160dd2984bcd8311f767ed17e90ef88ed5862befae3228885416c676da30","observation_id":"188d3cf4-d525-4a75-9005-8c8caff3d0ab","resolution":{"observed_at":"2026-08-01T03:40:11.440322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.468036Z","title":"Plssvm—parallel least squares support vector machine","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.468036Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:7e96995945fb73e6f447fa0e7dfb1383145acb536dce56a062834703f29f7690","observation_id":"d9075125-c546-4c9d-8edd-367ac0d72b9c","resolution":{"observed_at":"2026-08-01T03:40:11.468036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.522658Z","title":"Aqua: Network-accelerated memory offloading for llms in scale-up gpu domains","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.522658Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:2aecfce12c93715c1316a296a3148acbfc1709467cda28515979decd91fc2476","observation_id":"5771c190-475e-4cae-95be-a852315c3cea","resolution":{"observed_at":"2026-08-01T03:40:11.522658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.576555Z","title":"Coflow scheduling for llm training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.576555Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:7e3d69386ef0d78ef740ed7050126a67c0266dc8afa4387925dff345b1ae3dd3","observation_id":"9ecc8377-7758-414f-9506-64ac79e2ed9a","resolution":{"observed_at":"2026-08-01T03:40:11.576555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13354","last_updated":"2024-01-24T10:30:39Z","snapshot_observed_at":"2026-08-04T23:44:23.715197Z","submitted_at":"2024-01-24T10:30:39Z","title":"Characterizing Network Requirements for GPU API Remoting in AI Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13354","snapshot_observed_at":"2026-08-01T03:40:11.630913Z","title":"Character- izing network requirements for gpu api remoting in ai applications.arXiv preprint arXiv:2401.13354, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.630913Z"},"links":{"cited_paper":"/paper/2401.13354","citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:8d5240f1b9f2aee73ca5e8cdf7ccbf591a94581b8c85d45d7a7d04b91e3314fe","observation_id":"158cf9d6-e008-4c7c-a59e-73473353b2b2","resolution":{"observed_at":"2026-08-01T03:40:11.630913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.675274Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.675274Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:3ff52d0bfdc535e1a34b6d010b37794ebdb6ba4e2e0687519a2ab8c3634889bd","observation_id":"b7884337-5363-4d05-b8a1-1ae263e751ab","resolution":{"observed_at":"2026-08-01T03:40:11.675274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.755151Z","title":"Beware of fragmentation: Scheduling {GPU-Sharing} workloads with fragmentation gradient descent","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.755151Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:4b540e962a4867b96ee490ad61424f9d228805ce8ffebd8ed2e5b7bb961904ee","observation_id":"b25a7077-5fa2-4b4e-b832-c3e0c4d9b323","resolution":{"observed_at":"2026-08-01T03:40:11.755151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.798443Z","title":"Transparent {GPU} sharing in container clouds for deep learning workloads","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.798443Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:e9141df9b389f8191eceede0b11c2d5a81ad7331c279eda84fef263932d20eb8","observation_id":"ea9fd065-ddb7-48c9-a4c8-7b2ef3390bcb","resolution":{"observed_at":"2026-08-01T03:40:11.798443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.872455Z","title":"Yan, and Junchen Jiang","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.872455Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:3a1b7b3046040491193fa5c2aa3d2ee04a759319c205c13e99fe8bcd18c66d6e","observation_id":"e46584d6-1c14-4058-bc99-72391d454c51","resolution":{"observed_at":"2026-08-01T03:40:11.872455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:11.914851Z","title":"Efficient tensor offloading for large deep-learning model training based on compute express link","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:11.914851Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:4f6e905f2e96e5dc92379cd744518350c556322b19fd8428ab01c4b9274e0e7d","observation_id":"04c59993-3ce9-4598-a883-0405c0d8b2a1","resolution":{"observed_at":"2026-08-01T03:40:11.914851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:12.019245Z","title":"Infless: a native serverless system for low-latency, high- throughput inference","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:12.019245Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:2dcc49564ca953718cbe786843488a30ce6fc6dba8749f2a15abe08dd596f63a","observation_id":"f0699efe-20a1-4124-a9e0-7c8f547898d5","resolution":{"observed_at":"2026-08-01T03:40:12.019245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:12.078779Z","title":"Deep compressive offloading: Speeding up neural net- work inference by trading edge computation for network latency","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:12.078779Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:38a551ebf7f74db6197203883c3932bb33c4c0980293bfd25245d2c492f98e1b","observation_id":"e87e1bfe-f4ef-4c12-85e7-b6ea4ff2bef8","resolution":{"observed_at":"2026-08-01T03:40:12.078779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:12.186797Z","title":"Horus: granular in-network task sched- uler for cloud datacenters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:12.186797Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:bfd83a962d78d3f16a9f9552cbc3f7be6ded24f3b408e09aff9bc4b0099a8b52","observation_id":"d9dce3a7-97b3-4d3a-8f78-165427374f2d","resolution":{"observed_at":"2026-08-01T03:40:12.186797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03622","last_updated":"2025-07-08T02:15:07Z","snapshot_observed_at":"2026-07-06T15:39:10.697564Z","submitted_at":"2023-06-06T12:19:05Z","title":"Torpor: GPU-Enabled Serverless Computing for Low-Latency, Resource-Efficient Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03622","snapshot_observed_at":"2026-08-01T03:40:12.308277Z","title":"Faaswap: Slo-aware, gpu-efficient serverless inference via model swapping","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:12.308277Z"},"links":{"cited_paper":"/paper/2306.03622","citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:8ed1d01beae1fbd2b676821bce32d509e64dd1a269da01abc4faf1fdd76ecaef","observation_id":"0525d198-f573-46b9-bfc1-ec895eb25d05","resolution":{"observed_at":"2026-08-01T03:40:12.308277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:12.369125Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:12.369125Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:312a0c798ae755a5982c64176ce06d5c0d004e65e8e4d2a25880dacd6a57dcc5","observation_id":"32543cfe-c61d-4c10-80df-6a54ead58c8c","resolution":{"observed_at":"2026-08-01T03:40:12.369125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:12.439101Z","title":"Expel: Llm agents are ex- periential learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:12.439101Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:55fa877cbb409eacf4127e0cc56c32d41e077e50c6e7f0dbb005f1c8fb66d055","observation_id":"435783a6-c85b-4a06-95aa-502e3d4c7815","resolution":{"observed_at":"2026-08-01T03:40:12.439101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:12.509184Z","title":"Efficient {Direct-Connect} topologies for collective communications","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:12.509184Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:06e7d9a7aba306deefde5ca35c9cc644a3a47e9c64b2f97028ed6d6ec83a4235","observation_id":"9ba649ac-fb75-41ad-98e5-0ec9e7e9ca01","resolution":{"observed_at":"2026-08-01T03:40:12.509184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:12.594996Z","title":"Tally: Non-intrusive performance isolation for concur- rent deep learning workloads","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:12.594996Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:45c0332e1d3f4002bbfaf447cd52fa5eb80e238e96f9656290a13584685f1d32","observation_id":"da20ac6b-e61e-4283-b465-2ecc048e4ac1","resolution":{"observed_at":"2026-08-01T03:40:12.594996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:12.665111Z","title":"Sglang: Efficient execution of structured language model pro- grams.Advances in neural information processing sys- tems, 37:62557–62583, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:12.665111Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:9b10986b10c2c2bffba4db40f8271b19da0dfdbec75fa1e68e9e150c39b7d4a5","observation_id":"49ea237c-f11d-4484-a700-a0a96ebfd31c","resolution":{"observed_at":"2026-08-01T03:40:12.665111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:12.683698Z","title":"Kernelet: High- throughput gpu kernel executions with dynamic slicing and scheduling.IEEE Transactions on Parallel and Distributed Systems, 25(6):1522–1532, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:12.683698Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:7909ec2308d5a1390ebcc0ecdceba4cca3d2ea1b9c0067317f629c07653f6bd4","observation_id":"ab65e9fa-816f-4f3a-afe8-2b559f56f520","resolution":{"observed_at":"2026-08-01T03:40:12.683698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T03:40:12.723229Z","title":"Megascale-infer: Efficient mixture-of-experts model serving with disag- gregated expert parallelism","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-01T03:40:12.723229Z"},"links":{"citing_paper":"/paper/2607.23115"},"observation_digest":"sha256:a1b6444cc61d84b94f43d3d72d8e83d3cf6c9535cb7e4209e0dd2d5449138f6c","observation_id":"dbee7ac1-5724-4102-8cf5-d0e06cce693b","resolution":{"observed_at":"2026-08-01T03:40:12.723229Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.23115","last_updated":"2026-07-25T09:06:47Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-04T06:15:32.336957Z","submitted_at":"2026-07-25T09:06:47Z","title":"Gleam: Adaptive Network-Efficient CUDA API Remoting for Cross-Device GPU Sharing over LANs"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":2,"unresolved":83,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 0 inbound Pith citation observations for arXiv:2607.23115."}