{"as_of":"2026-08-08T21:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4706ba11a079905e4d38b2b49e94c83a39e9751cfbdd8ca55ece91dacfe3628f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":35,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:55:54.042509Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T11:59:50.582581Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":"2401.08671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-07-04T11:59:50.582581Z","title":"Deepspeed-fastgen: High-throughput text generation for llms via MII and deepspeed-inference","venue":null,"work_id":"d970e106-3cea-4d01-88f2-f4ffc759b0da","year":2024},"citing_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"reference_index":279,"source":"pdf_text","source_observed_at":"2026-05-15T02:39:33.007894Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2404.14294"},"observation_digest":"sha256:419eca2543b86ed346a3ca3cde919dee6e0e3e57af5e1b23d5f2f7efdaf4b98c","observation_id":"9ea946e8-56ae-4cfe-9859-67f8ea75d258","resolution":{"observed_at":"2026-05-15T02:39:33.490879Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":"2401.08671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-07-04T11:59:50.582581Z","title":"Deepspeed-fastgen: High-throughput text generation for llms via MII and deepspeed-inference","venue":null,"work_id":"d970e106-3cea-4d01-88f2-f4ffc759b0da","year":2024},"citing_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T07:53:38.715353Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2409.19256"},"observation_digest":"sha256:ad7256b7d7324a52ace2b55f1bd8fb5ad64a666bad8dcd669da7b3566a1f529a","observation_id":"852d3521-7c90-462c-832a-bcc96f884e8b","resolution":{"observed_at":"2026-05-11T07:53:38.983721Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":"2401.08671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-07-04T11:59:50.582581Z","title":"Deepspeed-fastgen: High-throughput text generation for llms via MII and deepspeed-inference","venue":null,"work_id":"d970e106-3cea-4d01-88f2-f4ffc759b0da","year":2024},"citing_paper":{"arxiv_id":"2412.03594","last_updated":"2026-04-22T15:33:51Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-11-29T05:57:37Z","title":"BatchLLM: Optimizing Large Batched LLM Inference with Global Prefix Sharing and Throughput-oriented Token Batching","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T16:57:46.645061Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2412.03594"},"observation_digest":"sha256:43a5f23f6bee3e0c5138ebd6f80d70ebddd56efe053b163bade62510839301a7","observation_id":"a129fb99-037a-4081-a384-96d4579e7a79","resolution":{"observed_at":"2026-05-23T16:58:11.937207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":"2401.08671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-07-04T11:59:50.582581Z","title":"Deepspeed-fastgen: High-throughput text generation for llms via MII and deepspeed-inference","venue":null,"work_id":"d970e106-3cea-4d01-88f2-f4ffc759b0da","year":2024},"citing_paper":{"arxiv_id":"2412.14590","last_updated":"2026-04-22T15:43:48Z","snapshot_observed_at":"2026-08-03T01:50:37.847212Z","submitted_at":"2024-12-19T07:15:15Z","title":"MixLLM: LLM Quantization with Global Mixed-precision between Output-features and Highly-efficient System Design","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-23T06:56:51.829741Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2412.14590"},"observation_digest":"sha256:f88548c96564fcbe2d222fdbccad0a4dbb2e3fcb02e7fb40f28b25798611225e","observation_id":"0c8721d8-0d08-4ff2-ad35-51587c21c02f","resolution":{"observed_at":"2026-05-23T06:57:40.262382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-08-08T17:55:54.042509Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06888","last_updated":"2025-02-09T08:47:06Z","snapshot_observed_at":"2026-08-08T17:48:01.395094Z","submitted_at":"2025-02-09T08:47:06Z","title":"Klotski: Efficient Mixture-of-Expert Inference via Expert-Aware Multi-Batch Pipeline","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T17:55:54.042509Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2502.06888"},"observation_digest":"sha256:3a4da66639ae700236338353c37f22c305333f19b0d5a98e48c0b7ff4ea1078e","observation_id":"cca8c0a0-3680-428a-9ec0-d540affbe1ac","resolution":{"observed_at":"2026-08-08T17:55:54.042509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-08-08T10:10:22.872509Z","title":"Holmes, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08182","last_updated":"2025-02-12T07:42:45Z","snapshot_observed_at":"2026-08-08T14:36:12.899386Z","submitted_at":"2025-02-12T07:42:45Z","title":"Memory Offloading for Large Language Model Inference with Latency SLO Guarantees","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T10:10:22.872509Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2502.08182"},"observation_digest":"sha256:1fae67ba280544561033f8dfb36d96d97305d74a5c088dc71ba588c72b2d2267","observation_id":"6bedb766-c3d8-4009-a6f4-8cabf5d05c7c","resolution":{"observed_at":"2026-08-08T10:10:22.872509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":"2401.08671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-07-04T11:59:50.582581Z","title":"Deepspeed-fastgen: High-throughput text generation for llms via MII and deepspeed-inference","venue":null,"work_id":"d970e106-3cea-4d01-88f2-f4ffc759b0da","year":2024},"citing_paper":{"arxiv_id":"2504.09775","last_updated":"2026-04-20T20:54:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T00:29:49Z","title":"MIST: A Co-Design Framework for Heterogeneous, Multi-Stage LLM Inference","version":6},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T21:16:31.655330Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2504.09775"},"observation_digest":"sha256:68aa346e53cdb612f648ce534bc45bc0a64e5f11d7ec55a6f75ddb5b619c52df","observation_id":"ebbd282c-edd5-43e1-ae96-9cf2bf0587d4","resolution":{"observed_at":"2026-05-22T21:17:08.081299Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":"2401.08671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-07-04T11:59:50.582581Z","title":"Deepspeed-fastgen: High-throughput text generation for llms via MII and deepspeed-inference","venue":null,"work_id":"d970e106-3cea-4d01-88f2-f4ffc759b0da","year":2024},"citing_paper":{"arxiv_id":"2505.09999","last_updated":"2026-05-11T03:41:00Z","snapshot_observed_at":"2026-07-30T05:05:51.180006Z","submitted_at":"2025-05-15T06:24:08Z","title":"ServeGen: Workload Characterization and Generation of Large Language Model Serving in Production","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T15:42:05.266854Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2505.09999"},"observation_digest":"sha256:5168771d94cf96f378560472b1af5f6de0cc7b7d452962085a730686212b637f","observation_id":"b06f25c7-381a-4421-a4e4-1855b33a2e6f","resolution":{"observed_at":"2026-05-22T15:44:58.084998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-08-07T12:50:52.961383Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23520","last_updated":"2025-05-29T14:59:06Z","snapshot_observed_at":"2026-08-07T12:42:08.849043Z","submitted_at":"2025-05-29T14:59:06Z","title":"AnchorAttention: Difference-Aware Sparse Attention with Stripe Granularity","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T12:50:52.961383Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2505.23520"},"observation_digest":"sha256:44a65daa82f6b0a4a81c365a381d8c31309bb763bc514053d346ac17c2240829","observation_id":"313443c8-0e08-4e59-b929-60f45ebddbc7","resolution":{"observed_at":"2026-08-07T12:50:52.961383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-08-07T10:52:48.938385Z","title":"Deepspeed-fastgen: High-throughput text generation for llms via mii and deepspeed-inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04108","last_updated":"2025-06-05T05:39:48Z","snapshot_observed_at":"2026-08-08T01:16:59.339584Z","submitted_at":"2025-06-04T16:01:48Z","title":"Rectified Sparse Attention","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:48.938385Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2506.04108"},"observation_digest":"sha256:b8bdafa6450187f61779b5480531061c2153c719ef283a72dc2e63f3c68d7da7","observation_id":"17c4b2d3-7d80-4f7e-a321-478c29739989","resolution":{"observed_at":"2026-08-07T10:52:48.938385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-08-06T19:19:10.069938Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05940","last_updated":"2025-07-08T12:38:41Z","snapshot_observed_at":"2026-08-07T07:18:06.442355Z","submitted_at":"2025-07-08T12:38:41Z","title":"Chat-Ghosting: A Comparative Study of Methods for Auto-Completion in Dialog Systems","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T19:19:10.069938Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2507.05940"},"observation_digest":"sha256:33b8a319e0d78184809bc4f66c641980dd2545c2594bc874f6cb25fccbcfd255","observation_id":"3f75106c-2cda-4921-a977-c6699722549e","resolution":{"observed_at":"2026-08-06T19:19:10.069938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-08-05T16:21:09.103693Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18736","last_updated":"2025-08-26T07:09:09Z","snapshot_observed_at":"2026-08-05T16:21:06.500734Z","submitted_at":"2025-08-26T07:09:09Z","title":"Rethinking Caching for LLM Serving Systems: Beyond Traditional Heuristics","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T16:21:09.103693Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2508.18736"},"observation_digest":"sha256:5acaac1f8c7dfe7fab8c5743b9525ba8ac4b6294dabe45dca33963edc2eb3fab","observation_id":"f846ec65-36d7-4250-8207-3cbfadd1c795","resolution":{"observed_at":"2026-08-05T16:21:09.103693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-08-05T15:53:29.009532Z","title":"Deepspeed- fastgen: High-throughput text generation for llms via mii and deepspeed- inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19373","last_updated":"2025-08-26T19:07:52Z","snapshot_observed_at":"2026-08-05T15:53:27.523245Z","submitted_at":"2025-08-26T19:07:52Z","title":"HAP: Hybrid Adaptive Parallelism for Efficient Mixture-of-Experts Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:29.009532Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2508.19373"},"observation_digest":"sha256:50bde247e7d272c7f0491eddd02c5d87a087997ba5aa6fb33327d448cd85c2b0","observation_id":"804a2c0c-1dc3-47dc-a9f9-82497e7d3e21","resolution":{"observed_at":"2026-08-05T15:53:29.009532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":"2401.08671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-07-04T11:59:50.582581Z","title":"Deepspeed-fastgen: High-throughput text generation for llms via MII and deepspeed-inference","venue":null,"work_id":"d970e106-3cea-4d01-88f2-f4ffc759b0da","year":2024},"citing_paper":{"arxiv_id":"2512.09472","last_updated":"2026-05-21T07:26:42Z","snapshot_observed_at":"2026-08-01T16:50:48.022324Z","submitted_at":"2025-12-10T09:47:40Z","title":"WarmServe: Enabling One-for-Many GPU Prewarming for Multi-LLM Serving","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T12:22:56.972437Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2512.09472"},"observation_digest":"sha256:2822718348efaf2fedb2348c1519516902f60b0aed7ec92250ec2701e71f4601","observation_id":"c81406e8-a4fc-4464-adde-fb4e1b76914f","resolution":{"observed_at":"2026-05-22T12:24:51.224216Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":"2401.08671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-07-04T11:59:50.582581Z","title":"Deepspeed-fastgen: High-throughput text generation for llms via MII and deepspeed-inference","venue":null,"work_id":"d970e106-3cea-4d01-88f2-f4ffc759b0da","year":2024},"citing_paper":{"arxiv_id":"2603.10726","last_updated":"2026-05-20T10:27:28Z","snapshot_observed_at":"2026-07-06T22:48:39.649787Z","submitted_at":"2026-03-11T12:59:12Z","title":"PrefixWall: Mitigating Prefix Caching Side Channels in Shared LLM Systems","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T12:14:09.509302Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2603.10726"},"observation_digest":"sha256:2d20c63bf09894ca3570cfaa1c41cee36600e4ef09b3f35d312180c67fc50221","observation_id":"268c5e27-d697-4056-a7a9-becc9c17b726","resolution":{"observed_at":"2026-05-21T12:15:06.799217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":"2401.08671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-07-04T11:59:50.582581Z","title":"Deepspeed-fastgen: High-throughput text generation for llms via MII and deepspeed-inference","venue":null,"work_id":"d970e106-3cea-4d01-88f2-f4ffc759b0da","year":2024},"citing_paper":{"arxiv_id":"2603.19199","last_updated":"2026-05-16T06:32:19Z","snapshot_observed_at":"2026-08-02T13:37:33.218495Z","submitted_at":"2026-03-19T17:51:37Z","title":"FASTER: Rethinking Real-Time Flow VLAs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T08:02:13.188363Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2603.19199"},"observation_digest":"sha256:98d34d65ad67b03bed3a9bceec8bc927795d23cb5ca934f1aa1dfb622a6b002a","observation_id":"ffa085a0-9695-41a7-8065-f41d1ffbd4c5","resolution":{"observed_at":"2026-05-15T08:05:15.319681Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":"2401.08671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-07-04T11:59:50.582581Z","title":"Deepspeed-fastgen: High-throughput text generation for llms via MII and deepspeed-inference","venue":null,"work_id":"d970e106-3cea-4d01-88f2-f4ffc759b0da","year":2024},"citing_paper":{"arxiv_id":"2603.19199","last_updated":"2026-05-16T06:32:19Z","snapshot_observed_at":"2026-08-02T13:37:33.218495Z","submitted_at":"2026-03-19T17:51:37Z","title":"FASTER: Rethinking Real-Time Flow VLAs","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T10:48:56.280105Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2603.19199"},"observation_digest":"sha256:458561c200502f0a3b15d4afa3d8f107245868e77212a86f23866e5cabc38be9","observation_id":"aaf05164-07a0-4f3b-a171-ee9197516154","resolution":{"observed_at":"2026-05-21T10:50:01.062812Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":"2401.08671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-07-04T11:59:50.582581Z","title":"Deepspeed-fastgen: High-throughput text generation for llms via MII and deepspeed-inference","venue":null,"work_id":"d970e106-3cea-4d01-88f2-f4ffc759b0da","year":2024},"citing_paper":{"arxiv_id":"2603.27960","last_updated":"2026-04-11T06:07:02Z","snapshot_observed_at":"2026-07-06T22:51:00.579062Z","submitted_at":"2026-03-30T02:23:37Z","title":"Towards Efficient Large Vision-Language Models: A Comprehensive Survey on Inference Strategies","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-14T21:40:55.343169Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2603.27960"},"observation_digest":"sha256:8ffddb22524f7a6ad669af40edddba4db1b1e44440bd9d70aebb44fc57f33f50","observation_id":"9c00d7a0-282f-44cf-acd1-f1192872aa99","resolution":{"observed_at":"2026-05-14T21:43:00.670264Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":"2401.08671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-07-04T11:59:50.582581Z","title":"Deepspeed-fastgen: High-throughput text generation for llms via MII and deepspeed-inference","venue":null,"work_id":"d970e106-3cea-4d01-88f2-f4ffc759b0da","year":2024},"citing_paper":{"arxiv_id":"2604.09611","last_updated":"2026-03-12T10:10:37Z","snapshot_observed_at":"2026-08-06T15:21:40.163401Z","submitted_at":"2026-03-12T10:10:37Z","title":"Characterizing Performance-Energy Trade-offs of Large Language Models in Multi-Request Workflows","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T12:28:38.809950Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2604.09611"},"observation_digest":"sha256:f1d989343956bd92005876d09f8c0e597546303d9901eacfab2ded7cf298899d","observation_id":"876815a3-5aa7-486c-8378-6ce3c7e3a195","resolution":{"observed_at":"2026-05-15T12:30:00.274373Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":"2401.08671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-07-04T11:59:50.582581Z","title":"Deepspeed-fastgen: High-throughput text generation for llms via MII and deepspeed-inference","venue":null,"work_id":"d970e106-3cea-4d01-88f2-f4ffc759b0da","year":2024},"citing_paper":{"arxiv_id":"2604.15186","last_updated":"2026-04-16T16:15:29Z","snapshot_observed_at":"2026-07-06T23:02:49.302337Z","submitted_at":"2026-04-16T16:15:29Z","title":"Scepsy: Serving Agentic Workflows Using Aggregate LLM Pipelines","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T09:52:40.057014Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2604.15186"},"observation_digest":"sha256:2f9ca1574aaa46b15bc5b4c43ccc44be237b6aa3a1cc86def1ef6b82a8e1c011","observation_id":"d57681e3-f3fb-42fc-8982-ad26d7846e04","resolution":{"observed_at":"2026-05-10T09:59:03.464710Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":"2401.08671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-07-04T11:59:50.582581Z","title":"Deepspeed-fastgen: High-throughput text generation for llms via MII and deepspeed-inference","venue":null,"work_id":"d970e106-3cea-4d01-88f2-f4ffc759b0da","year":2024},"citing_paper":{"arxiv_id":"2604.22906","last_updated":"2026-04-24T16:56:53Z","snapshot_observed_at":"2026-08-07T20:25:38.013655Z","submitted_at":"2026-04-24T16:56:53Z","title":"Network Edge Inference for Large Language Models: Principles, Techniques, and Opportunities","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-08T09:45:57.201837Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2604.22906"},"observation_digest":"sha256:2778e424a20cda23be72a9626b17bb5a3d4683e454793effcfd92e8bd5228700","observation_id":"61b831f4-fcd0-47ff-adc3-18b849d53a70","resolution":{"observed_at":"2026-05-11T20:16:10.210742Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":"2401.08671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-07-04T11:59:50.582581Z","title":"Deepspeed-fastgen: High-throughput text generation for llms via MII and deepspeed-inference","venue":null,"work_id":"d970e106-3cea-4d01-88f2-f4ffc759b0da","year":2024},"citing_paper":{"arxiv_id":"2604.26963","last_updated":"2026-04-14T05:15:28Z","snapshot_observed_at":"2026-08-01T00:07:50.693557Z","submitted_at":"2026-04-14T05:15:28Z","title":"MARS: Efficient, Adaptive Co-Scheduling for Heterogeneous Agentic Systems","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T14:30:56.899306Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2604.26963"},"observation_digest":"sha256:0acb65fb3dec40fa7a2f8a7b5e167764a094ad834e9993bc2689f2ce694f01c1","observation_id":"c0ab0b09-ffc3-4798-9256-856c3064c131","resolution":{"observed_at":"2026-05-10T14:35:35.686543Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":"2401.08671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-07-04T11:59:50.582581Z","title":"Deepspeed-fastgen: High-throughput text generation for llms via MII and deepspeed-inference","venue":null,"work_id":"d970e106-3cea-4d01-88f2-f4ffc759b0da","year":2024},"citing_paper":{"arxiv_id":"2605.06206","last_updated":"2026-05-07T13:12:41Z","snapshot_observed_at":"2026-08-02T22:44:55.983169Z","submitted_at":"2026-05-07T13:12:41Z","title":"Federation of Experts: Communication Efficient Distributed Inference for Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T13:40:50.411198Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2605.06206"},"observation_digest":"sha256:a73d760cf836891df7cc46298db0b0a03a8360edb4f162a6e643c9b167e56ac6","observation_id":"bdb1d749-6c65-4651-bbda-4dec91c8d58d","resolution":{"observed_at":"2026-05-11T18:51:07.551006Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":"2401.08671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-07-04T11:59:50.582581Z","title":"Deepspeed-fastgen: High-throughput text generation for llms via MII and deepspeed-inference","venue":null,"work_id":"d970e106-3cea-4d01-88f2-f4ffc759b0da","year":2024},"citing_paper":{"arxiv_id":"2605.18346","last_updated":"2026-05-18T12:58:13Z","snapshot_observed_at":"2026-07-06T23:29:14.916114Z","submitted_at":"2026-05-18T12:58:13Z","title":"Focused Forcing: Content-Aware Per-Frame KV Selection for Efficient Autoregressive Video Diffusion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T11:19:21.721494Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2605.18346"},"observation_digest":"sha256:ce61f0f136bcbcbf069d127c931e767cbf62aa7da29403476cc787c443da76d5","observation_id":"4baef794-3b5c-4841-b783-3006804077fb","resolution":{"observed_at":"2026-05-20T11:23:14.150643Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":"2401.08671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-07-04T11:59:50.582581Z","title":"Deepspeed-fastgen: High-throughput text generation for llms via MII and deepspeed-inference","venue":null,"work_id":"d970e106-3cea-4d01-88f2-f4ffc759b0da","year":2024},"citing_paper":{"arxiv_id":"2605.23389","last_updated":"2026-05-22T09:00:45Z","snapshot_observed_at":"2026-08-01T23:40:06.222566Z","submitted_at":"2026-05-22T09:00:45Z","title":"AlignedServe: Orchestrating Prefix-aware Batching to Build a High-throughput and Computing-efficient LLM Serving System","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-25T03:12:49.028342Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2605.23389"},"observation_digest":"sha256:b388e4b985930194457365cb5f70f991bb9db7a91da22d2bd086cb596bc3ab12","observation_id":"13fd3d8f-a36d-4899-832c-359a99beb400","resolution":{"observed_at":"2026-05-25T03:15:17.294037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":"2401.08671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-07-04T11:59:50.582581Z","title":"Deepspeed-fastgen: High-throughput text generation for llms via MII and deepspeed-inference","venue":null,"work_id":"d970e106-3cea-4d01-88f2-f4ffc759b0da","year":2024},"citing_paper":{"arxiv_id":"2606.01839","last_updated":"2026-06-01T07:51:09Z","snapshot_observed_at":"2026-07-06T23:42:21.252086Z","submitted_at":"2026-06-01T07:51:09Z","title":"Observation, Not Prediction: Conversation-Level Disaggregated Scheduling for Agentic Serving","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-28T12:56:16.768455Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2606.01839"},"observation_digest":"sha256:5d4fdb68b046be73f325246529a97e50ee4b51f99f7d30bcc7a0177277aa6c29","observation_id":"83d9298f-7b54-40a6-9b32-f483749567fe","resolution":{"observed_at":"2026-07-02T00:56:25.651067Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":"2401.08671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-07-04T11:59:50.582581Z","title":"Deepspeed-fastgen: High-throughput text generation for llms via MII and deepspeed-inference","venue":null,"work_id":"d970e106-3cea-4d01-88f2-f4ffc759b0da","year":2024},"citing_paper":{"arxiv_id":"2606.02964","last_updated":"2026-06-01T23:51:37Z","snapshot_observed_at":"2026-08-02T06:03:10.694543Z","submitted_at":"2026-06-01T23:51:37Z","title":"Multi-Segment Attention: Enabling Efficient KV-Cache Management for Faster Large Language Model Serving","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T11:38:05.435505Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2606.02964"},"observation_digest":"sha256:c5518a93d90175c8cd90b9e754137a5ae59eb0bfb0dd54fca89f0478aa7c89ff","observation_id":"6e215635-2261-408f-9102-c420675d9305","resolution":{"observed_at":"2026-07-02T01:36:26.302619Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":"2401.08671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-07-04T11:59:50.582581Z","title":"Deepspeed-fastgen: High-throughput text generation for llms via MII and deepspeed-inference","venue":null,"work_id":"d970e106-3cea-4d01-88f2-f4ffc759b0da","year":2024},"citing_paper":{"arxiv_id":"2606.05933","last_updated":"2026-06-04T09:36:40Z","snapshot_observed_at":"2026-08-07T11:42:57.077443Z","submitted_at":"2026-06-04T09:36:40Z","title":"Beyond Greedy Chunking: SLO-Aware Sliding-Window Scheduling for LLM Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T23:49:28.318260Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2606.05933"},"observation_digest":"sha256:b4a4950355248c27ac58963d5844063451e789a6c83e83fcbf8b35b3224dd84a","observation_id":"f690c26d-f209-43f4-b662-660346d06641","resolution":{"observed_at":"2026-07-02T15:27:06.039657Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":"2401.08671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-07-04T11:59:50.582581Z","title":"Deepspeed-fastgen: High-throughput text generation for llms via MII and deepspeed-inference","venue":null,"work_id":"d970e106-3cea-4d01-88f2-f4ffc759b0da","year":2024},"citing_paper":{"arxiv_id":"2606.06453","last_updated":"2026-06-04T17:48:17Z","snapshot_observed_at":"2026-08-08T14:28:58.546665Z","submitted_at":"2026-06-04T17:48:17Z","title":"Vortex: Efficient and Programmable Sparse Attention Serving for AI Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T01:07:14.691347Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2606.06453"},"observation_digest":"sha256:3383998c25d186088c904d15402f8ce6b418394314cff686bb1de9c0c82e5231","observation_id":"e407d765-5959-43a4-b272-097e3e6cc9fa","resolution":{"observed_at":"2026-07-02T13:36:59.463922Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":"2401.08671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-07-04T11:59:50.582581Z","title":"Deepspeed-fastgen: High-throughput text generation for llms via MII and deepspeed-inference","venue":null,"work_id":"d970e106-3cea-4d01-88f2-f4ffc759b0da","year":2024},"citing_paper":{"arxiv_id":"2606.18741","last_updated":"2026-06-17T06:36:40Z","snapshot_observed_at":"2026-08-07T05:56:30.051423Z","submitted_at":"2026-06-17T06:36:40Z","title":"ReMP: Low-Downtime Runtime Model-Parallelism Reconfiguration for LLM Serving","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T19:32:31.882977Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2606.18741"},"observation_digest":"sha256:731d8a712de475ba6e3eb06d3a8517d583c5698a984aa559b751bc1d2a54daaa","observation_id":"338310bb-7333-4cb7-9032-c6507b74679f","resolution":{"observed_at":"2026-07-04T02:39:24.932913Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":"2401.08671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-07-04T11:59:50.582581Z","title":"Deepspeed-fastgen: High-throughput text generation for llms via MII and deepspeed-inference","venue":null,"work_id":"d970e106-3cea-4d01-88f2-f4ffc759b0da","year":2024},"citing_paper":{"arxiv_id":"2606.22983","last_updated":"2026-06-22T08:04:12Z","snapshot_observed_at":"2026-08-08T01:27:37.891401Z","submitted_at":"2026-06-22T08:04:12Z","title":"LiveServe: Interaction-Aware Serving for Real-Time Omni-Modal LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T07:26:07.356352Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2606.22983"},"observation_digest":"sha256:fb63a8eccb4ef4a9f2e9f0ff0279d7e8b259e2ff7e3307c32efb4e13d8362b3b","observation_id":"a6e62147-93fa-408e-88c6-1da34df551c8","resolution":{"observed_at":"2026-07-04T11:59:50.585382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":"2401.08671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-07-04T11:59:50.582581Z","title":"Deepspeed-fastgen: High-throughput text generation for llms via MII and deepspeed-inference","venue":null,"work_id":"d970e106-3cea-4d01-88f2-f4ffc759b0da","year":2024},"citing_paper":{"arxiv_id":"2607.00151","last_updated":"2026-06-30T20:27:49Z","snapshot_observed_at":"2026-08-03T01:59:44.957724Z","submitted_at":"2026-06-30T20:27:49Z","title":"SmoothAgent: Efficient Long-Horizon LLM-Based Agent Serving with Lookahead Context Engineering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-02T17:19:53.560039Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2607.00151"},"observation_digest":"sha256:6e558a5d7ad534a1dcdf98e279f5eaae5d3ff0c06f1fadb1e17562572ca83100","observation_id":"286d72a8-abb5-474e-8411-d1aa48d0e656","resolution":{"observed_at":"2026-07-02T17:27:14.671196Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-07-12T09:50:23.266920Z","title":"B., Awan, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02574","last_updated":"2026-06-30T16:12:40Z","snapshot_observed_at":"2026-07-12T09:50:22.497230Z","submitted_at":"2026-06-30T16:12:40Z","title":"From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-12T09:50:23.266920Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2607.02574"},"observation_digest":"sha256:ec65faa90827c3383285e0f0b22120d8e66869f9ee3810fac6abc8e01d169649","observation_id":"208c00e4-9b51-4ca6-a064-f638bf559b5f","resolution":{"observed_at":"2026-07-12T09:50:23.266920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-07-13T05:43:12.690359Z","title":"Deepspeed- fastgen: High-throughput text generation for llms via mii and deepspeed- inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08930","last_updated":"2026-07-09T20:48:08Z","snapshot_observed_at":"2026-08-07T23:53:55.043533Z","submitted_at":"2026-07-09T20:48:08Z","title":"BlockServe: Block-Grained Continuous Batching for High-Throughput Diffusion LLM Serving","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T05:43:12.690359Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2607.08930"},"observation_digest":"sha256:3f70f97c940b064df5972085192ba98c98d92671c225ae0377d9e9fb82fe6446","observation_id":"b03ec011-2f9d-4d74-9362-1893d5dec339","resolution":{"observed_at":"2026-07-13T05:43:12.690359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08671","snapshot_observed_at":"2026-08-01T19:51:06.098713Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16836","last_updated":"2026-07-27T11:12:03Z","snapshot_observed_at":"2026-08-07T14:34:28.665365Z","submitted_at":"2026-07-18T14:21:39Z","title":"Beyond Storage: State as a Runtime Control Problem in Parallel and Distributed Systems","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-01T19:51:06.098713Z"},"links":{"cited_paper":"/paper/2401.08671","citing_paper":"/paper/2607.16836"},"observation_digest":"sha256:51635824076990bd6ff476a0d6728b104d8d4e7acba71df6a873ddf480f174f1","observation_id":"a0422bac-16ce-46b9-823a-0e3a1899cb82","resolution":{"observed_at":"2026-08-01T19:51:06.098713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2401.08671/citation-record","integrity":"/paper/2401.08671/integrity","json":"/paper/2401.08671/citation-record.json","paper":"/paper/2401.08671"},"outbound":[],"paper":{"arxiv_id":"2401.08671","last_updated":"2024-01-09T06:49:40Z","latest_version":1,"primary_category":"cs.PF","snapshot_observed_at":"2026-07-06T17:16:25.682072Z","submitted_at":"2024-01-09T06:49:40Z","title":"DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 35 inbound Pith citation observations for arXiv:2401.08671."}