Pith. sign in

Paper Citation Record · LEDGER

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving

As of 17 August 2026, this Paper Citation Record lists 100 of 139 outbound references and 0 inbound Pith citation observations for arXiv:2607.02574.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.02574 v1

Coverage vector

measured 100 of 139 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-07-12T09:50:23.266920Z

measured 100 of 100 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

100 of 139 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved100
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation cad7c44f-6a41-4c69-aaa3-a1985649e192 · outbound

This paper cites J., Soloveychik, I., and Kamath, P.Keyformer: Kv cache reduction through key tokens selection for efficient generative inference.Proceedings of Machine Learning and Systems(2024).

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving J., Soloveychik, I., and Kamath, P.Keyformer: Kv cache reduction through key tokens selection for efficient generative inference.Proceedings of Machine Learning and Systems(2024)

Reference 1

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:e65eb7e7fd5698bfe2d3113b80998cb55bebb7e325ce716308c8a9eede23107b

Observation 2c656e6b-f60e-46e1-bd76-1f0a4060e388 · outbound

This paper cites S., Tumanov, A., and Ramjee, R.Taming throughput-latency tradeoff in llm inference with sarathi-serve.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving S., Tumanov, A., and Ramjee, R.Taming throughput-latency tradeoff in llm inference with sarathi-serve

Reference 2

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:2fa6e543265b2f34aa6ed427c4be6398ce55b5476227792ce8c26c96a39eda12

Observation 4c91eeed-246f-4938-89dd-1552cefc34ba · outbound

This paper cites SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills

Reference 3

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:0db8429d6e524dd3682fd1322bf170e0da572b8401920a7e9d45d147f3bc2a80

Observation 7f955fdc-3b0d-41d4-af45-40dc0961e38c · outbound

This paper cites an unresolved cited work.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Unresolved cited work

Reference 4

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:aba477ac7cfdfb7f0548f6b3a3e5bd6ca821aa0b82e33bc28358664667a13dfd

Observation 8722d4cb-ccf0-4bce-a07b-6d2e7df9d5a6 · outbound

This paper cites Y., Rajbhandari, S., Awan, A.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Y., Rajbhandari, S., Awan, A

Reference 5

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:f54f8681253d3fd58607e13a93729de10b1a1d9e72d76a2d7e15b0895c2eea6a

Observation 3ef42ae8-4920-4492-96e8-bebf2ea5d6be · outbound

This paper cites an unresolved cited work.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Unresolved cited work

Reference 6

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:fb2345e4d35dc5f4a236024b8f63aba37dd3edc14a702b712ff68a0f66562480

Observation 7089685c-341b-4297-b2cd-241b3c7b0ec3 · outbound

This paper cites Longformer: The Long-Document Transformer.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Longformer: The Long-Document Transformer

Reference 7

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:a5a1cfa7ceb189468312bd9a022beacd3d0bbfef2faf8dbc78f7f3b608693cd4

Observation 1e3b4bab-c379-4bc9-98ad-e1d195f3e73d · outbound

This paper cites Striped Attention: Faster Ring Attention for Causal Transformers.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Striped Attention: Faster Ring Attention for Causal Transformers

Reference 8

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:0117378d809cb35f5984760df8cbd8cfb98a28d9b4d42834f908560189052bcb

Observation 2d902cb1-6e55-4643-9e49-9c2ac65fad06 · outbound

This paper cites an unresolved cited work.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Unresolved cited work

Reference 9

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:a6540f3fefc3c49029a899a2e6bfae73cbf796d67b1b68054ca21f3b25a65059

Observation 28d5b39d-f231-402e-9f12-58b019176a50 · outbound

This paper cites an unresolved cited work.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Unresolved cited work

Reference 10

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:d274c3686ac418d880a43cb01e2e3697f8e754c29235e1afce8321c582184892

Observation 6d75ca09-a319-4dc8-ab7c-907e9d4fa4a4 · outbound

This paper cites Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads

Reference 11

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:919f510ef6a9f3433a40ac7f3a4c446e91bb6f116fd0cbaa1121afd9cd7daa0c

Observation 7d09a5b7-3b94-4935-b244-bd4cddaa50f9 · outbound

This paper cites PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling

Reference 12

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:426f9aa425777ef8eb821aa9b954566242afbb435ad0d058ce014c5a48cd67e5

Observation 27c242c8-f385-4c08-b22e-1c3b79b89894 · outbound

This paper cites Next-Gen Computing Systems with Compute Express Link: a Comprehensive Survey.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Next-Gen Computing Systems with Compute Express Link: a Comprehensive Survey

Reference 13

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:58fd6e6fe4cc0647e81c587c64dd7b9b0c53c160063bde377050f0bf0615a46f

Observation 4a05479f-0a7f-434c-8ee2-b39f8233ba8e · outbound

This paper cites KVDirect: Distributed Disaggregated LLM Inference.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving KVDirect: Distributed Disaggregated LLM Inference

Reference 14

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:83a5ea3b378454f2fc868d42218de482842c36f8417db23f41b80ed44c5d301e

Observation e97c3075-4db8-4c09-88ee-fae871c3836a · outbound

This paper cites Extending Context Window of Large Language Models via Positional Interpolation.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Extending Context Window of Large Language Models via Positional Interpolation

Reference 15

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:b4b528dbe50d8e4152cbf65d4aca6fbaa9c47348b657e9963e7b4d0498601a02

Observation d42ea428-ea7c-497a-ad3c-3f35b4acc210 · outbound

This paper cites InInternational Conference on Learning Representations(2024), vol.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving InInternational Conference on Learning Representations(2024), vol

Reference 16

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:6d9f43f3e69230df271c113d9b71d333bd2d607ec46b0a5c98dc9e2071a78517

Observation 0b2cc121-2ccd-4ac6-8b7d-45e21e2fef8e · outbound

This paper cites Generating Long Sequences with Sparse Transformers.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Generating Long Sequences with Sparse Transformers

Reference 17

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:f72082174edbca2e3c379f3ead9c3139fcdad2e082ee3fea3de763c7cc8ad34b

Observation 0e4f6985-b4d9-47d7-82f9-cc1ccfff3fb4 · outbound

This paper cites [19]Corporation, A.Amd instinct mi300 series architecture.Technical whitepaper(2023).

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving [19]Corporation, A.Amd instinct mi300 series architecture.Technical whitepaper(2023)

Reference 18

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:31377a0d10e0b47a9ecc60cda92b9ad269e70819729d9f046cc4665021cfc606

Observation 7f3fa9ec-a9bd-4ee9-af45-e50297ab9e55 · outbound

This paper cites InInternational Conference on Learning Representations(2024), vol.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving InInternational Conference on Learning Representations(2024), vol

Reference 19

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:3903138c711d04a5b699b66a26210aab79e3c5d87ee805181b6a28440e7d8d9e

Observation 85546b09-60a4-4c9e-800d-abe3fc17289d · outbound

This paper cites an unresolved cited work.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Unresolved cited work

Reference 20

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:77a7c2f1108aabc0de8cc9904cb20651c41904e39e8d6fa6c8e264d356820683

Observation 963a5b70-d258-4286-a67c-65e2761f1c9c · outbound

This paper cites an unresolved cited work.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Unresolved cited work

Reference 21

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:d13811d701a042a5988223563349fb4854c84a9a727daf389bc5fadf2bcb729a

Observation 1608e6ca-b4d6-4e66-970f-76d12497b53a · outbound

This paper cites SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression

Reference 22

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:ac55f91d431803ae99056012e984f5fcf430dc78191a6790ad9064c2c369ccd0

Observation 573f8ee7-c0a4-4b9b-97df-9027a41a8792 · outbound

This paper cites LongNet: Scaling Transformers to 1,000,000,000 Tokens.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving LongNet: Scaling Transformers to 1,000,000,000 Tokens

Reference 23

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:ac7fb8192096d557006ab2e6c65696d539c076f76cd5b90421eedbafcf631c01

Observation 9dbe4e20-5419-482e-b6d4-3fe02b480b56 · outbound

This paper cites LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens

Reference 24

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:5793883b281f645857f8ee1538b479a0178fa60ee6b46eee750b190c7fc2cde7

Observation b59e9c71-c4f4-41f5-a174-fe493555aa17 · outbound

This paper cites Get More with LESS: Synthesizing Recurrence with KV Cache Compression for Efficient LLM Inference.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Get More with LESS: Synthesizing Recurrence with KV Cache Compression for Efficient LLM Inference

Reference 25

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:6f7c4a59c8d4a680b054a5b4aedb06e496e094c96ed7eb5db5a441cc0c58a2b4

Observation 8b603132-cb31-4a85-b3d4-a402822a5efd · outbound

This paper cites an unresolved cited work.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Unresolved cited work

Reference 26

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:0cfa6935b2e705a505ea02d98f03803b0d9709057b4aa0df98021b10bc955036

Observation 82e1b391-4fc2-4df7-9ec7-8042f205e8fb · outbound

This paper cites M., Tong, S., Lepikhin, D., Xu, Y., Krikun, M., Zhou, Y., Yu, A.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving M., Tong, S., Lepikhin, D., Xu, Y., Krikun, M., Zhou, Y., Yu, A

Reference 27

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:a259cae8860355c4be7b6b2af65e79e1b464fde7e4d3180d98d04a584af13ac1

Observation 228d47dd-d854-4a54-bd31-57e2e0538e73 · outbound

This paper cites MuxServe: Flexible Spatial-Temporal Multiplexing for Multiple LLM Serving.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving MuxServe: Flexible Spatial-Temporal Multiplexing for Multiple LLM Serving

Reference 28

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:c97294fdcac3b4b28d33fd59fca582dcdcf9124d72887c08b5092b182c85485d

Observation 312742af-27cc-42f4-9eea-172d1f55affc · outbound

This paper cites an unresolved cited work.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Unresolved cited work

Reference 29

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:6d67dd76cfc3ce1cc1e628dfa8de28fd22ad3ff3805e4c66835fd7a8472d606a

Observation 59e50066-2dd8-45fa-a04e-412ce0b1869e · outbound

This paper cites K.Ada-kv: Optimizing kv cache eviction by adaptive budget allocation for efficient llm inference.Advances in Neural Information Processing Systems(2024).

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving K.Ada-kv: Optimizing kv cache eviction by adaptive budget allocation for efficient llm inference.Advances in Neural Information Processing Systems(2024)

Reference 30

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:07c0571265f8b59fd497748f653e206307c8baaf463d86a98fed3b23459bc0fe

Observation 43313fea-998d-4060-a4db-7e208c3744ab · outbound

This paper cites GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers

Reference 31

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:04f7620d526a96f7d4e1186eb09238a03971f9e496e77bd2c5818bda76ab9294

Observation 4cf437ec-0509-4136-888f-fc33deed1096 · outbound

This paper cites Hungry Hungry Hippos: Towards Language Modeling with State Space Models.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Hungry Hungry Hippos: Towards Language Modeling with State Space Models

Reference 32

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:8af427798df9d827235575ca79f981a94dfd6d0de8bd03c085809a8919c58416

Observation 9fd9a7c0-1059-4670-95b1-72526efb4668 · outbound

This paper cites Break the Sequential Dependency of LLM Inference Using Lookahead Decoding.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Break the Sequential Dependency of LLM Inference Using Lookahead Decoding

Reference 33

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:4d608642bcb52ae508f1fc0d97c31543a2f78a4eacecac27c4f4e430330c3a6b

Observation add754b7-c5b3-4ed8-ac62-14ab4bda340c · outbound

This paper cites Proceedings of Machine Learning and Systems(2022).

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Proceedings of Machine Learning and Systems(2022)

Reference 34

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:26dd28b9a9ff8780b056604246b9135c073be9e4d0c1f4e658eb06c04140080e

Observation a0ddacec-4761-4d33-ac38-863d092ac612 · outbound

This paper cites L., Khandelwal, A., and Zhong, L.Prompt cache: Modular attention reuse for low-latency inference.Proceedings of Machine Learning and Systems 6(2024), 325–338.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving L., Khandelwal, A., and Zhong, L.Prompt cache: Modular attention reuse for low-latency inference.Proceedings of Machine Learning and Systems 6(2024), 325–338

Reference 35

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:3c4877b332c67a569cdbc4e1bbbd897fe3ae0fea9e674aca3adaaae3d56e676e

Observation b1142562-be7c-464e-927f-a92fbe08476d · outbound

This paper cites The Llama 3 Herd of Models.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving The Llama 3 Herd of Models

Reference 36

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:e824d4ea374ecb4cfdb2e9ec353775cc9cdb0cca651838de22a75cefe8700c11

Observation 7698e042-ac99-4a38-93f8-a4fe2d6fe5ad · outbound

This paper cites Mamba: Linear-Time Sequence Modeling with Selective State Spaces.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Mamba: Linear-Time Sequence Modeling with Selective State Spaces

Reference 37

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:02ca6cce3e80cabb2dd12283666760c6e813529b17688264f56aa22e60d1136c

Observation 29c4e1f3-26aa-43aa-9720-461b72286256 · outbound

This paper cites Efficiently Modeling Long Sequences with Structured State Spaces.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Efficiently Modeling Long Sequences with Structured State Spaces

Reference 38

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:e3838272d5fc9ac468da9bbf178fc1e54a449c66b6929a7f6c3b189bb7b7444d

Observation c6a4679e-1502-4402-a93e-8dbe20ee766e · outbound

This paper cites G.Efficient memory disaggregation with infiniswap.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving G.Efficient memory disaggregation with infiniswap

Reference 39

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:9bb023a99996d8e0b37f0109aee26f1ae7bb7da14fa525a687f5e811e3afae37

Observation 2f05965a-be86-4cfe-8d50-ed665afaa379 · outbound

This paper cites In International conference on machine learning(2020), PMLR, pp.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving In International conference on machine learning(2020), PMLR, pp

Reference 40

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:0f12e6a85c96aa5239b29f4de463a71d163fd3d4b3b44da259fe1f0b83b37f52

Observation f51a0686-9c62-4327-92f9-b133c37e797f · outbound

This paper cites LM-Infinite: Zero-Shot Extreme Length Generalization for Large Language Models.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving LM-Infinite: Zero-Shot Extreme Length Generalization for Large Language Models

Reference 41

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:3d5d88240c7c110c60b6b51b5ee5d63325b316bdcf1d0a1d36c45bea92a77132

Observation 6152210c-84fd-4605-a866-bb8536a07119 · outbound

This paper cites FastMoE: A Fast Mixture-of-Expert Training System.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving FastMoE: A Fast Mixture-of-Expert Training System

Reference 42

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:7b827d5771f0d43cda72c50478b7c5d0d458920df1ad913094862290f31dbfc3

Observation e581dcb3-0272-4c4b-90fc-a1a5b587d221 · outbound

This paper cites an unresolved cited work.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Unresolved cited work

Reference 43

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:7c84ead7c1a947de38f2b950adb1c8283e3dbe878046e3bd472fad22c42878a5

Observation 531fff35-3744-4b4a-8c2a-31e98b63c230 · outbound

This paper cites Training Compute-Optimal Large Language Models.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Training Compute-Optimal Large Language Models

Reference 44

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:e9972fa5401f9835f7fffd6a2822beb2f3b43a549a763a21fdf753f1d12db8d0

Observation 208c00e4-9b51-4ca6-a064-f638bf559b5f · outbound

This paper cites DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving DeepSpeed-FastGen: High-throughput Text Generation for LLMs via MII and DeepSpeed-Inference

Reference 45

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:03be1e6abbb029274b7c439f8394afea801c93d21449e774c2ca59a073ed33fc

Observation 5843d529-260d-4b0d-9340-d3176d5aa4bf · outbound

This paper cites W., Shao, Y.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving W., Shao, Y

Reference 46

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:add22db4b049bdc2cb3927ff5745e471b7f0bb5b3fe6b264f08f809fe83be13c

Observation fd7edb7a-853e-4df5-93bf-7fe941c9f6ca · outbound

This paper cites MemServe: Context Caching for Disaggregated LLM Serving with Elastic Memory Pool.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving MemServe: Context Caching for Disaggregated LLM Serving with Elastic Memory Pool

Reference 47

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:0ad8062fa160e7f0dffbc42d580db8b2c6eaa88ab593a34fd9b448a5e48ce65d

Observation a8ce9caf-d125-4573-859e-4df4ba102f0a · outbound

This paper cites an unresolved cited work.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Unresolved cited work

Reference 48

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:4b1f0f3b07a5571248c532133541d1eb7cd9d71c8509cb4d3e12373486415292

Observation 357e8dc0-9690-4498-a1b2-ad0498d78dff · outbound

This paper cites an unresolved cited work.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Unresolved cited work

Reference 49

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:4fc1b6150553cdafed1f17e4c67eefcd62652f577e880e6b2eb1fe5fe4fe4cda

Observation 087530ff-cec7-4866-8104-0a7a488b5d9e · outbound

This paper cites DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models

Reference 50

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:2d791c67bf6c99225942de506da40d5464609a5678572ccc78345037d2855926

Observation fdcda397-0e71-4801-bc54-f44097a94024 · outbound

This paper cites Mixtral of Experts.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Mixtral of Experts

Reference 51

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:73359850d5e452f30b6645fea3f92e90839b0fd871c7794137d5b65cc210db8c

Observation e4aa7403-4525-49aa-8078-8c3835e9f9ee · outbound

This paper cites an unresolved cited work.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Unresolved cited work

Reference 52

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:11de6d73d2005acdd31fab6950b920dd8f0a7fcbcdd034130154e019e9b45db7

Observation 08698169-f112-45b2-a260-1d555cd15ccd · outbound

This paper cites P/D-Serve: Serving Disaggregated Large Language Model at Scale.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving P/D-Serve: Serving Disaggregated Large Language Model at Scale

Reference 53

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:464ca6bf515685b4cb593dc13f2ed33a163296bc056a5578162763f8702bfd99

Observation dd44819b-a4ab-40e8-b6d8-e641d436a082 · outbound

This paper cites an unresolved cited work.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Unresolved cited work

Reference 54

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:1232a6da33362e1e5e7b379de5a0b7d4e0e1b9184605d6f25c1b7e5bec3e2435

Observation ec8e962e-f30c-442b-9bf0-228e2aebb6a8 · outbound

This paper cites Hydragen: High-Throughput LLM Inference with Shared Prefixes.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Hydragen: High-Throughput LLM Inference with Shared Prefixes

Reference 55

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:0548796e07ae7d5f40c7e29f96e595263491c9f77d6d1d48d2e1ab8e93a0c136

Observation 7cdd29e4-e91d-495a-807c-9983e269bd1a · outbound

This paper cites GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM

Reference 56

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:a791e8bf4c9bbc2fdd3394389f29b8c5a1d7a765afaf1d0beb87785cd6c49891

Observation 4dee23f8-e923-4207-aa37-1c33a573b168 · outbound

This paper cites InProceedings of the 2020 conference on empirical methods in natural language processing (EMNLP)(2020), pp.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving InProceedings of the 2020 conference on empirical methods in natural language processing (EMNLP)(2020), pp

Reference 57

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:ea7618fab657c2c24780afa88802a3deabd4a18d0443c3359755a4b2e62df61a

Observation ea433842-8f30-462a-9a04-71edc885daf3 · outbound

This paper cites InProceedings of the 43rd International ACM SIGIR conference on research and development in Information Retrieval(2020), pp.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving InProceedings of the 43rd International ACM SIGIR conference on research and development in Information Retrieval(2020), pp

Reference 58

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:1f1aee1a4b8a81fb839a926e2294ebae0b83bc7ce97e2ed294ffe643610e4016

Observation 6cf85f5b-64cf-48d2-9976-b7fd0cb2b1a5 · outbound

This paper cites Reformer: The Efficient Transformer.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Reformer: The Efficient Transformer

Reference 59

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:b90a621d8186c1581ba0b334696c3c33b14de63fea44bc0a218afdb235c8c234

Observation 7d31af90-403a-4dd2-bada-ee8f025bb7b0 · outbound

This paper cites H., Gonzalez, J., Zhang, H., and Stoica, I.Efficient memory management for large language model serving with pagedattention.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving H., Gonzalez, J., Zhang, H., and Stoica, I.Efficient memory management for large language model serving with pagedattention

Reference 60

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:760c4661a2c239d176441a942cf212c725cc9ce99507a3298c5be66cb7e388e0

Observation ed6d477a-9f9b-4c36-8a99-5bae46cb18de · outbound

This paper cites InProceedings of the 57th annual meeting of the association for computational linguistics(2019), pp.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving InProceedings of the 57th annual meeting of the association for computational linguistics(2019), pp

Reference 61

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:757e8fe7e42ee1e08822cb845f91e5ad2a414d378ab31607c376054616ba203c

Observation 211e8de5-93dc-4361-955d-4bb84908d578 · outbound

This paper cites GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding

Reference 62

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:f136211b309a09de7a2365fcf217102c3b2b151fd367c0a6a358c8caec05896f

Observation 2dce03ab-1acb-43aa-84fa-2735851764fd · outbound

This paper cites T., and Rabusseau, G.Kq-svd: Compressing the kv cache with provable guarantees on attention fidelity.arXiv preprint arXiv:2512.05916(2025).

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving T., and Rabusseau, G.Kq-svd: Compressing the kv cache with provable guarantees on attention fidelity.arXiv preprint arXiv:2512.05916(2025)

Reference 63

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:ca0c7edcc618dc5c4885c3180dc99922c97068e91a00414977e08be290597332

Observation dc23d8a7-f710-4246-a953-66a7669715cd · outbound

This paper cites In International Conference on Machine Learning(2023), PMLR, pp.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving In International Conference on Machine Learning(2023), PMLR, pp

Reference 64

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:35e0fbd769e5588b28a224902fba37bc28f6755a5a7b2a320f5fc62c48743a39

Observation a4ca30aa-0a60-4a97-8da3-41aaa7706bbc · outbound

This paper cites an unresolved cited work.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Unresolved cited work

Reference 65

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:31e109657d7b23e029df623ee94a1101ac3c037a689471179928838cc360b7f7

Observation 2a248df5-aef7-489e-a79a-2dca67a3f63f · outbound

This paper cites S., Hsu, L., Ernst, D., Zardoshti, P., Novakovic, S., Shah, M., Rajadnya, S., Lee, S., Agarwal, I., et al.Pond: Cxl-based memory pooling systems for cloud platforms.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving S., Hsu, L., Ernst, D., Zardoshti, P., Novakovic, S., Shah, M., Rajadnya, S., Lee, S., Agarwal, I., et al.Pond: Cxl-based memory pooling systems for cloud platforms

Reference 66

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:20d2c5be336b7db461f64c50d7a61231a9c9a1ca4f9c6b8ac66edbc6b81c49e5

Observation ef701a40-15eb-42eb-a2a4-373a290017d4 · outbound

This paper cites A Survey on Large Language Model Acceleration based on KV Cache Management.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving A Survey on Large Language Model Acceleration based on KV Cache Management

Reference 67

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:ae818f33e0a01b2aab8403ae0a79e05434e9a32967e70dc084218250f2022af4

Observation 65508025-0de0-4c58-be13-85faaa81ee79 · outbound

This paper cites EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty

Reference 68

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:be48482e14299d8773deacf985ca94feb1b6949541ab2e6e1838b0c0841a9912

Observation aad158e2-5212-4bdd-ae10-a5ffbd292fbf · outbound

This paper cites E., et al.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving E., et al

Reference 69

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:e2e4c2d12174293458b1be89d6ea325e47a65708c53afdb2343011f33a109600

Observation 1beb5909-efba-4ad6-bee9-51a4df9b23de · outbound

This paper cites Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache

Reference 70

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:9e6d9e635fd341d16ba40165c9857115252afc129b69dccd23c2a50730580543

Observation 118eae73-320f-4f63-b75d-5cb40ac5aab7 · outbound

This paper cites an unresolved cited work.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Unresolved cited work

Reference 71

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:0404d29b28a470b84fc9fb2be0d55d3487d5f9e832eb501e88a25de17d45340a

Observation b0421319-d752-4fe9-9cba-5113b796ec04 · outbound

This paper cites an unresolved cited work.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Unresolved cited work

Reference 72

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:47b2d92947c7619c8bca093228e1588f4a4b0f72f7b6ae0b27051554a6bc42a0

Observation 4ba35715-bbc0-49ee-869a-aeeb2aba232c · outbound

This paper cites InProceedings of the 2026 ACM/SIGDA International Symposium on Field Programmable Gate Arrays(2026), pp.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving InProceedings of the 2026 ACM/SIGDA International Symposium on Field Programmable Gate Arrays(2026), pp

Reference 73

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:d8f2f5c3105c73077aa3c823fc50946ba1e16bb848ac040f999de6bd90a58221

Observation 6ef4c7bd-23e1-402e-be26-1b56f38db33b · outbound

This paper cites an unresolved cited work.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Unresolved cited work

Reference 74

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:4377ee81fc790fea7a59114aca5039d6b93d1f84bd806065968c044d2cc5e3de

Observation dbf9a85e-7be7-4530-abc5-e0f4635963c1 · outbound

This paper cites In International Conference on Learning Representations(2024), vol.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving In International Conference on Learning Representations(2024), vol

Reference 75

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:d985d17d4c358b0eb7fe43622b265e82208adb89164ad8ff3741f21491cb1599

Observation ce2a5b33-c4b9-4a95-ae6b-adc48afcef63 · outbound

This paper cites 32 Jie Li, Tongyang Wang, and Yong Chen.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving 32 Jie Li, Tongyang Wang, and Yong Chen

Reference 76

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:777df3c00deed680283b3913049e829e91dbbd4322b34751f803a9bd820eefd2

Observation 06378a37-5429-4be8-a8f3-b6c1de6cfa53 · outbound

This paper cites an unresolved cited work.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Unresolved cited work

Reference 77

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:bace4ab84e82f5aee7f64e9cfc0dc81cf1e5baecb2f3a8ce41810632c25034c3

Observation 714f0613-9669-4e7d-929c-14b59d3d71ea · outbound

This paper cites InProceedings of the 4th International Conference on Artificial Intelligence and Intelligent Information Processing(2025), pp.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving InProceedings of the 4th International Conference on Artificial Intelligence and Intelligent Information Processing(2025), pp

Reference 78

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:460892c94b338374023183683fb41b554a09b8f4edcd3838448e04e4bed555f7

Observation ca62b75c-37a0-4718-b741-346f2264b383 · outbound

This paper cites InProceedings of the ACM SIGCOMM 2024 Conference(2024), pp.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving InProceedings of the ACM SIGCOMM 2024 Conference(2024), pp

Reference 79

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:788c1072111fd14a8006021a7fdb8068edb6cbab3c7985c273dafc13d674a959

Observation e5b22ac4-918e-410d-bd3a-069bc9f6b8df · outbound

This paper cites an unresolved cited work.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Unresolved cited work

Reference 80

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:c8449dd04e19a67789dde478f68816036f1327e10eb2b896a814eb8d1d629b1e

Observation 462fbf52-a1df-431b-b5a0-4b74668bb214 · outbound

This paper cites an unresolved cited work.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Unresolved cited work

Reference 81

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:c82db82b6a1589ca2afad0599eb2ce17e37126bf1c237da1abe8a6f9154194fe

Observation b1d5aabc-7126-4165-8efb-0d2a84b55720 · outbound

This paper cites KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache

Reference 82

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:67dd58da17cb985d0d63dd6d78d2a73a9c656b2a6678c494bc81310e9e7bd4ba

Observation 7b4db615-375d-4355-98a7-c6d1d72c3b4d · outbound

This paper cites A., and Y ashunin, D.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving A., and Y ashunin, D

Reference 83

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:6e6a94c772aad9808b7b8c759175d686b4fd97cc6aad23c73a3957e19388bc9d

Observation a952099d-d4ab-4e7c-8d16-7dbead6f1312 · outbound

This paper cites an unresolved cited work.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Unresolved cited work

Reference 84

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:bf98aaf1c717a93a8b842d3a5ea82e800058f1c8d1a0357a2edabeeef99eb7de

Observation 3e040c55-e160-4981-9490-b0c2cb6606aa · outbound

This paper cites an unresolved cited work.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Unresolved cited work

Reference 85

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:4cabf1ec9660a00a2f93a6a4654e771920d4fbff8713802130d118252691aeab

Observation 31dfef44-92e1-4fd9-b9f5-92dd9c6fd3ea · outbound

This paper cites Landmark Attention: Random-Access Infinite Context Length for Transformers.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Landmark Attention: Random-Access Infinite Context Length for Transformers

Reference 86

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:c6f81a85ea9bb5c82e38fc49730c58af2639f47903d039162218cff3a5e4fd6b

Observation c1c1b3ba-d766-461b-8d3e-e79258171d03 · outbound

This paper cites InProceedings of the international conference for high performance computing, networking, storage and analysis (2021), pp.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving InProceedings of the international conference for high performance computing, networking, storage and analysis (2021), pp

Reference 87

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:014de9f85cff2a4ff846854b220e2b0a4c4e4628a9d9ff2535c312ebfa076a36

Observation b714451a-be66-4a3f-b7c6-4554e09617e3 · outbound

This paper cites Dynamic Memory Compression: Retrofitting LLMs for Accelerated Inference.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Dynamic Memory Compression: Retrofitting LLMs for Accelerated Inference

Reference 88

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:8e579c9853217db77ae93c004237571c01832392e497244ac91e014f74fa8375

Observation 7e2c30df-c0c6-4002-ab4c-4949fc289c52 · outbound

This paper cites an unresolved cited work.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Unresolved cited work

Reference 89

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:49f66eb8b9ff543103d9a70ce17cd12bda2aed392e4ab6e8cdb421c49341aa5c

Observation 0acc352b-3cec-4e36-a356-6ba23a0d4139 · outbound

This paper cites M., Stratmann, E., and Stutsman, R.The case for ramclouds: Scalable high-performance storage entirely in dram.ACM SIGOPS Operating Systems Review 43, 4 (2010), 92–105.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving M., Stratmann, E., and Stutsman, R.The case for ramclouds: Scalable high-performance storage entirely in dram.ACM SIGOPS Operating Systems Review 43, 4 (2010), 92–105

Reference 90

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:171a77e377adde1d460c222d98419d16678b990ae864c13cc6c0aac2fa723241

Observation 3edabbc9-277b-49cf-91b6-d8325537e2c5 · outbound

This paper cites In2024 ACM/IEEE 51st Annual International Symposium on Computer Architecture (ISCA)(2024), IEEE, pp.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving In2024 ACM/IEEE 51st Annual International Symposium on Computer Architecture (ISCA)(2024), IEEE, pp

Reference 91

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:78b357f2ba6f26e6dd162dfaf809fe29dc79196c1aadd3c8b9ccd4f45e5cbbdc

Observation 7eedc6ea-86c3-4eb4-9621-d9512f083101 · outbound

This paper cites InInternational Conference on Learning Representations(2024), vol.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving InInternational Conference on Learning Representations(2024), vol

Reference 92

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:30b95d6d2bd7733208941ad21856b9621c0a032ecc36a7c65717dfbfd0ea85b4

Observation 9e6404b2-4bd0-4c60-8010-1559a9d0e226 · outbound

This paper cites Efficiently scaling transformer inference.Proceedings of machine learning and systems 5(2023), 606–624.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Efficiently scaling transformer inference.Proceedings of machine learning and systems 5(2023), 606–624

Reference 93

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:842bb04c6cc3c30b2c39d68244c07ea54c935a6c0158bcf77fccb9121aff669a

Observation 132596d3-6ab5-43cd-822d-b83f3f8ecc00 · outbound

This paper cites InProceedings of the 30th ACM International Conference on Architectural Support for Programming Languages and Operating Systems, Volume 1(2025), pp.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving InProceedings of the 30th ACM International Conference on Architectural Support for Programming Languages and Operating Systems, Volume 1(2025), pp

Reference 94

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:19d7884ce9e25bc8600f2afd6c31ae34e1b1f2333debaf158a40e4769b8bd957

Observation 8e68687d-7b86-4dab-aafd-3ac83fddfb57 · outbound

This paper cites DRackSim: Simulator for Rack-scale Memory Disaggregation.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving DRackSim: Simulator for Rack-scale Memory Disaggregation

Reference 95

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:1d3b47d7a710ae8dc8bf6a1e3bf0a25ab9ad0f6dd90a297c5ab98b7d01ca226a

Observation 480e6ef2-f300-43c2-aeb1-f9e7c162968f · outbound

This paper cites an unresolved cited work.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Unresolved cited work

Reference 96

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:1d96c1081709408d0afaf4293a980a12398610954a64c6e7d0fc0ff43dba44be

Observation ff09ccd4-b4d6-4775-a6fb-60b9c473a77c · outbound

This paper cites Y., Awan, A.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Y., Awan, A

Reference 97

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:6e596877351149be13bea565a0fefd45aa689b96b178386478ca75b67e445eb8

Observation 81f7cc40-a63f-43af-a802-1a258a055db3 · outbound

This paper cites InSC20: international conference for high performance computing, networking, storage and analysis(2020), IEEE, pp.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving InSC20: international conference for high performance computing, networking, storage and analysis(2020), IEEE, pp

Reference 98

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:513ee25d644ec9bc1466a6d95cfbce79876dd974be2b7b6a6cd3367db8641bbe

Observation 25231359-91c6-47ae-ac93-4234e7f1fc66 · outbound

This paper cites an unresolved cited work.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving Unresolved cited work

Reference 99

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:148090b5a3c2d5c484d66afd6531c987cb1848b92ebc35db3bd04a94c0093042

Observation 42a42c12-72e9-43f7-a0bb-84c603b381ec · outbound

This paper cites GPT Semantic Cache: Reducing LLM Costs and Latency via Semantic Embedding Caching.

From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving GPT Semantic Cache: Reducing LLM Costs and Latency via Semantic Embedding Caching

Reference 100

Resolution
unresolved
no resolver link, observed 2026-07-12T09:50:23.266920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T09:50:23.266920Z digest=sha256:756522a8301c9f29b20ca94984df5942dc5ff8b6747f7416db55ed69d3326ea6

Pith citing papers

No inbound Pith citation observations are available.