Pith. sign in

Paper Citation Record · LEDGER

Preserving Admission Responsibility in Multi-Tenant Large Language Model Prefix Caches

As of 17 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2608.01657.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2608.01657 v1

Coverage vector

measured 21 of 21 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-04T23:39:09.503875Z

measured 21 of 21 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

21 of 21 outbound references displayed

  • verified exact0
  • verified fuzzy21
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 387b4860-b496-471e-819e-ee815ad404f2 · outbound

This paper cites Efficient memory management for large language model serving with PagedAttention,.

Preserving Admission Responsibility in Multi-Tenant Large Language Model Prefix Caches Efficient memory management for large language model serving with PagedAttention,

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:39:14.650177Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-04T23:39:06.876542Z digest=sha256:c57ff7e29575b6a554a2a8ec9121ca21f7f67993a85c5df7705b36b9a06b89dd

Observation 8970443a-57a6-494f-b853-f566639fa1f5 · outbound

This paper cites SGLang: Efficient execution of structured language model programs,.

Preserving Admission Responsibility in Multi-Tenant Large Language Model Prefix Caches SGLang: Efficient execution of structured language model programs,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:39:14.387815Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-04T23:39:06.945638Z digest=sha256:69d6759beecd528cbb3d30a3543a56ac9771be746ccc0c91c39017aa54499ced

Observation 475d677f-11ba-4d0f-bdf3-d532130e5e82 · outbound

This paper cites Stateful large language model serving with Pensieve,.

Preserving Admission Responsibility in Multi-Tenant Large Language Model Prefix Caches Stateful large language model serving with Pensieve,

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:39:14.115636Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-04T23:39:07.068100Z digest=sha256:4ee0d303e354bb045acda15bb38f778983ef3f2d037bc3945f71723ec5408b2f

Observation ec41eb9c-d281-446c-a7e8-5441c48b0ba4 · outbound

This paper cites Online context caching for distributed large language models serving,.

Preserving Admission Responsibility in Multi-Tenant Large Language Model Prefix Caches Online context caching for distributed large language models serving,

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:39:13.837447Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-04T23:39:07.206965Z digest=sha256:d1babd3399a70be4a5e9fd8897d23c2e6f03aa82d116b2e2e52317488ad0d39d

Observation b438ddf6-5854-4404-873f-7603880d0a9b · outbound

This paper cites MELL: Memory-efficient large language model serving via multi-GPU KV cache management,.

Preserving Admission Responsibility in Multi-Tenant Large Language Model Prefix Caches MELL: Memory-efficient large language model serving via multi-GPU KV cache management,

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:39:13.586664Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-04T23:39:07.337094Z digest=sha256:8d6c279b538f6ab026191f6d7080e7df705c96b0ec536c03ae375d8206870f2b

Observation ac31c024-14e6-427f-8c54-89d9bd68a6cc · outbound

This paper cites Mooncake: Trading more storage for less computation—a KVCache-centric architecture for serving LLM chatbot,.

Preserving Admission Responsibility in Multi-Tenant Large Language Model Prefix Caches Mooncake: Trading more storage for less computation—a KVCache-centric architecture for serving LLM chatbot,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:39:13.352980Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-04T23:39:07.446449Z digest=sha256:26f5e68584ae9e19a2a16cfd0fd44b6e93f2bc40eadb6a8f7d0ea012b05a853b

Observation a628dc5c-0bd3-4956-85f9-a1a1ac216f76 · outbound

This paper cites KVCache cache in the wild: Characterizing and optimizing KVCache cache at a large cloud provider,.

Preserving Admission Responsibility in Multi-Tenant Large Language Model Prefix Caches KVCache cache in the wild: Characterizing and optimizing KVCache cache at a large cloud provider,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:39:13.134184Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-04T23:39:07.564760Z digest=sha256:93d6f8966b5a8e26b6b6b58e873883463942ea16b73c992c23e1740e186cc0c1

Observation 5c1e0539-4df6-4216-9724-927c2e65c6cc · outbound

This paper cites Fairness in serving large language models,.

Preserving Admission Responsibility in Multi-Tenant Large Language Model Prefix Caches Fairness in serving large language models,

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:39:12.948052Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-04T23:39:07.673297Z digest=sha256:c360d2b553c1b51bcfa4fa56ef0ef501a84d7b763c436fd9969d8f09f0fb432b

Observation 31e2e63d-7eda-42e8-91fe-a42e51674042 · outbound

This paper cites FIFO queues are all you need for cache eviction,.

Preserving Admission Responsibility in Multi-Tenant Large Language Model Prefix Caches FIFO queues are all you need for cache eviction,

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:39:12.670748Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-04T23:39:07.774046Z digest=sha256:93f52ddae8f61a79c0ae7900367a0ca7ae4f99ff0aac7a18ace6059db294ad73

Observation 2393ba6f-3e14-4d71-8e14-73a252c42dc4 · outbound

This paper cites FairRide: Near- optimal, fair cache sharing,.

Preserving Admission Responsibility in Multi-Tenant Large Language Model Prefix Caches FairRide: Near- optimal, fair cache sharing,

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:39:12.411005Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-04T23:39:07.938840Z digest=sha256:d5ec0e1c4c1e71220fc937bb26714ebbccd107770107780334a717d4d38f5173

Observation 34140d50-9b9f-47c3-bac6-4390299b0e00 · outbound

This paper cites NyxCache: Flexible and efficient multi-tenant persistent memory caching,.

Preserving Admission Responsibility in Multi-Tenant Large Language Model Prefix Caches NyxCache: Flexible and efficient multi-tenant persistent memory caching,

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:39:12.107542Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-04T23:39:08.088152Z digest=sha256:d90fbfd21cd20ead795ad5351a6ea44a5d4a0b96e975b2b61a301d7114749a26

Observation 7cd55043-5d03-49bd-934d-f70664315653 · outbound

This paper cites TinyLFU: A highly efficient cache admission policy,.

Preserving Admission Responsibility in Multi-Tenant Large Language Model Prefix Caches TinyLFU: A highly efficient cache admission policy,

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:39:11.916770Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-04T23:39:08.228622Z digest=sha256:c08a5d1db83c9bdfce99457c3ef57167a245fa820f07869713ab0cd530467f85

Observation e52f807e-2837-49e9-a41a-94b75d625a4d · outbound

This paper cites CacheBlend: Fast large language model serving for RAG with cached knowledge fusion,.

Preserving Admission Responsibility in Multi-Tenant Large Language Model Prefix Caches CacheBlend: Fast large language model serving for RAG with cached knowledge fusion,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:39:11.739259Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-04T23:39:08.376122Z digest=sha256:feb6449e28cf2a7dd550ebd6713c8063c12aaec5472b7804e121d780c66914ee

Observation 9843a93a-fc54-491c-a553-03b251c23e44 · outbound

This paper cites Oneiros: KV cache optimization through parameter remapping for multi-tenant LLM serving,.

Preserving Admission Responsibility in Multi-Tenant Large Language Model Prefix Caches Oneiros: KV cache optimization through parameter remapping for multi-tenant LLM serving,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:39:11.494632Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-04T23:39:08.488487Z digest=sha256:a42ecf961154146aed0b78f2ca3d053c5d3f4a627a1e26073184fd7f17f0a690

Observation e80bb4ab-9b9d-4c1f-9d3e-bc2eaa8f2c3e · outbound

This paper cites ServeGen: Workload characterization and generation of large language model serving in production,.

Preserving Admission Responsibility in Multi-Tenant Large Language Model Prefix Caches ServeGen: Workload characterization and generation of large language model serving in production,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:39:11.250527Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-04T23:39:08.612608Z digest=sha256:acc2b206eae301c17b13573e67e7c1fd2da525887d1691e51c913d000bea5b74

Observation f7b9beaf-771a-439a-be53-4e5b1b3dec39 · outbound

This paper cites IC-Cache: Efficient large language model serving via in-context caching,.

Preserving Admission Responsibility in Multi-Tenant Large Language Model Prefix Caches IC-Cache: Efficient large language model serving via in-context caching,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:39:11.003651Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-04T23:39:08.814744Z digest=sha256:452de0edeaf6df3d0f84548fe1609cb0c36d0aec2e195e99860f38432b4130e8

Observation 75cb134f-501c-4873-a8b6-340314b8e29b · outbound

This paper cites CacheGen: KV cache compression and streaming for fast large language model serving,.

Preserving Admission Responsibility in Multi-Tenant Large Language Model Prefix Caches CacheGen: KV cache compression and streaming for fast large language model serving,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:39:10.782441Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-04T23:39:08.956548Z digest=sha256:45cf5f0fff2f22c5a900c2ab49f5b79f892b8b183cb822f879d489796af53d36

Observation 7bab2b8f-4ad4-4afd-8566-958bb6a29a01 · outbound

This paper cites ThunderServe: High-performance and cost-efficient LLM serving in cloud environments,.

Preserving Admission Responsibility in Multi-Tenant Large Language Model Prefix Caches ThunderServe: High-performance and cost-efficient LLM serving in cloud environments,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:39:10.531597Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-04T23:39:09.072073Z digest=sha256:ccb3eba3c1d1761ac6cf651d230691a80193eaffdd3e1c8c551300006127af01

Observation ce5eac51-163c-412e-94ac-9437cde73904 · outbound

This paper cites Jenga: Effective memory management for serving LLM with heterogeneity,.

Preserving Admission Responsibility in Multi-Tenant Large Language Model Prefix Caches Jenga: Effective memory management for serving LLM with heterogeneity,

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:39:10.329498Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-04T23:39:09.242678Z digest=sha256:ce959b070afe6819874ac3841527c65409d236e3f64db51180e4cbc37bc2bd27

Observation 370e30f8-fc6a-476c-a98b-35f1b71f4d59 · outbound

This paper cites LServe: Efficient long-sequence LLM serving with unified sparse attention,.

Preserving Admission Responsibility in Multi-Tenant Large Language Model Prefix Caches LServe: Efficient long-sequence LLM serving with unified sparse attention,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:39:10.003418Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-04T23:39:09.394838Z digest=sha256:916fca99524a652c941ba4c3c4c2fceed9ddc70becc5c6d1eec3aca7b2163704

Observation 7a66cbfc-27fd-4516-9ab4-d4402cda02e8 · outbound

This paper cites Memory- efficient KV cache optimization for large language model inference at the edge,.

Preserving Admission Responsibility in Multi-Tenant Large Language Model Prefix Caches Memory- efficient KV cache optimization for large language model inference at the edge,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:39:09.787520Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-04T23:39:09.503875Z digest=sha256:0f09a682b3912462df2278881cdf3851f82ea5c6b5b2d5a3fe608c191155b749

Pith citing papers

No inbound Pith citation observations are available.