{"as_of":"2026-08-08T13:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2853621469676f43752e18b42cec56a83adf12f84bc4114c35ecfea3fcb3993b","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:22:45.314876Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.21919/citation-record","integrity":"/paper/2505.21919/integrity","json":"/paper/2505.21919/citation-record.json","paper":"/paper/2505.21919"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:47.221176Z","title":"CHIME: A Cache-Efficient and High-Performance Hybrid Index on Disaggregated Memory,","venue":null,"work_id":"ea50740b-5ee5-4fce-be10-52f887d3280b","year":null},"citing_paper":{"arxiv_id":"2505.21919","last_updated":"2025-05-28T03:05:55Z","snapshot_observed_at":"2026-08-07T13:17:02.968744Z","submitted_at":"2025-05-28T03:05:55Z","title":"Towards Efficient Key-Value Cache Management for Prefix Prefilling in LLM Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:44.081676Z"},"links":{"citing_paper":"/paper/2505.21919"},"observation_digest":"sha256:5ca6d1f4988423c8def2942cf236bed856873322f89eef8ebf10a6b4fb2f2e1d","observation_id":"375ff02c-a8a4-408b-b728-6828018802f6","resolution":{"observed_at":"2026-08-07T13:22:47.290344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:47.087143Z","title":"Sherman: A Write-Optimized Distributed B+Tree Index on Disaggregated Memory,","venue":null,"work_id":"05995fd6-3f43-4a78-84c8-8b54ec75ba57","year":null},"citing_paper":{"arxiv_id":"2505.21919","last_updated":"2025-05-28T03:05:55Z","snapshot_observed_at":"2026-08-07T13:17:02.968744Z","submitted_at":"2025-05-28T03:05:55Z","title":"Towards Efficient Key-Value Cache Management for Prefix Prefilling in LLM Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:44.174156Z"},"links":{"citing_paper":"/paper/2505.21919"},"observation_digest":"sha256:fff6466f3967daa8116dc80f97b6eec27129f370ba78ae77c25dbe58b5cf722e","observation_id":"0799148e-4176-41c6-be15-11073ca27ef8","resolution":{"observed_at":"2026-08-07T13:22:47.181456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:46.971187Z","title":"Unlocking Longer Generation with Key-Value Cache Quantization","venue":null,"work_id":"2bf2908f-b70a-4f7c-b40a-81715bf76cdd","year":2024},"citing_paper":{"arxiv_id":"2505.21919","last_updated":"2025-05-28T03:05:55Z","snapshot_observed_at":"2026-08-07T13:17:02.968744Z","submitted_at":"2025-05-28T03:05:55Z","title":"Towards Efficient Key-Value Cache Management for Prefix Prefilling in LLM Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:44.282406Z"},"links":{"citing_paper":"/paper/2505.21919"},"observation_digest":"sha256:2555533326caaa4804815464d1fb60684708778703c195afb3671d6cfcc4e7a1","observation_id":"f05966c6-ad4a-4800-b5df-a7844b415cc3","resolution":{"observed_at":"2026-08-07T13:22:47.010693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:46.834283Z","title":"vLLM vs TensorRT- LLM 12, Automatic Prefix Caching","venue":null,"work_id":"dc8b9a3f-8d7f-4ed4-92de-b8871ed8bf9e","year":2024},"citing_paper":{"arxiv_id":"2505.21919","last_updated":"2025-05-28T03:05:55Z","snapshot_observed_at":"2026-08-07T13:17:02.968744Z","submitted_at":"2025-05-28T03:05:55Z","title":"Towards Efficient Key-Value Cache Management for Prefix Prefilling in LLM Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:44.386461Z"},"links":{"citing_paper":"/paper/2505.21919"},"observation_digest":"sha256:ccb5a9da859e5a6059a48de38fee57cdc5dfce41cd83a1e8ceafa040fa53f575","observation_id":"fc9c2d9e-0206-48e6-a911-c3301b27228b","resolution":{"observed_at":"2026-08-07T13:22:46.914847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12706","last_updated":"2025-02-20T12:14:49Z","snapshot_observed_at":"2026-08-07T14:50:59.121668Z","submitted_at":"2024-12-17T09:20:31Z","title":"More Tokens, Lower Precision: Towards the Optimal Token-Precision Trade-off in KV Cache Compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12706","snapshot_observed_at":"2026-08-07T13:22:44.472480Z","title":"More Tokens, Lower Precision: Towards the Optimal Token-Precision Trade-off in KV Cache Compression,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21919","last_updated":"2025-05-28T03:05:55Z","snapshot_observed_at":"2026-08-07T13:17:02.968744Z","submitted_at":"2025-05-28T03:05:55Z","title":"Towards Efficient Key-Value Cache Management for Prefix Prefilling in LLM Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:44.472480Z"},"links":{"cited_paper":"/paper/2412.12706","citing_paper":"/paper/2505.21919"},"observation_digest":"sha256:8e421038c086b0c3bc7d891a9fb60e4a9ff4ad032e190e97117f2b6503dca800","observation_id":"9f28759a-2cf3-4dd8-8106-86b6acf5f8e9","resolution":{"observed_at":"2026-08-07T13:22:44.472480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-07T13:22:44.554910Z","title":"GQA: Training Generalized Multi-query Transformer Models from Multi-Head Checkpoints,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21919","last_updated":"2025-05-28T03:05:55Z","snapshot_observed_at":"2026-08-07T13:17:02.968744Z","submitted_at":"2025-05-28T03:05:55Z","title":"Towards Efficient Key-Value Cache Management for Prefix Prefilling in LLM Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:44.554910Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2505.21919"},"observation_digest":"sha256:79e51ac6a560534717ff270485c71c91cc9f17fac22f38cab79763d7f38392be","observation_id":"ba612c96-afe4-4af9-9450-4a4d25d12738","resolution":{"observed_at":"2026-08-07T13:22:44.554910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:46.665498Z","title":"Longformer: The long- document transformer,","venue":null,"work_id":"55617398-9497-4bcf-b493-37f28b4e3097","year":null},"citing_paper":{"arxiv_id":"2505.21919","last_updated":"2025-05-28T03:05:55Z","snapshot_observed_at":"2026-08-07T13:17:02.968744Z","submitted_at":"2025-05-28T03:05:55Z","title":"Towards Efficient Key-Value Cache Management for Prefix Prefilling in LLM Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:44.706234Z"},"links":{"citing_paper":"/paper/2505.21919"},"observation_digest":"sha256:253039f6ab9d574b0039833eb9a63738558608563ea9200fd7975ddfbb76a889","observation_id":"6f72440f-ebc4-4f90-b435-07f7a5963d91","resolution":{"observed_at":"2026-08-07T13:22:46.729746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09317","last_updated":"2024-11-14T09:50:41Z","snapshot_observed_at":"2026-07-06T19:50:15.546603Z","submitted_at":"2024-11-14T09:50:41Z","title":"Pie: Pooling CPU Memory for LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09317","snapshot_observed_at":"2026-08-07T13:22:44.784746Z","title":"Pie: Pooling CPU Memory for LLM Inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21919","last_updated":"2025-05-28T03:05:55Z","snapshot_observed_at":"2026-08-07T13:17:02.968744Z","submitted_at":"2025-05-28T03:05:55Z","title":"Towards Efficient Key-Value Cache Management for Prefix Prefilling in LLM Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:44.784746Z"},"links":{"cited_paper":"/paper/2411.09317","citing_paper":"/paper/2505.21919"},"observation_digest":"sha256:38756b4b7d4f2f6178c8760f1349c80d80e9697a833dad92ce6f52b3aac36439","observation_id":"d6e904c3-9c8b-42a7-95ff-0b9f54fb0e8d","resolution":{"observed_at":"2026-08-07T13:22:44.784746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:46.430720Z","title":"Mooncake: Trading More Storage for Less Computation—A KVCache-centric Architecture for Serving LLM Chatbot,","venue":null,"work_id":"e53823ab-42c6-4d29-a4cf-1f525dae1252","year":null},"citing_paper":{"arxiv_id":"2505.21919","last_updated":"2025-05-28T03:05:55Z","snapshot_observed_at":"2026-08-07T13:17:02.968744Z","submitted_at":"2025-05-28T03:05:55Z","title":"Towards Efficient Key-Value Cache Management for Prefix Prefilling in LLM Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:44.875176Z"},"links":{"citing_paper":"/paper/2505.21919"},"observation_digest":"sha256:6f790865a06f6cc861db3ccfe770a0c38b95649b93a91f9843be046d494664f4","observation_id":"a97db814-edd7-46eb-84ce-9e6adf73d081","resolution":{"observed_at":"2026-08-07T13:22:46.548558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:46.247136Z","title":"CacheGen: KV Cache Compression and Streaming for Fast Large Language Model Serving,","venue":null,"work_id":"428e4549-c8e8-442a-9160-797fad1017f1","year":null},"citing_paper":{"arxiv_id":"2505.21919","last_updated":"2025-05-28T03:05:55Z","snapshot_observed_at":"2026-08-07T13:17:02.968744Z","submitted_at":"2025-05-28T03:05:55Z","title":"Towards Efficient Key-Value Cache Management for Prefix Prefilling in LLM Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:44.988250Z"},"links":{"citing_paper":"/paper/2505.21919"},"observation_digest":"sha256:7f718fda623375d1d9eadcb40abd4fb42946c30130ac5bd2983d74eb893e410b","observation_id":"0fb4072f-0a8b-49d0-9160-848e7435ae17","resolution":{"observed_at":"2026-08-07T13:22:46.334911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:45.943632Z","title":"DeepSeek 3FS","venue":null,"work_id":"2f599c2a-7d99-4c9d-9d97-e389a7b9c394","year":2025},"citing_paper":{"arxiv_id":"2505.21919","last_updated":"2025-05-28T03:05:55Z","snapshot_observed_at":"2026-08-07T13:17:02.968744Z","submitted_at":"2025-05-28T03:05:55Z","title":"Towards Efficient Key-Value Cache Management for Prefix Prefilling in LLM Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:45.106737Z"},"links":{"citing_paper":"/paper/2505.21919"},"observation_digest":"sha256:a314a26b1b0293d2a8e8c04bb3c4e9b321dd3a05fe8c42f35fd2d15bd8bb6a11","observation_id":"5aeb4ef5-c030-4ff3-a977-6aa2a4c68dd7","resolution":{"observed_at":"2026-08-07T13:22:46.087572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:45.715174Z","title":"IMPRESS: An Importance-Informed Multi-Tier Prefix KV Storage System for Large Language Model Inference,","venue":null,"work_id":"76385da6-1a64-4e41-86d4-aab83b534ed0","year":null},"citing_paper":{"arxiv_id":"2505.21919","last_updated":"2025-05-28T03:05:55Z","snapshot_observed_at":"2026-08-07T13:17:02.968744Z","submitted_at":"2025-05-28T03:05:55Z","title":"Towards Efficient Key-Value Cache Management for Prefix Prefilling in LLM Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:45.218533Z"},"links":{"citing_paper":"/paper/2505.21919"},"observation_digest":"sha256:4f05504e44aa9d42eea9520003ed0bf516323059722dd1b48ccc6a132c580bb4","observation_id":"75256a89-6565-4e20-b516-4c4f2b4578ab","resolution":{"observed_at":"2026-08-07T13:22:45.827026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:45.477427Z","title":"Exploring cxl-based kv cache storage for llm serving,","venue":null,"work_id":"0554edbb-3a6b-4738-b3bc-025ac012aa92","year":null},"citing_paper":{"arxiv_id":"2505.21919","last_updated":"2025-05-28T03:05:55Z","snapshot_observed_at":"2026-08-07T13:17:02.968744Z","submitted_at":"2025-05-28T03:05:55Z","title":"Towards Efficient Key-Value Cache Management for Prefix Prefilling in LLM Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:45.314876Z"},"links":{"citing_paper":"/paper/2505.21919"},"observation_digest":"sha256:c3c12d6f08958a9a6acadd1aa0f552ee1c752d3026239d43620daa82c73fe520","observation_id":"e12c1413-4397-4f13-abee-b623222209de","resolution":{"observed_at":"2026-08-07T13:22:45.549127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.21919","last_updated":"2025-05-28T03:05:55Z","latest_version":1,"primary_category":"cs.ET","snapshot_observed_at":"2026-08-07T13:17:02.968744Z","submitted_at":"2025-05-28T03:05:55Z","title":"Towards Efficient Key-Value Cache Management for Prefix Prefilling in LLM Inference"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2505.21919."}