{"as_of":"2026-08-05T23:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:82ebb5bc77cee1c51a4ab49606c92535cf38e5e736c31897a5e14a43831887e8","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.08057/citation-record","integrity":"/paper/2607.08057/integrity","json":"/paper/2607.08057/citation-record.json","paper":"/paper/2607.08057"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.05165","doi":"10.48550/arxiv.2509.05165","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reza Yazdani Aminabadi, Samyam Rajbhandari, Am- mar Ahmad Awan, Cheng Li, Du Li, Elton Zheng, Olatunji Ruwase, Shaden Smith, Minjia Zhang, Jeff Rasley, and Yuxiong He","venue":"ArXiv.org","work_id":"85b80250-577d-478d-8d3c-caaa0640674e","year":2022},"citing_paper":{"arxiv_id":"2607.08057","last_updated":"2026-07-09T02:11:18Z","snapshot_observed_at":"2026-08-04T11:12:32.355642Z","submitted_at":"2026-07-09T02:11:18Z","title":"Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-10T00:55:52.215700Z"},"links":{"citing_paper":"/paper/2607.08057"},"observation_digest":"sha256:8c37b0611e7d901607053496c5f556712afd1582b81c55a1d09b2aa4c85ba6cb","observation_id":"9b862f76-056f-4a5d-acfc-141e73d7b3bf","resolution":{"observed_at":"2026-07-10T00:56:40.955266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:19:56.677812+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:19:56.677812+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04643","last_updated":"2024-04-12T13:00:25Z","snapshot_observed_at":"2026-08-04T07:21:43.170218Z","submitted_at":"2024-03-07T16:42:37Z","title":"QAQ: Quality Adaptive Quantization for LLM KV Cache","version":2},"cited_work":{"arxiv_id":"2403.04643","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.04643","snapshot_observed_at":"2026-07-10T00:56:40.966385Z","title":"Shichen Dong, Wen Cheng, Jiayu Qin, and Wei Wang","venue":"cs.CL","work_id":"d70bef43-c14b-4123-9165-73982b68b6e2","year":2024},"citing_paper":{"arxiv_id":"2607.08057","last_updated":"2026-07-09T02:11:18Z","snapshot_observed_at":"2026-08-04T11:12:32.355642Z","submitted_at":"2026-07-09T02:11:18Z","title":"Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-10T00:55:52.215700Z"},"links":{"cited_paper":"/paper/2403.04643","citing_paper":"/paper/2607.08057"},"observation_digest":"sha256:453191b22eb6bc8406c86576b7902bc47a4c1a9946a5f6e2d664a18393bac6ba","observation_id":"8a4e0bd6-55d9-4de2-b720-7ea7ca35cb23","resolution":{"observed_at":"2026-07-10T00:56:40.967598Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14057","last_updated":"2024-07-19T06:34:45Z","snapshot_observed_at":"2026-07-06T18:48:49.546589Z","submitted_at":"2024-07-19T06:34:45Z","title":"LazyLLM: Dynamic Token Pruning for Efficient Long Context LLM Inference","version":1},"cited_work":{"arxiv_id":"2407.14057","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.14057","snapshot_observed_at":"2026-07-10T00:56:40.961590Z","title":"Lazyllm: Dynamic token pruning for efficient long context LLM inference.arXiv preprint arXiv:2407.14057","venue":"cs.CL","work_id":"490f102f-1700-4b06-8f29-69e79a840bdb","year":2024},"citing_paper":{"arxiv_id":"2607.08057","last_updated":"2026-07-09T02:11:18Z","snapshot_observed_at":"2026-08-04T11:12:32.355642Z","submitted_at":"2026-07-09T02:11:18Z","title":"Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-10T00:55:52.215700Z"},"links":{"cited_paper":"/paper/2407.14057","citing_paper":"/paper/2607.08057"},"observation_digest":"sha256:de55d9b5e63c53c3fdca771be2c40427bf3e0eb65b3d8621c1792645f8368591","observation_id":"037ea3a9-2cf1-49e0-a4c6-45d98885b7a1","resolution":{"observed_at":"2026-07-10T00:56:40.962769Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.08005","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:56:40.968764Z","title":"Deltakv: Residual-based kv cache compression via long-range similarity","venue":null,"work_id":"337ade75-c0e5-4b9d-8314-2cf7b9400956","year":2025},"citing_paper":{"arxiv_id":"2607.08057","last_updated":"2026-07-09T02:11:18Z","snapshot_observed_at":"2026-08-04T11:12:32.355642Z","submitted_at":"2026-07-09T02:11:18Z","title":"Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-10T00:55:52.215700Z"},"links":{"citing_paper":"/paper/2607.08057"},"observation_digest":"sha256:e7f0ba0187c125f8a0129b5e81f04753fb13330e1190527839b7ea33e41cc12c","observation_id":"f879b246-8df6-4573-88c7-a7473d278f62","resolution":{"observed_at":"2026-07-10T00:56:40.970360Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2607.08057","last_updated":"2026-07-09T02:11:18Z","snapshot_observed_at":"2026-08-04T11:12:32.355642Z","submitted_at":"2026-07-09T02:11:18Z","title":"Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-10T00:55:52.215700Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2607.08057"},"observation_digest":"sha256:8a1b3c13b105ccb6a1df4bfe4ffc9139ce3c572eb27039361154e9ebf24ddae8","observation_id":"c5c2f566-6573-44f2-83fe-7b5390964c35","resolution":{"observed_at":"2026-07-10T00:56:40.965166Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19442","last_updated":"2025-07-30T05:24:46Z","snapshot_observed_at":"2026-07-06T20:13:31.499259Z","submitted_at":"2024-12-27T04:17:57Z","title":"A Survey on Large Language Model Acceleration based on KV Cache Management","version":3},"cited_work":{"arxiv_id":"2412.19442","doi":"10.48550/arxiv.2412.19442","metadata_source":"pith","pith_arxiv_id":"2412.19442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A survey on large lan- guage model acceleration based on kv cache management","venue":"cs.AI","work_id":"5ad86189-256c-4911-bb00-fbfc90ae9a4e","year":2024},"citing_paper":{"arxiv_id":"2607.08057","last_updated":"2026-07-09T02:11:18Z","snapshot_observed_at":"2026-08-04T11:12:32.355642Z","submitted_at":"2026-07-09T02:11:18Z","title":"Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-10T00:55:52.215700Z"},"links":{"cited_paper":"/paper/2412.19442","citing_paper":"/paper/2607.08057"},"observation_digest":"sha256:86298e42c014e01e7e0c092cd69ab64b9fd0130c4d4731decc54b457d55a7961","observation_id":"69d14e1c-8af3-4b6c-a72b-c7d151241648","resolution":{"observed_at":"2026-07-10T00:56:40.957979Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:20:05.433835+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:20:05.433835+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15234","last_updated":"2025-07-23T10:11:55Z","snapshot_observed_at":"2026-08-05T06:23:34.302204Z","submitted_at":"2023-12-23T11:57:53Z","title":"Towards Efficient Generative Large Language Model Serving: A Survey from Algorithms to Systems","version":2},"cited_work":{"arxiv_id":"2312.15234","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.15234","snapshot_observed_at":"2026-07-10T00:56:40.976559Z","title":"Towards efficient generative large language model serving: A survey from algorithms to systems","venue":"cs.LG","work_id":"60d8ed33-eba3-401c-9124-609458817b15","year":2023},"citing_paper":{"arxiv_id":"2607.08057","last_updated":"2026-07-09T02:11:18Z","snapshot_observed_at":"2026-08-04T11:12:32.355642Z","submitted_at":"2026-07-09T02:11:18Z","title":"Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-10T00:55:52.215700Z"},"links":{"cited_paper":"/paper/2312.15234","citing_paper":"/paper/2607.08057"},"observation_digest":"sha256:986ad40e89b1e31d6d6afce3d84c4bcff46e591a10413799334c03df42156f0b","observation_id":"b1535c11-1425-4769-8eca-0e811aa67576","resolution":{"observed_at":"2026-07-10T00:56:40.977777Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00079","last_updated":"2025-09-03T14:56:29Z","snapshot_observed_at":"2026-07-06T18:38:42.333605Z","submitted_at":"2024-06-24T02:05:32Z","title":"Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving","version":4},"cited_work":{"arxiv_id":"2407.00079","doi":"10.48550/arxiv.2407.00079","metadata_source":"pith","pith_arxiv_id":"2407.00079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mooncake: A kvcache-centric disaggregated architecture for llm serving","venue":"cs.DC","work_id":"eee8f937-db6b-4c48-887b-960ca80c0d81","year":2024},"citing_paper":{"arxiv_id":"2607.08057","last_updated":"2026-07-09T02:11:18Z","snapshot_observed_at":"2026-08-04T11:12:32.355642Z","submitted_at":"2026-07-09T02:11:18Z","title":"Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T00:55:52.215700Z"},"links":{"cited_paper":"/paper/2407.00079","citing_paper":"/paper/2607.08057"},"observation_digest":"sha256:675c1eba398ee6fc8c85a0ceadcc322bb1fb7a8d09b4d73cf2148786106974bf","observation_id":"43c055a7-a8eb-4daf-8c8d-f31ee9ecee5d","resolution":{"observed_at":"2026-07-10T00:56:40.960364Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:20:11.013176+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:20:11.013176+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06262","last_updated":"2024-02-17T10:08:14Z","snapshot_observed_at":"2026-08-03T16:19:48.429086Z","submitted_at":"2024-02-09T09:20:59Z","title":"On the Efficacy of Eviction Policy for Key-Value Constrained Generative Language Model Inference","version":2},"cited_work":{"arxiv_id":"2402.06262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.06262","snapshot_observed_at":"2026-07-10T00:56:40.724162Z","title":"On the efficacy of eviction policy for key-value constrained generative language model inference","venue":"cs.CL","work_id":"eff2d2c6-2666-4f5b-8155-82d9f907ee66","year":2024},"citing_paper":{"arxiv_id":"2607.08057","last_updated":"2026-07-09T02:11:18Z","snapshot_observed_at":"2026-08-04T11:12:32.355642Z","submitted_at":"2026-07-09T02:11:18Z","title":"Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2402.06262","citing_paper":"/paper/2607.08057"},"observation_digest":"sha256:9a35a30a6fabd376dee0890c5f128b08441133ea4195770480d12e0d0c203cb7","observation_id":"3c82e1a2-e934-47ec-9a94-dfe6b9bd0471","resolution":{"observed_at":"2026-07-10T00:56:40.725793Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:56:41.207609Z","title":"Idris O Sunmola, Zhenjun Zhao, Samuel Schmidgall, Yumeng Wang, Paul Maria Scheikl, and Axel Krieger","venue":null,"work_id":"72dc195c-b462-4306-bb70-2b22531a2a66","year":null},"citing_paper":{"arxiv_id":"2607.08057","last_updated":"2026-07-09T02:11:18Z","snapshot_observed_at":"2026-08-04T11:12:32.355642Z","submitted_at":"2026-07-09T02:11:18Z","title":"Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-10T00:55:52.215700Z"},"links":{"citing_paper":"/paper/2607.08057"},"observation_digest":"sha256:08a162c68255016e23cf3bc93033197e97290ed0a7ce17819914191efea8909d","observation_id":"b20c001a-d8b3-4706-a16c-cf3d439c60e5","resolution":{"observed_at":"2026-07-10T00:56:41.208881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04079","last_updated":"2025-08-03T22:13:27Z","snapshot_observed_at":"2026-07-06T20:47:37.495143Z","submitted_at":"2025-03-06T04:33:19Z","title":"Surgical Gaussian Surfels: Highly Accurate Real-time Surgical Scene Rendering using Gaussian Surfels","version":2},"cited_work":{"arxiv_id":"2503.04079","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.04079","snapshot_observed_at":"2026-07-10T00:56:40.974056Z","title":"Surgical gaussian surfels: Highly accu- rate real-time surgical scene rendering using gaussian surfels","venue":"cs.CV","work_id":"7b33c22e-812f-454a-ae7c-94f5fa96f313","year":2025},"citing_paper":{"arxiv_id":"2607.08057","last_updated":"2026-07-09T02:11:18Z","snapshot_observed_at":"2026-08-04T11:12:32.355642Z","submitted_at":"2026-07-09T02:11:18Z","title":"Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-10T00:55:52.215700Z"},"links":{"cited_paper":"/paper/2503.04079","citing_paper":"/paper/2607.08057"},"observation_digest":"sha256:75ef6f25c98e57b079b8d58d728d0d56a34eb1e7dff8fda206689717aa9af9d9","observation_id":"ed5e878e-f0e7-4d67-bf39-9f4e66f85dd2","resolution":{"observed_at":"2026-07-10T00:56:40.975423Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-05T23:24:44.027417Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":"2303.18223","doi":"10.18653/v1/d16-1080","metadata_source":"pith","pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey of Large Language Models","venue":"cs.CL","work_id":"de1b42b5-4a0a-4b1f-8c78-1f7fe21be6c9","year":2023},"citing_paper":{"arxiv_id":"2607.08057","last_updated":"2026-07-09T02:11:18Z","snapshot_observed_at":"2026-08-04T11:12:32.355642Z","submitted_at":"2026-07-09T02:11:18Z","title":"Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-10T00:55:52.215700Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2607.08057"},"observation_digest":"sha256:d99d3021aa5914cef077a16ff523cfa253dc18399d88287275cd3d7b727dc216","observation_id":"972cf1f8-48ed-4582-8b16-a949690228db","resolution":{"observed_at":"2026-07-10T00:56:40.972806Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"cited_work":{"arxiv_id":"2404.14294","doi":"10.48550/arxiv.2404.14294","metadata_source":"pith","pith_arxiv_id":"2404.14294","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Efficient Inference for Large Language Models","venue":"cs.CL","work_id":"4e58b7d0-2870-4ddb-955f-798b34deb447","year":2024},"citing_paper":{"arxiv_id":"2607.08057","last_updated":"2026-07-09T02:11:18Z","snapshot_observed_at":"2026-08-04T11:12:32.355642Z","submitted_at":"2026-07-09T02:11:18Z","title":"Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-10T00:55:52.215700Z"},"links":{"cited_paper":"/paper/2404.14294","citing_paper":"/paper/2607.08057"},"observation_digest":"sha256:1ea3f47d785fb12809bc3fbe279e2e85fa4198e522af7f67f1fa1bcb038548fe","observation_id":"4d8bcde0-6f1a-4a16-8ae6-3343673db9b7","resolution":{"observed_at":"2026-07-10T00:56:40.952272Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:38.535897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:38.535897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:56:41.209886Z","title":"retain” vs. “evict","venue":null,"work_id":"cd9a895c-f0f4-4850-a2b3-e0d7cdec6e8e","year":2025},"citing_paper":{"arxiv_id":"2607.08057","last_updated":"2026-07-09T02:11:18Z","snapshot_observed_at":"2026-08-04T11:12:32.355642Z","submitted_at":"2026-07-09T02:11:18Z","title":"Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-10T00:55:52.215700Z"},"links":{"citing_paper":"/paper/2607.08057"},"observation_digest":"sha256:ea8a51ffce42269ac995dbab1b35bfea8ebc5e91b3ff64481b34072acb5c9df2","observation_id":"409dd5e7-b0a0-475c-8bd1-abdab80afb19","resolution":{"observed_at":"2026-07-10T00:56:41.210984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:56:41.202111Z","title":"BALI (Jurkschat et al., 2025) measures LLM inference across six frameworks or acceler- ation approaches","venue":null,"work_id":"ea7b2f1c-0536-4dc4-8956-ad31d04d1aef","year":2025},"citing_paper":{"arxiv_id":"2607.08057","last_updated":"2026-07-09T02:11:18Z","snapshot_observed_at":"2026-08-04T11:12:32.355642Z","submitted_at":"2026-07-09T02:11:18Z","title":"Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-10T00:55:52.215700Z"},"links":{"citing_paper":"/paper/2607.08057"},"observation_digest":"sha256:7c6dc6c4b1c68bb9853d53f4c43eb5c9fb359864ed24ce00a6dcbbfdcf91ad3e","observation_id":"10db3a9b-75f7-4d17-b12d-d05574827fab","resolution":{"observed_at":"2026-07-10T00:56:41.203423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:56:41.203979Z","title":"Workloads.A future sKis benchmark should cover the following three workload types to stress temporal, spatial, and structural KV behaviors:","venue":null,"work_id":"97665230-fb05-439f-9445-c8a0dcc9e1e4","year":null},"citing_paper":{"arxiv_id":"2607.08057","last_updated":"2026-07-09T02:11:18Z","snapshot_observed_at":"2026-08-04T11:12:32.355642Z","submitted_at":"2026-07-09T02:11:18Z","title":"Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-10T00:55:52.215700Z"},"links":{"citing_paper":"/paper/2607.08057"},"observation_digest":"sha256:83e269f061eeeae75ad96af2db4989184174a499c4867d081d39b9d216bcc27b","observation_id":"758c8532-d83a-4b3d-9265-a37e5dcbd14e","resolution":{"observed_at":"2026-07-10T00:56:41.205437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:56:41.205980Z","title":null,"venue":null,"work_id":"3a4517fd-1581-4299-ab5d-9f803b23099f","year":null},"citing_paper":{"arxiv_id":"2607.08057","last_updated":"2026-07-09T02:11:18Z","snapshot_observed_at":"2026-08-04T11:12:32.355642Z","submitted_at":"2026-07-09T02:11:18Z","title":"Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-10T00:55:52.215700Z"},"links":{"citing_paper":"/paper/2607.08057"},"observation_digest":"sha256:cc7953f99c91ff2cd9b5ce9e7cf0bce4a469fd3b4124d283bc36cc9f3f3bed5a","observation_id":"9588fd59-2e21-448c-9c23-766403368ad9","resolution":{"observed_at":"2026-07-10T00:56:41.207045Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:56:41.211542Z","title":null,"venue":null,"work_id":"e6bc0b3e-394c-44b1-be52-efa4c4d93194","year":null},"citing_paper":{"arxiv_id":"2607.08057","last_updated":"2026-07-09T02:11:18Z","snapshot_observed_at":"2026-08-04T11:12:32.355642Z","submitted_at":"2026-07-09T02:11:18Z","title":"Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-10T00:55:52.215700Z"},"links":{"citing_paper":"/paper/2607.08057"},"observation_digest":"sha256:4ec4d766beec8b3ee751221762c8e605ab4e43d49b03313faf3d56a5a92acca9","observation_id":"d9112735-8597-47ad-b223-5ed99926fb14","resolution":{"observed_at":"2026-07-10T00:56:41.212576Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:56:41.200233Z","title":"Reporting standards.In addition to the basic in- formation like model, hardware, and configuration, we recommend the following reporting standards for sKis benchmarks:","venue":null,"work_id":"44d36e5d-cd61-4321-b81e-e8e3ec2b5e17","year":2024},"citing_paper":{"arxiv_id":"2607.08057","last_updated":"2026-07-09T02:11:18Z","snapshot_observed_at":"2026-08-04T11:12:32.355642Z","submitted_at":"2026-07-09T02:11:18Z","title":"Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-10T00:55:52.215700Z"},"links":{"citing_paper":"/paper/2607.08057"},"observation_digest":"sha256:ffc0faf6a42ba7377ac6240937af60efebffa071facf1ef723c7d16d07bf4189","observation_id":"794abd52-105c-4163-aa50-f59968e0376f","resolution":{"observed_at":"2026-07-10T00:56:41.201535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:56:41.196619Z","title":null,"venue":null,"work_id":"0b53829a-d293-4aea-aa2d-4e4221efbebd","year":null},"citing_paper":{"arxiv_id":"2607.08057","last_updated":"2026-07-09T02:11:18Z","snapshot_observed_at":"2026-08-04T11:12:32.355642Z","submitted_at":"2026-07-09T02:11:18Z","title":"Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-10T00:55:52.215700Z"},"links":{"citing_paper":"/paper/2607.08057"},"observation_digest":"sha256:ef1d2909395ef677f63622fa9311282525362b39f65babf1d9dbdb0eba8d88f5","observation_id":"34921c23-a415-4ec5-bdfc-e223dcde3917","resolution":{"observed_at":"2026-07-10T00:56:41.197713Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:56:41.198302Z","title":"memory curves for structural methods to reveal the trade-offs","venue":null,"work_id":"ff756e7b-cdfc-4fbd-b337-830e9ac52000","year":null},"citing_paper":{"arxiv_id":"2607.08057","last_updated":"2026-07-09T02:11:18Z","snapshot_observed_at":"2026-08-04T11:12:32.355642Z","submitted_at":"2026-07-09T02:11:18Z","title":"Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-10T00:55:52.215700Z"},"links":{"citing_paper":"/paper/2607.08057"},"observation_digest":"sha256:acadbacfe0dc95162fe826928717ddce1f7d26440064b68a1f6b40c05869ce19","observation_id":"4db01e9f-5aa5-4761-95aa-ca750a5371d5","resolution":{"observed_at":"2026-07-10T00:56:41.199642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:56:41.194893Z","title":null,"venue":null,"work_id":"3e3c9bb0-2bc8-4561-a1d1-9ac1e721ac90","year":null},"citing_paper":{"arxiv_id":"2607.08057","last_updated":"2026-07-09T02:11:18Z","snapshot_observed_at":"2026-08-04T11:12:32.355642Z","submitted_at":"2026-07-09T02:11:18Z","title":"Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-10T00:55:52.215700Z"},"links":{"citing_paper":"/paper/2607.08057"},"observation_digest":"sha256:db00d15abc685f5d28b2f61bb9292f76fe47d44a21bcffaf0796a37149ca591c","observation_id":"1abb0e95-aa48-47ef-973d-575eacdfdf2d","resolution":{"observed_at":"2026-07-10T00:56:41.196020Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.08057","last_updated":"2026-07-09T02:11:18Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-04T11:12:32.355642Z","submitted_at":"2026-07-09T02:11:18Z","title":"Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":1,"metadata_mismatch":9,"parse_uncertain":0,"unresolved":4,"verified_exact":2,"verified_fuzzy":6},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2607.08057."}