{"as_of":"2026-08-15T02:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0e9fa7252baae9fb36c789ebe2968d2534ebb98c092e8118dc7dc0fb1296d829","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T20:18:18.542070Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.05896/citation-record","integrity":"/paper/2412.05896/integrity","json":"/paper/2412.05896/citation-record.json","paper":"/paper/2412.05896"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T20:18:17.512660Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:17.512660Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:cede7586023dd10c43b801f367d35b074d28a80e82dab250a6fcb70082ee6a50","observation_id":"9c055c66-937b-4714-b416-2a93fc7c64c3","resolution":{"observed_at":"2026-08-11T20:18:17.512660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:18:17.574028Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:17.574028Z"},"links":{"citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:3cfaae1e80ea0231fec88433e4995d375ba4e95f7c0f2d3f32b537aefd3c9f91","observation_id":"07b9240e-b607-4c10-96c7-951783dffdde","resolution":{"observed_at":"2026-08-11T20:18:17.574028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-08-13T04:25:38.282910Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-11T20:18:17.628259Z","title":"Code llama: Open foundation models for code,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:17.628259Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:14d87b46f456e925252b4d2969988666c2636e3d80902ee404ac8c16bbe371cc","observation_id":"9cb2e7ac-7654-44df-bd4e-50c5a5bd1c4f","resolution":{"observed_at":"2026-08-11T20:18:17.628259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:18:17.661932Z","title":"Multi-news: A large-scale multi-document summarization dataset and abstractive hierarchical model,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:17.661932Z"},"links":{"citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:146473ec2643ca057470deb6df6cb84409f5ed68149f8402020d33af986e7cfa","observation_id":"09a7a6b8-2d7e-4dd0-85b2-208b50436ba1","resolution":{"observed_at":"2026-08-11T20:18:17.661932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18098","last_updated":"2023-11-21T11:01:24Z","snapshot_observed_at":"2026-08-13T11:30:16.359584Z","submitted_at":"2023-05-29T14:07:52Z","title":"BigTranslate: Augmenting Large Language Models with Multilingual Translation Capability over 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18098","snapshot_observed_at":"2026-08-11T20:18:17.694269Z","title":"Bigtranslate: Augmenting large language models with multilingual translation capability over 100 languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:17.694269Z"},"links":{"cited_paper":"/paper/2305.18098","citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:710947e837929a5bba8d0dabe308b0585a4d7f506bc6223c0c3a24116959cfcc","observation_id":"5e0f265e-8a7e-4b8f-9fc3-b56ab7a8531e","resolution":{"observed_at":"2026-08-11T20:18:17.694269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:18:17.726994Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:17.726994Z"},"links":{"citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:931d5d01bec3ed1b914f934fb8edd5357fa1335dea66ba30c6fbd8bbab695fcd","observation_id":"6a4c3da6-16b0-4a75-8e3c-aefbc8fcd193","resolution":{"observed_at":"2026-08-11T20:18:17.726994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:18:17.745916Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:17.745916Z"},"links":{"citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:77ceba1a43dfd69ef02a763042470ef87fb095ea88c27762dbc8c835a524a007","observation_id":"09f9e62c-f1e5-42cd-a751-790c9f667659","resolution":{"observed_at":"2026-08-11T20:18:17.745916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T20:18:17.749958Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:17.749958Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:d5d66870449544d9c3e92d9e9b7a432745b97ee4ed6304489db2ad36ce198680","observation_id":"bd8d2ff1-9305-44d5-8d28-3e113cc26bf4","resolution":{"observed_at":"2026-08-11T20:18:17.749958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:18:19.657640Z","title":"DistServe: Disaggregating prefill and decoding for goodput-optimized large language model serving,","venue":null,"work_id":"f75e3fa8-342e-4f1a-a655-985eaf224f55","year":2024},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:17.754162Z"},"links":{"citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:0c80bb63e4fcec95f9191e72681799ac9bf881260860c38d1fdec93cbc5421f2","observation_id":"e865ae17-693f-497c-bc1c-2f350d3c17b2","resolution":{"observed_at":"2026-08-11T20:18:19.663061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:18:17.758144Z","title":"Taming {Throughput-Latency} tradeoff in {LLM} inference with {Sarathi-Serve},","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:17.758144Z"},"links":{"citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:12e6a99386940c451b8fd4a8e0b0a0f69e8b924a8cade5ffc4231d1da5284654","observation_id":"635d9776-ddcd-4f9a-abd7-b52a8ce58373","resolution":{"observed_at":"2026-08-11T20:18:17.758144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-13T04:48:37.453735Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-11T20:18:17.762149Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:17.762149Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:cb2c4315f29f35151374f64ac22f49ad44ce7ca793b056f8b26e01ff608aeb74","observation_id":"4bc970ca-837e-4ab2-907a-dc13a6579332","resolution":{"observed_at":"2026-08-11T20:18:17.762149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:18:19.594217Z","title":"Cam: Cache merging for memory-efficient LLMs inference,","venue":null,"work_id":"c0dc7c55-f3f0-4114-b667-e01ba7f67f92","year":2024},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:17.766660Z"},"links":{"citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:d9e4179efadda94f49a9de937bbd385238326f55ee6908563556f9491abd2207","observation_id":"f949eb0b-9063-46f8-8d69-5c8ca568bc7b","resolution":{"observed_at":"2026-08-11T20:18:19.617635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08454","last_updated":"2024-07-21T02:37:11Z","snapshot_observed_at":"2026-08-12T23:24:15.519470Z","submitted_at":"2024-07-11T12:50:42Z","title":"Model Tells You Where to Merge: Adaptive KV Cache Merging for LLMs on Long-Context Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08454","snapshot_observed_at":"2026-08-11T20:18:17.793321Z","title":"Model tells you where to merge: Adaptive kv cache merging for llms on long-context tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:17.793321Z"},"links":{"cited_paper":"/paper/2407.08454","citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:3361fb4bda376603399fa6012b2d93c0614aa0bf4d2592fbbe674f556ee0f516","observation_id":"4403e995-db45-424f-b38b-3cc8f5c321be","resolution":{"observed_at":"2026-08-11T20:18:17.793321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-13T07:43:17.158479Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-11T20:18:17.868031Z","title":"Gear: An efficient kv cache compression recipefor near- lossless generative inference of llm,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:17.868031Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:e87322e0fb7dfb5411f759f5e4ee7a729c4b23c5c5ad5e673dfe0c9282ea0f25","observation_id":"01665fc2-6ef2-4415-bf6a-6d14cac1887e","resolution":{"observed_at":"2026-08-11T20:18:17.868031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12820","last_updated":"2025-03-30T08:13:50Z","snapshot_observed_at":"2026-08-14T07:48:38.103893Z","submitted_at":"2024-07-01T13:05:42Z","title":"PQCache: Product Quantization-based KVCache for Long Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12820","snapshot_observed_at":"2026-08-11T20:18:17.944588Z","title":"Pqcache: Product quantization-based kvcache for long context llm inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:17.944588Z"},"links":{"cited_paper":"/paper/2407.12820","citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:ac7b54ce4f3a5cd778fdbc5be262885f99121072aded97dd61c5b318cc184279","observation_id":"78aba339-3138-4ca1-84c4-ff1e468612f8","resolution":{"observed_at":"2026-08-11T20:18:17.944588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:18:19.537607Z","title":"Efficient streaming language models with attention sinks,","venue":null,"work_id":"bcfacf10-8954-4567-a5cc-884becf0bea7","year":2024},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:18.020570Z"},"links":{"citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:fe47259b51e4349123afe1d85b5d4b8c5b6a25340dc34f4f1ebfe372c0e035d1","observation_id":"9ad1737c-78b2-4c46-a9ee-7431ac55c420","resolution":{"observed_at":"2026-08-11T20:18:19.568865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:18:18.062326Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:18.062326Z"},"links":{"citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:03a708c34fddf738a51ec9dcecf4feb80d2cb43a3ad84595a8a45c75a40c1ec9","observation_id":"42f33cf2-bfd5-4168-9fb0-4c80c50091a4","resolution":{"observed_at":"2026-08-11T20:18:18.062326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-14T12:21:04.886717Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-08-11T20:18:18.109882Z","title":"Snapkv: Llm knows what you are looking for before generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:18.109882Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:10aa33d8b9c4c87779a8a47eb36ff2c94ac80af4ce9c0ed59b1444f16e5d6e21","observation_id":"5da5dd4a-5a53-4efc-b9ac-9d29aff8cf88","resolution":{"observed_at":"2026-08-11T20:18:18.109882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:18:19.440922Z","title":"PyramidInfer: Pyramid KV cache compression for high-throughput LLM inference,","venue":null,"work_id":"c4534a4f-381c-4108-9af7-fb93891902f3","year":2024},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:18.160144Z"},"links":{"citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:5dd70c05e154dc23d02be8136d973ec0d6aaf2bce59f1e1bca169d9ab6410a23","observation_id":"33ccda45-dabe-436d-ace9-c95026b75da0","resolution":{"observed_at":"2026-08-11T20:18:19.490479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:18:19.369725Z","title":"Scissorhands: Exploiting the persistence of importance hypothesis for llm kv cache compression at test time,","venue":null,"work_id":"e0fc2db0-a8e2-4321-ba39-5032a2b4e775","year":2023},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:18.177088Z"},"links":{"citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:d18ef948c748292e723dac18e038889eb00b1d79985123bd882afc9512b589fb","observation_id":"fe9687a2-803f-4f7a-96c7-78bec9e8fd1d","resolution":{"observed_at":"2026-08-11T20:18:19.375500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:18:19.313005Z","title":"Model tells you what to discard: Adaptive KV cache compression for LLMs,","venue":null,"work_id":"08c7a01a-55ca-4709-b641-7e492ed1ed3f","year":2024},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:18.186155Z"},"links":{"citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:78a91eee4f027dbd99fcfd6bb69115e3a81ecd190c8950510145a344f31d75ce","observation_id":"63227244-9140-4c27-846e-1fd5a6032cb9","resolution":{"observed_at":"2026-08-11T20:18:19.344417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04939","last_updated":"2024-09-06T05:06:51Z","snapshot_observed_at":"2026-08-13T05:30:11.261543Z","submitted_at":"2023-11-08T01:45:37Z","title":"LooGLE: Can Long-Context Language Models Understand Long Contexts?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04939","snapshot_observed_at":"2026-08-11T20:18:18.203912Z","title":"Loogle: Can long- context language models understand long contexts?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:18.203912Z"},"links":{"cited_paper":"/paper/2311.04939","citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:4354c434fcf95936f2d1274d964c940eff430bc9ca42e2cbb00b82b25b58868e","observation_id":"9e3e2cf7-8c4b-4ae0-95cb-10a70f904c40","resolution":{"observed_at":"2026-08-11T20:18:18.203912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-08-13T04:39:30.300015Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02069","snapshot_observed_at":"2026-08-11T20:18:18.218270Z","title":"Pyramidkv: Dynamic kv cache compression based on pyramidal information funneling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:18.218270Z"},"links":{"cited_paper":"/paper/2406.02069","citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:a034de78f161572acbf00cb378605fcfea5619efc646f22e68f8c14f7a8192d9","observation_id":"e5a6bf00-40b7-4191-9f24-2baea217dc2f","resolution":{"observed_at":"2026-08-11T20:18:18.218270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:18:19.213834Z","title":"Tsplit: Fine-grained gpu memory management for efficient dnn training via tensor splitting,","venue":null,"work_id":"8074073c-ae4e-4456-8c00-f6fc8e4f2332","year":2022},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:18.240316Z"},"links":{"citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:f891da3d007965e7b39996e2b3cc8c430ca176089d53a127e9fd3e9724d81bdc","observation_id":"7d453edd-8979-4d3e-82b0-9f9cf16794cf","resolution":{"observed_at":"2026-08-11T20:18:19.270618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:18:19.162595Z","title":"Het-gmp: A graph-based system approach to scaling large embedding model training,","venue":null,"work_id":"5903ca6e-e877-433c-b776-f46035e80d8d","year":2022},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:18.250080Z"},"links":{"citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:09adf97180f8f5144b524336c790d47f587f692066d875895f6d8af55f908f38","observation_id":"c231ff2d-aca3-4261-9acb-1ec24f10313d","resolution":{"observed_at":"2026-08-11T20:18:19.176927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:18:19.108777Z","title":"Platod2gl: An efficient dynamic deep graph learning system for graph neural net- work training on billion-scale graphs,","venue":null,"work_id":"16e013b9-ee19-4fa7-83bd-af4c26992b6c","year":2024},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:18.254703Z"},"links":{"citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:9f42a4d40fc8f7bd6202f30996747babedeec2207f00cc37cb316218735d066a","observation_id":"d6c90f88-3dd7-4017-902f-92f4384eae7b","resolution":{"observed_at":"2026-08-11T20:18:19.130730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:18:19.016499Z","title":"Optimizing tensor programs on flexible storage,","venue":null,"work_id":"0359f619-4acd-49d7-b2ec-260b88374aa2","year":2023},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:18.259394Z"},"links":{"citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:487ef47ae63579bb3ec050d8bcdc5ed2f51174de17da304a24911f8bbbcdb5b9","observation_id":"726d85d1-ff7f-45fb-b65e-30e9558d788f","resolution":{"observed_at":"2026-08-11T20:18:19.050351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05254","last_updated":"2024-05-09T14:12:45Z","snapshot_observed_at":"2026-08-14T00:44:29.108997Z","submitted_at":"2024-05-08T17:57:39Z","title":"You Only Cache Once: Decoder-Decoder Architectures for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05254","snapshot_observed_at":"2026-08-11T20:18:18.263580Z","title":"You only cache once: Decoder-decoder architectures for language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:18.263580Z"},"links":{"cited_paper":"/paper/2405.05254","citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:697b86a1b8cb26a0c7a30fb3b6b8fce569b76d4edb9cf76e74bf0dd2146023a4","observation_id":"46a7c86d-7356-41e5-a6ff-ba62edc91568","resolution":{"observed_at":"2026-08-11T20:18:18.263580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-13T04:29:50.330115Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-11T20:18:18.267468Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:18.267468Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:da81f7c0321e5def6817300b150f2c922790ccfa7f25bf6add26e531bf373ccb","observation_id":"f1f659a8-005c-48d9-b736-fb859617fdb4","resolution":{"observed_at":"2026-08-11T20:18:18.267468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-08-12T17:03:50.984887Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-11T20:18:18.271340Z","title":"Kivi: A tuning-free asymmetric 2bit quantization for kv cache,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:18.271340Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:2486255c6f65341fd1ba02f5dc8e3f243d322a56187ccf182cc79bf2db3e6eed","observation_id":"28cfb6ec-bace-40b4-bb9a-039f587b4091","resolution":{"observed_at":"2026-08-11T20:18:18.271340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:18:18.292763Z","title":"Flexgen: High-throughput generative inference of large language models with a single gpu,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:18.292763Z"},"links":{"citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:b4a92c788b1b2739364397914c1f736ec07f460d816d40d9301bada950fbdad8","observation_id":"8f9eca48-fff4-4f70-95ef-c7730d1660cf","resolution":{"observed_at":"2026-08-11T20:18:18.292763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:18:18.959292Z","title":"Efficient sparse attention needs adaptive token release,","venue":null,"work_id":"7955570d-4700-49dc-8cb5-3def62ae7c85","year":2024},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:18.349173Z"},"links":{"citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:c0826a6907bba8b7d6b802ff813ddd0303fa73e581466bd1305927ebc990aeaa","observation_id":"ffdf17bf-0f5e-4a83-8e81-3bfc63d2eb51","resolution":{"observed_at":"2026-08-11T20:18:18.987661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17312","last_updated":"2024-03-26T01:46:34Z","snapshot_observed_at":"2026-08-14T15:59:31.638810Z","submitted_at":"2024-03-26T01:46:34Z","title":"ALISA: Accelerating Large Language Model Inference via Sparsity-Aware KV Caching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17312","snapshot_observed_at":"2026-08-11T20:18:18.404941Z","title":"Alisa: Accelerating large lan- guage model inference via sparsity-aware kv caching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:18.404941Z"},"links":{"cited_paper":"/paper/2403.17312","citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:2c8f5f4e902fc27d4aa85aa4fa5fe5e9d4ab63901030954ba550cc18ef78c245","observation_id":"24931133-797e-4db4-92b1-5103e501c2a3","resolution":{"observed_at":"2026-08-11T20:18:18.404941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12335","last_updated":"2024-10-02T00:19:13Z","snapshot_observed_at":"2026-08-12T23:40:22.420583Z","submitted_at":"2024-06-18T07:01:11Z","title":"Attention Score is not All You Need for Token Importance Indicator in KV Cache Reduction: Value Also Matters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12335","snapshot_observed_at":"2026-08-11T20:18:18.448561Z","title":"Attention score is not all you need for token importance indicator in kv cache reduction: Value also matters,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:18.448561Z"},"links":{"cited_paper":"/paper/2406.12335","citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:afc6e39efe41f8b4e8f330adc13bed9c828a1ccf890a2c5473cba22121d9dd36","observation_id":"88d4850b-4452-45df-91fa-515eae97b1f6","resolution":{"observed_at":"2026-08-11T20:18:18.448561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-08-12T20:32:53.188699Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-11T20:18:18.491299Z","title":"Ada-kv: Optimizing kv cache eviction by adaptive budget allocation for efficient llm inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:18.491299Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:b679485b0c4b9a04a653ad5492a862474887a211d133ea733cf6cd91429136be","observation_id":"a767261c-f5ef-4981-b34d-80cdd15589ab","resolution":{"observed_at":"2026-08-11T20:18:18.491299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:18:18.514907Z","title":"Lost in the middle: How language models use long contexts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:18.514907Z"},"links":{"citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:0b8aa86a316b56e4698a09f06f3abd349286e87fb07688b8101b62fc5de841bb","observation_id":"2098b003-d575-429f-a8aa-8c95cf730341","resolution":{"observed_at":"2026-08-11T20:18:18.514907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:18:18.827985Z","title":"LongBench: A bilingual, multitask benchmark for long context understanding,","venue":null,"work_id":"894d6fb9-fda3-42bc-abdf-5b5a0a5ce595","year":2024},"citing_paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T20:18:18.542070Z"},"links":{"citing_paper":"/paper/2412.05896"},"observation_digest":"sha256:a726aadd4490500c11d9c203d5847d1d5b1c71b1514c73c1f47ae9e6123a9230","observation_id":"3bcb1c91-78dc-451c-a2f1-327f1cdbc760","resolution":{"observed_at":"2026-08-11T20:18:18.894224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.05896","last_updated":"2024-12-08T11:32:08Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T18:25:06.915616Z","submitted_at":"2024-12-08T11:32:08Z","title":"XKV: Personalized KV Cache Memory Reduction for Long-Context LLM Inference"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2412.05896."}