{"as_of":"2026-08-09T00:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:237162f71665cd2b1ddd015c8944e76ce69e447af4826d780c99308d5ee0edc6","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:57:15.844310Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.19906/citation-record","integrity":"/paper/2507.19906/integrity","json":"/paper/2507.19906/citation-record.json","paper":"/paper/2507.19906"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T13:57:15.646922Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.646922Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:afce986d1e9211ecd628da413ee8bd10906283d23814baf1c237a0bd21577f93","observation_id":"7202c61d-e046-47d4-a4a6-dd9616e5842a","resolution":{"observed_at":"2026-08-06T13:57:15.646922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:57:17.382018Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":"65f390cd-d307-4a98-9c18-3dc11d643c9c","year":2023},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.651831Z"},"links":{"citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:730b4893a74cf4d6716da4093690e564e0aeae29aa7b70ca5296a27907135432","observation_id":"2676b63f-3f03-4c4b-8fed-6fa6fcb6f796","resolution":{"observed_at":"2026-08-06T13:57:17.445507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:57:17.169501Z","title":"Longbench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":"c17587f5-09e5-4506-a9f3-9b324a181255","year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.656502Z"},"links":{"citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:fecaf8b62fee0164250accbe72a3a711d9c1edb64ff617058eca692fb4fa8854","observation_id":"f6b2c56f-f772-4ace-89cc-1e45982ccf17","resolution":{"observed_at":"2026-08-06T13:57:17.244358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12981","last_updated":"2024-05-21T17:59:29Z","snapshot_observed_at":"2026-08-02T00:33:35.724101Z","submitted_at":"2024-05-21T17:59:29Z","title":"Reducing Transformer Key-Value Cache Size with Cross-Layer Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12981","snapshot_observed_at":"2026-08-06T13:57:15.661526Z","title":"Reducing transformer key-value cache size with cross-layer attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.661526Z"},"links":{"cited_paper":"/paper/2405.12981","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:57fd160929978d811e7402cbe60ebd39fedc498904fa9e3027c79393b9a01908","observation_id":"345bb7a4-d061-4786-9478-af7175703411","resolution":{"observed_at":"2026-08-06T13:57:15.661526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02069","snapshot_observed_at":"2026-08-06T13:57:15.666030Z","title":"Pyramidkv: Dynamic kv cache compression based on pyramidal information funneling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.666030Z"},"links":{"cited_paper":"/paper/2406.02069","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:09edeb0d98014c10fa2c1f2f9fb9569a2c25998f9ab6976b0959d0b078c353ae","observation_id":"71be8909-196f-489c-9806-77b6bc72c888","resolution":{"observed_at":"2026-08-06T13:57:15.666030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-07-06T18:54:41.705593Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-08-06T13:57:15.670799Z","title":"Palu: Compressing kv-cache with low-rank projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.670799Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:26fa40b96ad9adeee046112a218c5c1444bcba54bfd9ee2764342fbbf4e1c810","observation_id":"72c9b27c-2c3b-4a5d-87d3-bc691b0d4124","resolution":{"observed_at":"2026-08-06T13:57:15.670799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12094","last_updated":"2025-06-02T11:46:43Z","snapshot_observed_at":"2026-08-02T16:34:35.677937Z","submitted_at":"2024-12-16T18:58:57Z","title":"SepLLM: Accelerate Large Language Models by Compressing One Segment into One Separator","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12094","snapshot_observed_at":"2026-08-06T13:57:15.675892Z","title":"Sepllm: Accelerate large language models by compressing one segment into one separator","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.675892Z"},"links":{"cited_paper":"/paper/2412.12094","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:04508635d131ddf88ed7cb05e53886ace1b7137cfcfd2a495624891c342b5979","observation_id":"57454bc2-d061-44aa-ae76-7f3e17e17fe3","resolution":{"observed_at":"2026-08-06T13:57:15.675892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11430","last_updated":"2024-11-03T09:42:35Z","snapshot_observed_at":"2026-08-07T19:20:38.764086Z","submitted_at":"2024-06-17T11:35:16Z","title":"A Simple and Effective $L_2$ Norm-Based Strategy for KV Cache Compression","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11430","snapshot_observed_at":"2026-08-06T13:57:15.680442Z","title":"A simple and effective l_2 norm-based strategy for kv cache compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.680442Z"},"links":{"cited_paper":"/paper/2406.11430","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:1d3f591aee7a56f48b3e13655648717d4333c25ea07dc8d5feda74d3ebed59ab","observation_id":"7806b74f-bbdc-40fc-8703-d73765ce6bdd","resolution":{"observed_at":"2026-08-06T13:57:15.680442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04643","last_updated":"2024-04-12T13:00:25Z","snapshot_observed_at":"2026-08-04T07:21:43.170218Z","submitted_at":"2024-03-07T16:42:37Z","title":"QAQ: Quality Adaptive Quantization for LLM KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04643","snapshot_observed_at":"2026-08-06T13:57:15.685067Z","title":"Qaq: Quality adaptive quantization for llm kv cache","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.685067Z"},"links":{"cited_paper":"/paper/2403.04643","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:9677015f5fa30d7464e09d956354c01a35d3eb0e377aefeefe2df7e2263b8488","observation_id":"11d233ba-8593-4977-af05-59f648ad1ee3","resolution":{"observed_at":"2026-08-06T13:57:15.685067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T13:57:15.689722Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.689722Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:5550a5484aa0c8bb40b558bb8a82d728fbbb68d120a38668ffedbe143e6c57a7","observation_id":"df3fa1f2-e40d-4e1b-a806-412d58cc275e","resolution":{"observed_at":"2026-08-06T13:57:15.689722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-08-08T13:32:33.116151Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-06T13:57:15.694151Z","title":"Ada-kv: Optimizing kv cache eviction by adaptive budget allocation for efficient llm inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.694151Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:faddf155b26de3abaf3efac861a51f7a8aabf4b8b82746472bccd2945a44225b","observation_id":"96d90404-72c7-4a92-a26e-07c29d737a99","resolution":{"observed_at":"2026-08-06T13:57:15.694151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:57:15.698374Z","title":"Not all heads matter: A head-level kv cache compression method with integrated retrieval and reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.698374Z"},"links":{"citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:adce1df8b4bec657712c460ab81a0a9fa03c58606dc311b01afae740bc9a9a3b","observation_id":"cf847818-5763-493b-a472-5af7c4a4b078","resolution":{"observed_at":"2026-08-06T13:57:15.698374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-06T13:57:15.702165Z","title":"Model tells you what to discard: Adaptive kv cache compression for llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.702165Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:6b150db7bce67aea7661a481c58c74438061b3f37a7625cf61b7382be85ab2b9","observation_id":"f42b0cec-832c-44e0-ba4a-1db6ace0f765","resolution":{"observed_at":"2026-08-06T13:57:15.702165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14256","last_updated":"2024-05-23T07:37:16Z","snapshot_observed_at":"2026-07-06T18:18:21.334080Z","submitted_at":"2024-05-23T07:37:16Z","title":"ZipCache: Accurate and Efficient KV Cache Quantization with Salient Token Identification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14256","snapshot_observed_at":"2026-08-06T13:57:15.706240Z","title":"Zipcache: Accurate and efficient kv cache quantization with salient token identification","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.706240Z"},"links":{"cited_paper":"/paper/2405.14256","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:7a2c854715abd6f5f0ebd0c2b2b810b23f9b5764669fd331fa57a13fe40ba2f9","observation_id":"83187b8a-959e-40c0-a79a-35d4d6a8652f","resolution":{"observed_at":"2026-08-06T13:57:15.706240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-05T09:48:25.127042Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-06T13:57:15.710581Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.710581Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:624b987a01301ae1ff0770bceb3510a3781396b4919b1caafb380acc611428a1","observation_id":"ffc9ce03-1f66-45f5-a56c-51d090804ebd","resolution":{"observed_at":"2026-08-06T13:57:15.710581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-06T13:57:15.714902Z","title":"Ruler: What’s the real context size of your long-context language models? arXiv preprint arXiv:2404.06654, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.714902Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:9290c85cf74a88eec17a932d409f7520e8356d19fcfede2717ccd6de6fc43d84","observation_id":"01f02dc7-00ff-4b0d-9a53-8034531de720","resolution":{"observed_at":"2026-08-06T13:57:15.714902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-06T13:57:15.719168Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.719168Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:9815353d50b26368dbfc8daa3a635af7e7eabe1668ca9163a0cc26256c978b6d","observation_id":"9f8d88bd-33bb-4e47-b3c8-d8853acda7ea","resolution":{"observed_at":"2026-08-06T13:57:15.719168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05099","last_updated":"2024-05-13T08:49:44Z","snapshot_observed_at":"2026-08-04T23:21:31.317269Z","submitted_at":"2024-02-07T18:53:01Z","title":"Hydragen: High-Throughput LLM Inference with Shared Prefixes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05099","snapshot_observed_at":"2026-08-06T13:57:15.723671Z","title":"Hydragen: High-throughput llm inference with shared prefixes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.723671Z"},"links":{"cited_paper":"/paper/2402.05099","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:567848eb6285f650b30f21e58d4f736599e568970b222ddf2cbe109c9c29dcba","observation_id":"f92c6351-36f5-467d-8658-d8e1baa35229","resolution":{"observed_at":"2026-08-06T13:57:15.723671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-06T13:57:15.727858Z","title":"GEAR: an efficient KV cache compression recipe for near-lossless generative inference of LLM","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.727858Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:da10a67e98be16b9eb37f2fdf1d52b31098f01ac4793c1b51fcea34cca7a490c","observation_id":"5310eae0-5bb4-4afe-ac14-c9176c428768","resolution":{"observed_at":"2026-08-06T13:57:15.727858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-07T22:57:56.263839Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-08-06T13:57:15.732475Z","title":"Snapkv: Llm knows what you are looking for before generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.732475Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:cc6eed7d319e2223498ae19df1721928b5d03c047a6e78d4aee3c48fece53e3b","observation_id":"30bf4c5f-1431-4f2c-b1cd-cc5c284d9e16","resolution":{"observed_at":"2026-08-06T13:57:15.732475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-06T13:57:15.736969Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.736969Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:b7eb9984fbb74e86af12d9892da8f958df4d8c0e16846770c2dee8015a6c350a","observation_id":"c3d33bfc-f572-4d21-b961-be136cd0003b","resolution":{"observed_at":"2026-08-06T13:57:15.736969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T13:57:15.741444Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.741444Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:b51ef2e007a1818175736a8fdd341745df05f27925c00a31ef3362f43715a43b","observation_id":"5fb05e49-b401-4fdc-b3a4-2db964c44424","resolution":{"observed_at":"2026-08-06T13:57:15.741444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:57:15.745777Z","title":"Lost in the middle: How language models use long contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.745777Z"},"links":{"citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:0fb64cddaa56aa0b392d308150e01894cb0089a03c93fd698fb396188a0e4205","observation_id":"bcdcf966-4e0f-41c1-b5b8-effde72e5654","resolution":{"observed_at":"2026-08-06T13:57:15.745777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:57:17.012728Z","title":"Scissorhands: Exploiting the persistence of importance hypothesis for llm kv cache compression at test time","venue":null,"work_id":"a1e62472-d73a-457c-938b-d1edb69d1ef7","year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.749791Z"},"links":{"citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:6f8f9fa46c5c45a8de701e51692a49b1d97eebd65d6276945747ee3f035afd35","observation_id":"b3a2c4d2-f9f9-4352-8645-e4e7df5738a0","resolution":{"observed_at":"2026-08-06T13:57:17.081334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:57:16.873074Z","title":"KIVI: A tuning-free asymmetric 2bit quantization for KV cache","venue":null,"work_id":"d5ce7193-f559-4ada-befd-6a2c86d79af7","year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.754094Z"},"links":{"citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:7a9b030662c365412684304fe5e844efa276e98a6006855c675772ff33342a0b","observation_id":"365ca0fe-707b-42f2-9793-ab56062917e7","resolution":{"observed_at":"2026-08-06T13:57:16.932174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:57:16.752946Z","title":"CAKE: Cascading and adaptive KV cache eviction with layer preferences","venue":null,"work_id":"4755e76c-ece7-43a9-b19f-4ab96d69db7e","year":2025},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.758394Z"},"links":{"citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:385124f89fa6f155fe58caf486c029b70cfe352d476714e42bc0d4d086416e21","observation_id":"597ffd37-bc5a-4e92-844c-e9e60014ebe3","resolution":{"observed_at":"2026-08-06T13:57:16.797279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-06T13:57:15.762573Z","title":"Fast transformer decoding: One write-head is all you need","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.762573Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:bb6aa3809af82932588e071063e547de3fc7282212d54b0d4bc30b8528c00541","observation_id":"ba1b3470-96d1-46fd-a945-120164147543","resolution":{"observed_at":"2026-08-06T13:57:15.762573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:57:15.766960Z","title":"Flexgen: High-throughput generative inference of large language models with a single gpu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.766960Z"},"links":{"citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:af61ae3c0ab2921c51f5055b582f5777189e9e83d03004fcf4ab2fc0f6fe7a6e","observation_id":"00e1e89f-cb37-4df4-a152-1064e9263afb","resolution":{"observed_at":"2026-08-06T13:57:15.766960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05254","last_updated":"2024-05-09T14:12:45Z","snapshot_observed_at":"2026-08-04T14:59:09.585356Z","submitted_at":"2024-05-08T17:57:39Z","title":"You Only Cache Once: Decoder-Decoder Architectures for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05254","snapshot_observed_at":"2026-08-06T13:57:15.771372Z","title":"You only cache once: Decoder-decoder architectures for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.771372Z"},"links":{"cited_paper":"/paper/2405.05254","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:dbdbcfaa2bcaa786b7d786b6bd053cba508971ef964d2720326d62d33894bda1","observation_id":"13304490-bca6-4a82-90c0-81c7b3e72b6d","resolution":{"observed_at":"2026-08-06T13:57:15.771372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:57:16.683375Z","title":"Quest: Query-aware sparsity for efficient long-context llm inference","venue":null,"work_id":"e74074f9-2159-4af5-a4b1-f73b3450e884","year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.776238Z"},"links":{"citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:7a0802f088213972fabd63383d8e2fe573b6a9fd1e9ec027205aed58f919f6ad","observation_id":"dfe709df-f236-40e4-8208-1325c1a77790","resolution":{"observed_at":"2026-08-06T13:57:16.699882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T13:57:15.780545Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.780545Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:4e4822c24968f32d478bb416406bdd1d8c24e351b6d75ae047c57d0dfb147a39","observation_id":"d9e996b0-3d34-438f-8007-6825fdca0878","resolution":{"observed_at":"2026-08-06T13:57:15.780545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11504","last_updated":"2024-09-11T02:22:58Z","snapshot_observed_at":"2026-07-06T17:18:28.323349Z","submitted_at":"2024-01-21T14:28:41Z","title":"With Greater Text Comes Greater Necessity: Inference-Time Training Helps Long Text Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11504","snapshot_observed_at":"2026-08-06T13:57:15.784636Z","title":"With greater text comes greater necessity: Inference-time training helps long text generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.784636Z"},"links":{"cited_paper":"/paper/2401.11504","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:8e46cb431e8f1f4b04336c3a0eac6e425f4e81ae9838e3e8d4cb5809c56893ea","observation_id":"b0d8488a-6186-46fc-9703-dec6a9253b90","resolution":{"observed_at":"2026-08-06T13:57:15.784636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08454","last_updated":"2024-07-21T02:37:11Z","snapshot_observed_at":"2026-07-06T18:44:49.512236Z","submitted_at":"2024-07-11T12:50:42Z","title":"Model Tells You Where to Merge: Adaptive KV Cache Merging for LLMs on Long-Context Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08454","snapshot_observed_at":"2026-08-06T13:57:15.789011Z","title":"Model tells you where to merge: Adaptive kv cache merging for llms on long-context tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.789011Z"},"links":{"cited_paper":"/paper/2407.08454","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:f4643c48dc2e591c6e7f2c6a2db705c20e77f4a88f6c0e8050f37fde8f4e63d6","observation_id":"f55d36b7-9840-4ccd-a473-1fbad5488290","resolution":{"observed_at":"2026-08-06T13:57:15.789011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10637","last_updated":"2024-06-04T00:08:10Z","snapshot_observed_at":"2026-07-06T18:15:42.050651Z","submitted_at":"2024-05-17T08:59:46Z","title":"Layer-Condensed KV Cache for Efficient Inference of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10637","snapshot_observed_at":"2026-08-06T13:57:15.793887Z","title":"Layer-condensed kv cache for efficient inference of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.793887Z"},"links":{"cited_paper":"/paper/2405.10637","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:f27e54fecd3e7049337e8d2561726baefd02922ece278c52fe297fa3e6aec927","observation_id":"7b6f0485-9572-4977-8526-ce7db81918e2","resolution":{"observed_at":"2026-08-06T13:57:15.793887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:57:16.643850Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":"55db7f4d-53d2-4bd0-bcbd-3f0364299fa6","year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.798557Z"},"links":{"citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:6db472ba8ed0d1322d1915ca04e84345adc430fd10ce0d2246c39114daaad44d","observation_id":"475fbee9-8551-418f-8854-3e867a0151ed","resolution":{"observed_at":"2026-08-06T13:57:16.660199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05787","last_updated":"2025-03-03T18:23:47Z","snapshot_observed_at":"2026-08-05T13:19:11.535881Z","submitted_at":"2024-11-08T18:57:07Z","title":"RefreshKV: Updating Small KV Cache During Long-form Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05787","snapshot_observed_at":"2026-08-06T13:57:15.803004Z","title":"Recycled attention: Efficient inference for long-context language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.803004Z"},"links":{"cited_paper":"/paper/2411.05787","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:de6da023a57f10a427eb7a5d0174bb8109a98f5158a145ed7a94edcd62ec60c4","observation_id":"06bfe2da-1a58-40bf-9640-c9831ed69550","resolution":{"observed_at":"2026-08-06T13:57:15.803004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-07-06T18:17:08.160308Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-08-06T13:57:15.807556Z","title":"Pyramidinfer: Pyramid kv cache compression for high-throughput llm inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.807556Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:2e8e83729597630490e9bc5a1cab4c32d91cffee81cffa42c770a07b349862fc","observation_id":"1280fc6c-c0e7-48ed-90fa-0b80692b91d2","resolution":{"observed_at":"2026-08-06T13:57:15.807556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18096","last_updated":"2024-02-28T06:34:54Z","snapshot_observed_at":"2026-07-06T17:36:40.933805Z","submitted_at":"2024-02-28T06:34:54Z","title":"No Token Left Behind: Reliable KV Cache Compression via Importance-Aware Mixed Precision Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18096","snapshot_observed_at":"2026-08-06T13:57:15.812442Z","title":"No token left behind: Reliable kv cache compression via importance-aware mixed precision quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.812442Z"},"links":{"cited_paper":"/paper/2402.18096","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:0dcf2d7b6066af7b67051388e58cb7370d401e6c5055bd5abde03b5fd8cf5e04","observation_id":"94bf7996-0ad1-4918-bb21-0b53445cdb60","resolution":{"observed_at":"2026-08-06T13:57:15.812442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07056","last_updated":"2024-06-11T08:37:33Z","snapshot_observed_at":"2026-07-06T18:28:42.314877Z","submitted_at":"2024-06-11T08:37:33Z","title":"Effectively Compress KV Heads for LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07056","snapshot_observed_at":"2026-08-06T13:57:15.817194Z","title":"Effectively compress kv heads for llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.817194Z"},"links":{"cited_paper":"/paper/2406.07056","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:62f87e019b281deca8237867590fb5762d52b243fd02f0063d503feda7e09896","observation_id":"3d124d0f-0688-4e16-8aea-961b5b574e41","resolution":{"observed_at":"2026-08-06T13:57:15.817194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03917","last_updated":"2024-05-07T00:25:20Z","snapshot_observed_at":"2026-07-06T18:10:45.376531Z","submitted_at":"2024-05-07T00:25:20Z","title":"KV Cache is 1 Bit Per Channel: Efficient Large Language Model Inference with Coupled Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03917","snapshot_observed_at":"2026-08-06T13:57:15.821815Z","title":"Kv cache is 1 bit per channel: Efficient large language model inference with coupled quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.821815Z"},"links":{"cited_paper":"/paper/2405.03917","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:75b175bd3d126bb89c34c15196c494ebfcbdd46b383b6eaf6390efe38f990ef0","observation_id":"0aef9934-a407-4c49-8162-428eb3976373","resolution":{"observed_at":"2026-08-06T13:57:15.821815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03131","last_updated":"2025-08-30T09:35:22Z","snapshot_observed_at":"2026-08-06T18:56:07.858056Z","submitted_at":"2024-12-04T08:51:23Z","title":"DiffKV: Differentiated Memory Management for Large Language Models with Parallel KV Compaction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03131","snapshot_observed_at":"2026-08-06T13:57:15.826481Z","title":"Unifying kv cache compression for large language models with leankv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.826481Z"},"links":{"cited_paper":"/paper/2412.03131","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:335336beb547eff35de016f157c1786227adff9892f98451a2a94a03b6eda686","observation_id":"0600c39f-b547-4039-b16f-492813fa9ea3","resolution":{"observed_at":"2026-08-06T13:57:15.826481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:57:16.605986Z","title":"Cam: Cache merging for memory-efficient llms inference","venue":null,"work_id":"40dab564-37f1-4fd4-b9c9-54960329fab2","year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.831200Z"},"links":{"citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:f139bf812066f5848a72c87dd4f434da841bcd60de34e3435b63afe777786576","observation_id":"a025ba81-5030-40a3-aec2-5800b2d8dab2","resolution":{"observed_at":"2026-08-06T13:57:16.621659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:57:16.569789Z","title":"Barrett, Zhangyang Wang, and Beidi Chen","venue":null,"work_id":"b293e1e3-355d-4ca7-839d-e15470bd315e","year":2023},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.835368Z"},"links":{"citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:240cab397c7243aac9c281ca7c44ed6146fd4e20d34a495cacbcb3159b702878","observation_id":"f312100d-bf84-4f50-a921-f44980329ab3","resolution":{"observed_at":"2026-08-06T13:57:16.584256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14838","last_updated":"2025-05-27T03:08:57Z","snapshot_observed_at":"2026-08-02T23:02:03.395024Z","submitted_at":"2024-12-19T13:28:42Z","title":"DynamicKV: Task-Aware Adaptive KV Cache Compression for Long Context LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14838","snapshot_observed_at":"2026-08-06T13:57:15.839816Z","title":"Dynamickv: Task-aware adaptive kv cache compression for long context llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.839816Z"},"links":{"cited_paper":"/paper/2412.14838","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:f692c63928529bbb49ba6057a85a0627f8fb233e74f2f03b252091d0494be73b","observation_id":"20efee29-b8eb-44cc-a975-33186125f2c7","resolution":{"observed_at":"2026-08-06T13:57:15.839816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14808","last_updated":"2024-05-30T05:09:25Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:58:28Z","title":"RelayAttention for Efficient Large Language Model Serving with Long System Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14808","snapshot_observed_at":"2026-08-06T13:57:15.844310Z","title":"Relayattention for efficient large language model serving with long system prompts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.844310Z"},"links":{"cited_paper":"/paper/2402.14808","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:ce95543fbacf019e541d222c2d2e1d9d38f36f1576d86125b63eea71fc0e6127","observation_id":"8161cfc0-3de8-4c17-bc42-c96431256f5e","resolution":{"observed_at":"2026-08-06T13:57:15.844310Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2507.19906."}