{"as_of":"2026-08-07T01:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd9fcdfc10568665bd3dc35cae9a526cad8456891caad557da3aff6c2179fd6b","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T11:16:31.904921Z","state":"measured"},{"denominator":128,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":128,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":59,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:11:49.196155Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2502.01068","last_updated":"2026-04-20T06:24:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T05:25:09Z","title":"FastKV: Decoupling of Context Reduction and KV Cache Compression for Prefill-Decoding Acceleration","version":7},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-23T03:59:58.634512Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2502.01068"},"observation_digest":"sha256:90f6c406b838eb950333388e0ba6df3c585edc12cf1459963026fbbafa217570","observation_id":"0f17e24f-6c54-4e27-8f67-b00442291c14","resolution":{"observed_at":"2026-05-23T04:02:30.377552Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2502.01941","last_updated":"2026-05-12T08:04:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-04T02:23:06Z","title":"Semantic Integrity Matters: Benchmarking and Preserving High-Density Reasoning in KV Cache Compression","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-23T04:15:36.906263Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2502.01941"},"observation_digest":"sha256:3ab8aa8b45a9d677f903577dbb3acebeb5c23197fee46fd47acf0c7b5b9c90c3","observation_id":"f827319a-be95-42c8-9a27-420ba7675998","resolution":{"observed_at":"2026-05-23T04:17:31.067489Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2504.15965","last_updated":"2025-04-23T13:47:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T15:05:04Z","title":"From Human Memory to AI Memory: A Survey on Memory Mechanisms in the Era of LLMs","version":2},"reference_index":133,"source":"pdf_text","source_observed_at":"2026-05-17T11:05:09.588491Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2504.15965"},"observation_digest":"sha256:9ccd717d233c1ac80d9577409e7ba4cbd85c07f84f8a8547a141d4b6695f039d","observation_id":"6acdf6fb-83ba-4780-b293-712fea310160","resolution":{"observed_at":"2026-05-17T11:16:32.250514Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-06T13:57:15.694151Z","title":"Ada-kv: Optimizing kv cache eviction by adaptive budget allocation for efficient llm inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-06T13:57:11.431220Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.694151Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:c69be830adc8c55c75f541a97eba9e9f6f16bc600e4e84117a68b724dea49674","observation_id":"96d90404-72c7-4a92-a26e-07c29d737a99","resolution":{"observed_at":"2026-08-06T13:57:15.694151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T11:10:56.741169Z","title":"Ada-kv: Optimizing kv cache evic- tion by adaptive budget allocation for efficient llm inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03136","last_updated":"2025-09-03T08:38:40Z","snapshot_observed_at":"2026-08-05T11:10:55.803387Z","submitted_at":"2025-09-03T08:38:40Z","title":"Adaptive KV-Cache Compression without Manually Setting Budget","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T11:10:56.741169Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2509.03136"},"observation_digest":"sha256:72db7309de92ea12b1b57f34e3e4d32bb4821a4bae91df57f59722e4babee4a8","observation_id":"f6079f28-5534-4db1-87df-d7bc15b06115","resolution":{"observed_at":"2026-08-05T11:10:56.741169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T10:16:13.056228Z","title":"arXiv preprint arXiv:2407.11550","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04377","last_updated":"2025-09-04T16:40:01Z","snapshot_observed_at":"2026-08-06T07:33:15.787399Z","submitted_at":"2025-09-04T16:40:01Z","title":"PagedEviction: Structured Block-wise KV Cache Pruning for Efficient Large Language Model Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T10:16:13.056228Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2509.04377"},"observation_digest":"sha256:a46cd6bc5b01ce759f072bff3d57d35e8df30b88d8044565425708e94c763b1c","observation_id":"aa3065d9-cbd7-4529-8aa1-7c2233fcc46f","resolution":{"observed_at":"2026-08-05T10:16:13.056228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2509.17396","last_updated":"2026-05-19T20:55:44Z","snapshot_observed_at":"2026-07-06T22:30:26.679189Z","submitted_at":"2025-09-22T06:56:35Z","title":"EpiCache: Episodic KV Cache Management for Long-Term Conversation on Resource-Constrained Environments","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-21T21:54:05.442769Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2509.17396"},"observation_digest":"sha256:5186b8712d1fe9d59d2a49ccefa800935363a1c3d790fc929094a4557e0c2575","observation_id":"bd52760f-6744-4b3d-8d2c-f8b730e6a790","resolution":{"observed_at":"2026-05-21T21:54:22.753517Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-03T05:09:28.823705Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.03216","last_updated":"2026-05-29T02:42:46Z","snapshot_observed_at":"2026-08-03T05:09:26.451185Z","submitted_at":"2026-02-03T07:31:14Z","title":"Token Sparse Attention: Efficient Long-Context Inference with Interleaved Token Selection","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-03T05:09:28.823705Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2602.03216"},"observation_digest":"sha256:d8b275ffcc830372ff6ae5cb72bbe28a88439a3c7715860b2e06324cbe75f419","observation_id":"f4409d38-b709-431f-8cd0-4cf258b23b19","resolution":{"observed_at":"2026-08-03T05:09:28.823705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-03T03:37:50.106345Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07721","last_updated":"2026-05-28T23:34:23Z","snapshot_observed_at":"2026-08-03T03:37:48.402653Z","submitted_at":"2026-02-07T22:26:45Z","title":"ParisKV: Fast and Drift-Robust KV-Cache Retrieval for Long-Context LLMs","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T03:37:50.106345Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2602.07721"},"observation_digest":"sha256:fba84d3eb892d3fbd0fc8ea6baa83983cb9ab9127a031d4e1a953ee47b1f4bd6","observation_id":"e7b153f9-48c0-4353-b88e-c577f109e60f","resolution":{"observed_at":"2026-08-03T03:37:50.106345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-03T03:17:41.901032Z","title":"doi: 10.18653/v1/P19-1102","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.08585","last_updated":"2026-06-01T09:16:10Z","snapshot_observed_at":"2026-08-03T03:17:37.567545Z","submitted_at":"2026-02-09T12:23:38Z","title":"Predicting Future Utility: Global Combinatorial Optimization for Task-Agnostic KV Cache Eviction","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-03T03:17:41.901032Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2602.08585"},"observation_digest":"sha256:c80d1456b0ff8528cd2139b524a0ec5df2f84370c0cb932b10b8364d006f949a","observation_id":"3f0141be-a84a-42f3-9332-6ac9eafa64cc","resolution":{"observed_at":"2026-08-03T03:17:41.901032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-03T03:17:41.954664Z","title":"URL https: //doi.org/10.48550/arXiv.2407.11550","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08585","last_updated":"2026-06-01T09:16:10Z","snapshot_observed_at":"2026-08-03T03:17:37.567545Z","submitted_at":"2026-02-09T12:23:38Z","title":"Predicting Future Utility: Global Combinatorial Optimization for Task-Agnostic KV Cache Eviction","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T03:17:41.954664Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2602.08585"},"observation_digest":"sha256:fa721f6c9fab4860985d1322a27a55cabafd77b1391499fa2a06b2281beb7380","observation_id":"6235209a-5567-4d26-a903-76b19b66df2c","resolution":{"observed_at":"2026-08-03T03:17:41.954664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2602.08686","last_updated":"2026-07-21T10:42:28Z","snapshot_observed_at":"2026-08-03T03:16:17.613692Z","submitted_at":"2026-02-09T14:07:55Z","title":"CompilerKV: Risk-Adaptive KV Compression via Offline Experience Compilation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T13:32:15.598047Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2602.08686"},"observation_digest":"sha256:40f8b07496a5fbb3a8ea74ae4ad0de4aac8bc5e24ca332aad6479c86dc9abb77","observation_id":"bd059498-2f91-45cc-bfdf-a30890ff5533","resolution":{"observed_at":"2026-05-21T13:34:11.386035Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-03T03:16:19.869117Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.08686","last_updated":"2026-07-21T10:42:28Z","snapshot_observed_at":"2026-08-03T03:16:17.613692Z","submitted_at":"2026-02-09T14:07:55Z","title":"CompilerKV: Risk-Adaptive KV Compression via Offline Experience Compilation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T03:16:19.869117Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2602.08686"},"observation_digest":"sha256:80f00fc9eb60bc545da1fc06c36066b8af57c745ab6193a44568df4d8dd40882","observation_id":"2cb08b7e-855e-47bc-a2bc-429babc17a2b","resolution":{"observed_at":"2026-08-03T03:16:19.869117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2602.18196","last_updated":"2026-05-28T10:28:00Z","snapshot_observed_at":"2026-08-02T22:05:41.622495Z","submitted_at":"2026-02-20T13:09:49Z","title":"RAT+: Train Dense, Infer Sparse -- Recurrence Augmented Attention for Dilated Inference","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T20:59:33.902420Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2602.18196"},"observation_digest":"sha256:96622812aeac3c2a4c22a1edf9a20c0b5c24e71eccb11074ff42d0eed9736aeb","observation_id":"bb52036e-e225-4445-bf97-74ac0da5d12f","resolution":{"observed_at":"2026-05-17T11:16:32.250514Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2602.18196","last_updated":"2026-05-28T10:28:00Z","snapshot_observed_at":"2026-08-02T22:05:41.622495Z","submitted_at":"2026-02-20T13:09:49Z","title":"RAT+: Train Dense, Infer Sparse -- Recurrence Augmented Attention for Dilated Inference","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T12:45:27.150368Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2602.18196"},"observation_digest":"sha256:e0aa2438ff61427627622848bd85ab495c32d588b8f791bb784287bd53009063","observation_id":"ba045b40-e115-43b9-85aa-7592be0e4e31","resolution":{"observed_at":"2026-05-21T12:50:09.472921Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-02T22:05:42.996217Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.18196","last_updated":"2026-05-28T10:28:00Z","snapshot_observed_at":"2026-08-02T22:05:41.622495Z","submitted_at":"2026-02-20T13:09:49Z","title":"RAT+: Train Dense, Infer Sparse -- Recurrence Augmented Attention for Dilated Inference","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T22:05:42.996217Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2602.18196"},"observation_digest":"sha256:d0934978f9222250890156ee9a7400127a8eeb4a2dcd654e5e28c0cd9e49bda5","observation_id":"e6346723-9918-45b5-b9d7-69a8d3376839","resolution":{"observed_at":"2026-08-02T22:05:42.996217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2603.05959","last_updated":"2026-04-29T12:58:34Z","snapshot_observed_at":"2026-07-06T22:48:04.438669Z","submitted_at":"2026-03-06T06:44:17Z","title":"OVGGT: O(1) Constant-Cost Streaming Visual Geometry Transformer","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T15:39:55.826057Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2603.05959"},"observation_digest":"sha256:2109bc62281e4c9f044612d9a294d13d08ddfd9581c3cacf40a2baac0bfc6186","observation_id":"66b1bc7e-180a-459c-9973-3782ac42978f","resolution":{"observed_at":"2026-05-17T11:16:32.250514Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2604.04722","last_updated":"2026-04-06T14:45:49Z","snapshot_observed_at":"2026-07-06T22:53:37.357996Z","submitted_at":"2026-04-06T14:45:49Z","title":"Don't Waste Bits! Adaptive KV-Cache Quantization for Lightweight On-Device LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T19:31:17.420639Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2604.04722"},"observation_digest":"sha256:7c2a41988b961aad0603e08cfe82bb530cdc5e0129fbd1a367683f96c3f65b84","observation_id":"c9e8d310-d388-41fa-8342-51ded957d3d1","resolution":{"observed_at":"2026-05-17T11:16:32.250514Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-07-13T09:09:32.932051Z","title":"Kevin Zhou","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.06035","last_updated":"2026-06-02T01:46:36Z","snapshot_observed_at":"2026-08-06T06:50:01.259424Z","submitted_at":"2026-04-07T16:30:54Z","title":"cuRAMSES: Scalable AMR Optimizations for Large-Scale Cosmological Simulations","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T09:09:32.932051Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2604.06035"},"observation_digest":"sha256:0c3790098cd325a668da50fa69f1fe61aba6e0bead4f1709380f8ad2df3b9bb1","observation_id":"cb783ee4-13e0-4dc3-971f-9a5d8292bbe9","resolution":{"observed_at":"2026-07-13T09:09:32.932051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2604.06036","last_updated":"2026-04-09T09:40:36Z","snapshot_observed_at":"2026-07-06T22:54:34.877944Z","submitted_at":"2026-04-07T16:31:45Z","title":"CodecSight: Leveraging Video Codec Signals for Efficient Streaming VLM Inference","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T18:45:26.555395Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2604.06036"},"observation_digest":"sha256:0153fb15c5a6bec093276e1ab6e4d4d34083a0f5709025406f940fa309b46850","observation_id":"b856209d-dcf8-4559-b657-c00aedf98241","resolution":{"observed_at":"2026-05-17T11:16:32.250514Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2604.06694","last_updated":"2026-04-08T05:20:39Z","snapshot_observed_at":"2026-07-06T22:55:06.424752Z","submitted_at":"2026-04-08T05:20:39Z","title":"AudioKV: KV Cache Eviction in Efficient Large Audio Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T18:28:49.768210Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2604.06694"},"observation_digest":"sha256:42bf6cde3d7afcefe25abce9f3ad3f3033d07ef008d525014a7846ac018fafae","observation_id":"406d98a9-c4c0-4f47-88f3-5e6dff90c453","resolution":{"observed_at":"2026-05-17T11:16:32.250514Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2604.15237","last_updated":"2026-04-17T17:56:45Z","snapshot_observed_at":"2026-08-02T15:16:08.707340Z","submitted_at":"2026-04-16T17:12:10Z","title":"StreamCacheVGGT: Streaming Visual Geometry Transformers with Robust Scoring and Hybrid Cache Compression","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T11:16:13.269662Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2604.15237"},"observation_digest":"sha256:1d6969710579f7daa820f5e723b4cb1a378e3b3a8cf50412dde1acf9325f116a","observation_id":"35fc7be4-c413-4c23-b3ff-fa4fc69a1a89","resolution":{"observed_at":"2026-05-17T11:16:32.250514Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2604.16864","last_updated":"2026-04-18T06:28:21Z","snapshot_observed_at":"2026-08-02T05:52:50.560554Z","submitted_at":"2026-04-18T06:28:21Z","title":"HieraSparse: Hierarchical Semi-Structured Sparse KV Attention","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T07:15:19.184970Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2604.16864"},"observation_digest":"sha256:6cb5c5d4edcc654c6fa00a4a8e05e7dfbe4a0650ad03a7aa1f1c5c393c118a65","observation_id":"acd2012f-995e-488c-92a1-4ac0447d9b1b","resolution":{"observed_at":"2026-05-17T11:16:32.250514Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2604.18529","last_updated":"2026-04-20T17:25:44Z","snapshot_observed_at":"2026-08-02T10:24:06.103567Z","submitted_at":"2026-04-20T17:25:44Z","title":"HybridGen: Efficient LLM Generative Inference via CPU-GPU Hybrid Computing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T02:48:18.330339Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2604.18529"},"observation_digest":"sha256:8206733a34bb85338416803dcb38ecdd1add183755bc62bcd178202217697125","observation_id":"e1d3ab66-5641-4e35-8342-dfea167095bb","resolution":{"observed_at":"2026-05-17T11:16:32.250514Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2605.06763","last_updated":"2026-05-11T02:30:41Z","snapshot_observed_at":"2026-07-06T23:19:10.574595Z","submitted_at":"2026-05-07T17:37:56Z","title":"Sparse Attention as a Range Searching Problem: Towards an Inference-Efficient Index for KV Cache","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-11T01:15:35.871863Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2605.06763"},"observation_digest":"sha256:81812c252d869a557d9cbaab266114e92b83d1bb7a2e440805948d212ef819a9","observation_id":"ae260121-b8da-4d6e-8047-4988258c5c16","resolution":{"observed_at":"2026-05-17T11:16:32.250514Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2605.07234","last_updated":"2026-05-08T04:37:22Z","snapshot_observed_at":"2026-08-06T04:40:19.152385Z","submitted_at":"2026-05-08T04:37:22Z","title":"Reformulating KV Cache Eviction Problem for Long-Context LLM Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T02:37:52.545943Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2605.07234"},"observation_digest":"sha256:a38c3c6077d0e4afed4f305201ad4c1ef46cc8d54ec41af91f68616830d5c78f","observation_id":"5d0e01fd-cc17-4c20-9610-ee008ee8743f","resolution":{"observed_at":"2026-05-17T11:16:32.250514Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2605.08317","last_updated":"2026-05-08T15:15:06Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T15:15:06Z","title":"RDKV: Rate-Distortion Bit Allocation for Joint Eviction and Quantization of the KV Cache","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T01:16:15.869198Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2605.08317"},"observation_digest":"sha256:94bd6cf7071c683f76a5eba6b3f939143d8283b2cd69e377b4730c7c06d76007","observation_id":"f4cb9951-4ede-4629-884f-d0b59830d73b","resolution":{"observed_at":"2026-05-17T11:16:32.250514Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2605.08840","last_updated":"2026-05-09T09:49:32Z","snapshot_observed_at":"2026-07-06T23:21:02.177557Z","submitted_at":"2026-05-09T09:49:32Z","title":"ReST-KV: Robust KV Cache Eviction with Layer-wise Output Reconstruction and Spatial-Temporal Smoothing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T02:52:33.076123Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2605.08840"},"observation_digest":"sha256:314d4fcb87213fa7943d2fefc9e29821602fd3e76be2b3ff1bb7e8f405e796c6","observation_id":"19d8247b-a1cb-4c75-ab1b-26617f8683ac","resolution":{"observed_at":"2026-05-17T11:16:32.250514Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2605.09649","last_updated":"2026-05-10T16:47:50Z","snapshot_observed_at":"2026-07-06T23:21:44.900680Z","submitted_at":"2026-05-10T16:47:50Z","title":"Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T05:02:25.513351Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2605.09649"},"observation_digest":"sha256:9425484fd21851df58ba75be935158b15d93420bf8546fc70731073369b09067","observation_id":"54352432-fa9f-43b7-a2ed-e73125c78673","resolution":{"observed_at":"2026-05-17T11:16:32.250514Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2605.10875","last_updated":"2026-05-11T17:27:15Z","snapshot_observed_at":"2026-07-06T23:22:47.781940Z","submitted_at":"2026-05-11T17:27:15Z","title":"Compute Where it Counts: Self Optimizing Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T04:57:58.649358Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2605.10875"},"observation_digest":"sha256:d5d8f9e11a02eef6ba66c36c5624d72cd6d46262cbd339074a654d20e167fa2a","observation_id":"3b0a3732-f212-49b2-aadc-6c042827756e","resolution":{"observed_at":"2026-05-17T11:16:32.250514Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2605.13111","last_updated":"2026-05-13T07:23:02Z","snapshot_observed_at":"2026-08-04T00:43:58.708088Z","submitted_at":"2026-05-13T07:23:02Z","title":"Pyramid Forcing: Head-Aware Pyramid KV Cache Policy for High-Quality Long Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-14T19:49:04.707675Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2605.13111"},"observation_digest":"sha256:e514db6e250d91cec770b434265fc961c507adf8529d5da29726a77f55feb378","observation_id":"0b95bdb8-d046-4b8a-af92-370d300ee2cf","resolution":{"observed_at":"2026-05-17T11:16:32.250514Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2605.14037","last_updated":"2026-05-13T18:58:16Z","snapshot_observed_at":"2026-08-04T00:53:16.855757Z","submitted_at":"2026-05-13T18:58:16Z","title":"Self-Pruned Key-Value Attention: Learning When to Write by Predicting Future Utility","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-15T05:35:09.705532Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2605.14037"},"observation_digest":"sha256:4fe03b2784689a35b4517261b9a97c43704130c5f74110454d6acd46474e1538","observation_id":"0e656eb6-73be-486d-8506-36094e2c6f71","resolution":{"observed_at":"2026-05-17T11:16:32.250514Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2605.17613","last_updated":"2026-05-17T19:18:39Z","snapshot_observed_at":"2026-07-06T23:28:36.134614Z","submitted_at":"2026-05-17T19:18:39Z","title":"VeriCache: Turning Lossy KV Cache into Lossless LLM Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T22:09:15.782104Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2605.17613"},"observation_digest":"sha256:b3a416a530d9a96cc65d77561cb714fc1490493498c4f2b10ba5dae75037b352","observation_id":"d6937745-42fd-4af9-80f6-16e1f681b9a6","resolution":{"observed_at":"2026-05-19T22:12:51.079539Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2605.18053","last_updated":"2026-05-18T08:41:34Z","snapshot_observed_at":"2026-07-06T23:28:59.503300Z","submitted_at":"2026-05-18T08:41:34Z","title":"Protection Is (Nearly) All You Need: Structural Protection Dominates Scoring in Globally Capped KV Eviction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T12:13:14.295659Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2605.18053"},"observation_digest":"sha256:1339aa8e1ce96e66448fd58786585dcc27daec1403742db6d888c4e343776e86","observation_id":"57c2cafe-3be5-496e-baaf-029560cfef9a","resolution":{"observed_at":"2026-05-20T12:13:15.950561Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2605.20600","last_updated":"2026-05-20T01:30:33Z","snapshot_observed_at":"2026-07-06T23:31:08.671011Z","submitted_at":"2026-05-20T01:30:33Z","title":"Head-Aware Key-Value Compression for Efficient Autoregressive Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T06:05:23.148656Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2605.20600"},"observation_digest":"sha256:f5c7e2f4e629e6725f6878139de162db345a4360483afb7b1af3d3bc93dfe0e8","observation_id":"f4035e90-3c4b-48ad-bef5-617fffdac953","resolution":{"observed_at":"2026-05-21T06:09:41.660092Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2605.20868","last_updated":"2026-05-20T08:04:40Z","snapshot_observed_at":"2026-07-06T23:31:23.407780Z","submitted_at":"2026-05-20T08:04:40Z","title":"Runtime-Certified Bounded-Error Quantized Attention","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T05:45:42.295527Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2605.20868"},"observation_digest":"sha256:4d5ca0e423a07d534b70aa3a8e30fa7ff16eed2c52b4ad7d86744c3095b6ecc9","observation_id":"664cd1d1-fd5e-4a19-8f98-ccfa86236adf","resolution":{"observed_at":"2026-05-21T05:49:41.134082Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2605.22106","last_updated":"2026-05-21T07:40:57Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T07:40:57Z","title":"ArborKV: Structure-Aware KV Cache Management for Scaling Tree-based LLM Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T05:48:30.118982Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2605.22106"},"observation_digest":"sha256:1f836493e48afccaecf30a3ea15bc5f0609c35ee225c76890be7c6df139a2d09","observation_id":"618041a0-879a-4b29-910b-00e4247ace06","resolution":{"observed_at":"2026-05-22T05:51:08.742724Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2605.23200","last_updated":"2026-05-22T03:32:52Z","snapshot_observed_at":"2026-08-02T09:14:38.688799Z","submitted_at":"2026-05-22T03:32:52Z","title":"Adaptive Mass-Segmented KV Compression for Long-Context Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-25T05:22:47.198185Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2605.23200"},"observation_digest":"sha256:2052780e903cda9016b438c3075f0275376170668a8172b9b161e0b07c6744ec","observation_id":"f6ef1f4f-8a40-4a43-8f63-a5272cdff75d","resolution":{"observed_at":"2026-05-25T05:25:22.824928Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2605.25085","last_updated":"2026-06-07T06:58:29Z","snapshot_observed_at":"2026-07-06T23:35:06.733347Z","submitted_at":"2026-05-24T13:54:13Z","title":"Polynomial Context-Truncation Sensitivity in Autoregressive Language Models: Sequential Wyner-Ziv Bounds for KV Cache Compression","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-29T23:46:44.498959Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2605.25085"},"observation_digest":"sha256:9f0d864a700b3bc3722b7eab621f4ba6ddc666eda47667e5dc4729d0d6462da7","observation_id":"840d6d94-0f12-4b8e-a316-855aa691d53e","resolution":{"observed_at":"2026-06-30T00:04:07.005277Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2606.01563","last_updated":"2026-06-01T02:08:40Z","snapshot_observed_at":"2026-08-06T03:26:36.028360Z","submitted_at":"2026-06-01T02:08:40Z","title":"MomentKV: Closing the Directional Gap in KV Cache Eviction for Long-Context Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T16:07:22.196982Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2606.01563"},"observation_digest":"sha256:4a770e1b93013777e0f1ee7f98525a784306502c5e7eefa7355689190fa51368","observation_id":"ceb41bf3-04b2-4d55-beb5-38cb1984c52c","resolution":{"observed_at":"2026-07-01T21:56:15.429922Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2606.02775","last_updated":"2026-06-01T18:38:21Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T18:38:21Z","title":"AURA: Action-Gated Memory for Robot Policies at Constant VRAM","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T14:30:49.006075Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2606.02775"},"observation_digest":"sha256:9cea8179f88d9809c1b2cc755d31b6934c8c632caa3f0fa0aaa53360dc56f94e","observation_id":"ab6e242f-0bd2-44c7-8c31-21f407d802c6","resolution":{"observed_at":"2026-07-01T23:16:24.341478Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2606.03075","last_updated":"2026-06-02T03:06:17Z","snapshot_observed_at":"2026-08-03T19:26:00.654755Z","submitted_at":"2026-06-02T03:06:17Z","title":"TGV-KV: Text-Grounded KV Eviction for Vision-Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T11:04:54.171291Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2606.03075"},"observation_digest":"sha256:ddc5517321beefe71e611904ea5ca8087b5dafa0fff00d38d6b499b6597a86ee","observation_id":"1878f6e1-7c5b-4f4d-a45f-ff80f8ec31e8","resolution":{"observed_at":"2026-07-02T02:16:26.712945Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2606.05875","last_updated":"2026-06-04T08:47:46Z","snapshot_observed_at":"2026-07-06T23:45:47.161248Z","submitted_at":"2026-06-04T08:47:46Z","title":"QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T01:47:43.240850Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2606.05875"},"observation_digest":"sha256:be0ce6ba9d2ff9704a1cd80909b41ffa410d0d1b37388819ffc4fbec9991edc0","observation_id":"f696f251-de49-4933-aeb5-6970a3fa6c40","resolution":{"observed_at":"2026-07-02T12:46:57.470290Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2606.06302","last_updated":"2026-06-04T15:41:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-04T15:41:27Z","title":"Tangram: Unlocking Non-Uniform KV Cache for Efficient Multi-turn LLM Serving","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T02:25:46.234576Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2606.06302"},"observation_digest":"sha256:55d80299a26cc60940fa020439392e58101620cf1b638bdc77936226cb9735c0","observation_id":"3bcfccae-87c0-489e-bada-5fc3e17d7144","resolution":{"observed_at":"2026-07-02T12:06:56.142261Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2606.21238","last_updated":"2026-06-19T09:05:01Z","snapshot_observed_at":"2026-07-06T23:56:17.293417Z","submitted_at":"2026-06-19T09:05:01Z","title":"Recency/Frequency Adaptive KV Caching for Large Language Model Serving","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T13:24:44.218871Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2606.21238"},"observation_digest":"sha256:ac18017fbf705b6b90fdcf4c6af1af7cbd014f94950e496427ca08531983caba","observation_id":"f020fc52-9aa1-4c1d-82f1-3cf5d6ad275f","resolution":{"observed_at":"2026-07-04T07:29:39.057707Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2606.24033","last_updated":"2026-06-23T00:17:48Z","snapshot_observed_at":"2026-08-05T22:30:32.069600Z","submitted_at":"2026-06-23T00:17:48Z","title":"RoPE-Aware Bit Allocation for KV-Cache Quantization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T01:05:13.790381Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2606.24033"},"observation_digest":"sha256:73e4cff83340a77517fb2995ba29bc0db6bc36aed56a6b08c2665d9c9d604e64","observation_id":"43d52b19-1db8-4de6-a152-0055d561e04e","resolution":{"observed_at":"2026-07-04T15:59:57.339429Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2606.24187","last_updated":"2026-06-24T04:06:43Z","snapshot_observed_at":"2026-08-05T05:31:09.631074Z","submitted_at":"2026-06-23T06:13:30Z","title":"Towards Fast and Effective Long Video Understanding of Multimodal Large Language Models via Adaptive Quasi-Gaussian Sampling","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T00:53:43.629684Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2606.24187"},"observation_digest":"sha256:c18899bd0223f7d6b1fe897fa6be3f2013fede2e6f9abdc67225ed9e90f0bdad","observation_id":"34819430-05d8-4ab5-9f0b-71969161c1c3","resolution":{"observed_at":"2026-07-04T16:09:57.153630Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-07-06T23:59:03.724013Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:2d2992bac15e31967993c0d709dc7131e56e7e07ecfe6b670474527a3d83c750","observation_id":"cdcca5e3-b201-4475-84b2-8babd76b69a8","resolution":{"observed_at":"2026-07-04T16:49:58.039510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2606.28831","last_updated":"2026-06-27T09:36:37Z","snapshot_observed_at":"2026-07-07T00:02:52.539331Z","submitted_at":"2026-06-27T09:36:37Z","title":"HARD-KV: Head-Adaptive Regularization for Decoding-time KV Compression","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T10:27:30.344430Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2606.28831"},"observation_digest":"sha256:0923a40d6253f5285e590041f730bda0cc8c4e18f7c535f18b6dd4c7f4a83e0a","observation_id":"e14af459-92f8-4ac3-9f53-934c91a98c70","resolution":{"observed_at":"2026-06-30T10:44:37.454177Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2606.29563","last_updated":"2026-06-28T19:04:47Z","snapshot_observed_at":"2026-08-02T13:11:07.991129Z","submitted_at":"2026-06-28T19:04:47Z","title":"Coverage-Driven KV Cache Eviction for Efficient and Improved Inference of LLM","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-06-30T07:19:48.530272Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2606.29563"},"observation_digest":"sha256:d09d55f856a190f1268cf846a0c26f9e8ed98c1d60af906c150f01ca1aa3fefe","observation_id":"b1c927ed-d880-4e1b-9773-c91e39e52da1","resolution":{"observed_at":"2026-06-30T07:24:21.317305Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":"2407.11550","doi":"10.48550/arxiv.2407.11550","metadata_source":"pith","pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","venue":"cs.CL","work_id":"b41eb6db-193f-48ba-8278-6b1698524755","year":2024},"citing_paper":{"arxiv_id":"2607.08032","last_updated":"2026-07-09T01:15:03Z","snapshot_observed_at":"2026-08-02T16:38:21.894642Z","submitted_at":"2026-07-09T01:15:03Z","title":"What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-10T01:26:59.421158Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2607.08032"},"observation_digest":"sha256:eb64ed1e5d96a9cefda57b63bc8e5174c4db61ea7389a3d5de48a8c8b280b7ae","observation_id":"cac1ad83-7a9e-4a88-a6e2-df8080ee2990","resolution":{"observed_at":"2026-07-10T01:36:44.281921Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.442662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-07-14T10:41:08.967261Z","title":"Ada-KV: Optimizing KV cache eviction by adaptive budget allocation for efficient LLM inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10582","last_updated":"2026-07-12T05:35:26Z","snapshot_observed_at":"2026-07-16T23:18:51.454376Z","submitted_at":"2026-07-12T05:35:26Z","title":"MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T10:41:08.967261Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2607.10582"},"observation_digest":"sha256:92d570f4f7f463bdcb564d9d1eb47fe8c926d886d180e187fd57993b0750912c","observation_id":"fd1634c4-70f1-4929-ba94-e707d266f298","resolution":{"observed_at":"2026-07-14T10:41:08.967261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-01T14:12:01.001000Z","title":"Ada-kv: Optimizing kv cache eviction by adaptive budget allocation for efficient llm inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18859","last_updated":"2026-07-21T08:49:30Z","snapshot_observed_at":"2026-08-06T17:07:51.430753Z","submitted_at":"2026-07-21T08:49:30Z","title":"PhoenixRepair: Rethinking Repair Strategy Exploration in Software Agents","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-01T14:12:01.001000Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2607.18859"},"observation_digest":"sha256:25c1d2a7a1796fe90b60c1391e3ac754bf98af4b4afc77af240cc09f57925df3","observation_id":"e5f68943-dc4d-448c-b85b-5c1cd7d85bf5","resolution":{"observed_at":"2026-08-01T14:12:01.001000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-01T07:23:37.013625Z","title":"Kevin Zhou","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21475","last_updated":"2026-07-25T14:37:35Z","snapshot_observed_at":"2026-08-06T01:07:09.953369Z","submitted_at":"2026-07-23T16:16:59Z","title":"Error Certificates for KV-Cache Eviction via Randomized Design","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T07:23:37.013625Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2607.21475"},"observation_digest":"sha256:270c51c7063ca0e5ab1d826101f706a1bb33ed5f0cfaa242424e1cd0835e9741","observation_id":"73850121-342a-4844-aad9-807694ad86cd","resolution":{"observed_at":"2026-08-01T07:23:37.013625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-02T11:58:30.056509Z","title":"Kevin , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22586","last_updated":"2026-06-09T04:56:59Z","snapshot_observed_at":"2026-08-06T10:04:16.098099Z","submitted_at":"2026-06-09T04:56:59Z","title":"MM-ShiftKV: Decode-Aware Prefill-Stage KV Selection for Multimodal Large Language Models","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-02T11:58:30.056509Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2607.22586"},"observation_digest":"sha256:87c5c5cba084ed527779bf12804600bd878b6dc60e1d9e01de43f8f1edee77ec","observation_id":"0e0d93f9-2ca8-4c7a-8d0c-75e38cda5bc0","resolution":{"observed_at":"2026-08-02T11:58:30.056509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-07-31T11:49:11.643900Z","title":"Kevin Zhou","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.643900Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:6fa5640f2c915929ce2924171f2dd6f8616f0d18125bc608a7e233639adcfae7","observation_id":"4301edce-d036-4326-a5ac-7512a5da7da9","resolution":{"observed_at":"2026-07-31T11:49:11.643900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-02T09:52:42.397695Z","title":"Ada-kv: Optimizing kv cache eviction by adaptive budget allocation for efficient llm inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24788","last_updated":"2026-06-26T17:48:13Z","snapshot_observed_at":"2026-08-04T08:13:02.039551Z","submitted_at":"2026-06-26T17:48:13Z","title":"GLIDE: Guided Layerwise Hybrid Attention for Efficient LLM Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T09:52:42.397695Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2607.24788"},"observation_digest":"sha256:9dcbfecd0976b4751ad526a0af96ea5041979daa1dffc3af4187a68811635320","observation_id":"f250c808-b7b1-416a-b174-215876bb254b","resolution":{"observed_at":"2026-08-02T09:52:42.397695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-04T13:43:57.862186Z","title":"arXiv preprint arXiv:2407.11550 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02150","last_updated":"2026-08-05T06:57:37Z","snapshot_observed_at":"2026-08-07T01:27:00.119359Z","submitted_at":"2026-08-03T12:34:31Z","title":"PhyCheck: Fine-Grained Evidence-Grounded Dataset for Physical Law Understanding in Video-LLMs","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-08-04T13:43:57.862186Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2608.02150"},"observation_digest":"sha256:a4f21070980e896e178b02dc7ac4ef566289e0ddcff4040ae424c2dbb86aedda","observation_id":"8c1f21c3-1568-423c-95da-973cf561f3e2","resolution":{"observed_at":"2026-08-04T13:43:57.862186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-08-07T00:11:49.196155Z","title":"arXiv preprint arXiv:2407.11550 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02150","last_updated":"2026-08-05T06:57:37Z","snapshot_observed_at":"2026-08-07T01:27:00.119359Z","submitted_at":"2026-08-03T12:34:31Z","title":"PhyCheck: Fine-Grained Evidence-Grounded Dataset for Physical Law Understanding in Video-LLMs","version":3},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-08-07T00:11:49.196155Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2608.02150"},"observation_digest":"sha256:a7546cfe70ffae315d4c4d6c880c508c9473dd9dcf8cfdc6eda727381bd2312d","observation_id":"9aa6fe0a-fe0a-4044-ae3a-4c672ab79fd2","resolution":{"observed_at":"2026-08-07T00:11:49.196155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2407.11550/citation-record","integrity":"/paper/2407.11550/integrity","json":"/paper/2407.11550/citation-record.json","paper":"/paper/2407.11550"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.18013","last_updated":"2025-08-15T03:28:39Z","snapshot_observed_at":"2026-08-04T11:22:48.683493Z","submitted_at":"2024-02-28T03:16:44Z","title":"A Survey on Recent Advances in LLM-Based Multi-turn Dialogue Systems","version":2},"cited_work":{"arxiv_id":"2402.18013","doi":"10.48550/arxiv.2402.18013","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.18013","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A survey on recent advances in llm-based multi-turn dialogue systems","venue":"arXiv (Cornell University)","work_id":"d4419b98-6427-493f-8afe-3e4d0d22a371","year":2024},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2402.18013","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:5e2493cc14dbfee66557fc7e47b36bcd50ef4b13f3c67825b41fd9eaf0858a86","observation_id":"6e7faeaa-a576-47ec-8d7f-75305605368d","resolution":{"observed_at":"2026-05-17T11:16:32.120808Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Summedits: measuring llm ability at factual reasoning through the lens of summarization","venue":null,"work_id":"00288d86-bd7b-4705-86cc-8d173f1a99e3","year":2023},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:912278e1ffe55c870d61b31edc4e5d5cbc0fa87e1885d3e0c08e1e01e09e78c8","observation_id":"144dd309-7e56-4854-920c-fcd77533bc31","resolution":{"observed_at":"2026-05-17T11:16:32.133814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llm-based code generation method for golang compiler testing","venue":null,"work_id":"2d74f7bf-f26e-4dd9-8eaf-f3343afb4df8","year":2023},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:5286b832e640ac4693eed0929cc810baa60bf8bfb24e98290d86deafe6561905","observation_id":"52cb7d50-e276-468f-a91b-0c1948b9822d","resolution":{"observed_at":"2026-05-17T11:16:32.137587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:a2510b33791def2bd877713a26c63769601ad1521dd251602eea3c8aaaaf24c7","observation_id":"f24c49b7-2128-49ca-80cd-7b77651fd41d","resolution":{"observed_at":"2026-05-17T11:16:32.087204Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The claude 3 model family: Opus, sonnet, haiku, March 2024","venue":null,"work_id":"33e09cc4-5444-41b5-bbd0-30293fce35f4","year":2024},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:2b1f5d75c81b70bf30200f226a65a81ad0adb468f5126b7f8ff3531d7e001116","observation_id":"fb2f066c-506f-4508-a6d4-3377504b0a21","resolution":{"observed_at":"2026-05-17T11:16:32.142781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:121147f579cb822e77063e8dfbe245222f753396ee2f9383671bd9f37b788d4b","observation_id":"159bcee7-e37a-4900-8939-363686e5e9d8","resolution":{"observed_at":"2026-05-17T11:16:31.989850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":"2310.01801","doi":"10.48550/arxiv.2310.01801","metadata_source":"pith","pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","venue":"cs.CL","work_id":"91379982-466d-4895-96f5-079b66259a73","year":2023},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:06cc228da9a540c3017c4951b227be4fa062a1c52a4c0b0fd0d18efc6459c43d","observation_id":"e247733d-70e0-440e-96fa-6098d8520233","resolution":{"observed_at":"2026-05-17T11:16:32.055445Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":"2c3fbd7f-1377-4198-a454-86a6e072d41d","year":2024},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:5a1380e33c0773997053dbd005dcaa222394bebadb567cf808c39ac13bfc0a9d","observation_id":"29cf75f6-909c-41aa-b680-225ae8061826","resolution":{"observed_at":"2026-05-17T11:16:32.147044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PyramidInfer: Pyramid KV cache compression for high-throughput LLM inference","venue":null,"work_id":"748e3984-6fdf-4afa-9c84-2ced5c40e39f","year":2024},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:a35eecc5d94f6cd3d13e95c334508fb050c859e12907d823852e4f2e0db6add7","observation_id":"91cbc77b-ae31-4941-953e-bab9d84f440a","resolution":{"observed_at":"2026-05-17T11:16:32.151003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"cited_work":{"arxiv_id":"2406.02069","doi":"10.48550/arxiv.2406.02069","metadata_source":"pith","pith_arxiv_id":"2406.02069","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","venue":"cs.CL","work_id":"6317700d-f903-4ce1-8f53-b43cb146d48b","year":2024},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2406.02069","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:8f17d6024c5464ed6a84fb12889321571f6783490c07202c7c14ec752d756945","observation_id":"5db3f52e-6649-45e8-9603-4ddd49a703be","resolution":{"observed_at":"2026-05-17T11:16:32.027501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.042348+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.042348+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SnapKV: LLM knows what you are looking for before generation","venue":null,"work_id":"a316e733-bbf2-41bd-8aaa-bc202f50f272","year":2024},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:7fd0a49215a39e12f28b31bdf47ec5607701e40b5983208ec036927fa69835d5","observation_id":"c2b4aaac-0dc2-4647-a4ea-ffa1b5dbc548","resolution":{"observed_at":"2026-05-17T11:16:32.157063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llm kv cache compression made easy","venue":null,"work_id":"4ca44302-9f1f-4159-849a-da600f4f61d7","year":2024},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:a7d474071730246934f193eca870c6fed93f3f240957bf191c4a3c8f4f55f4d1","observation_id":"485cf98b-5527-4526-9341-82de8ea46220","resolution":{"observed_at":"2026-05-17T11:16:32.160934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Catalyst: Optimizing cache management for large in-memory key-value systems","venue":null,"work_id":"3e63b190-5c40-45d0-9cc6-89ece32d49c2","year":2023},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:6c2cedddf25ada249f89f638979b609a0b56ae0108075f66ae65410e91d5ed93","observation_id":"fd5c8696-81ca-4b25-b752-90921024fa1a","resolution":{"observed_at":"2026-05-17T11:16:32.165596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":"2004.05150","doi":"10.48550/arxiv.2004.05150","metadata_source":"pith","pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Longformer: The Long-Document Transformer","venue":"cs.CL","work_id":"abea7a44-6668-4de7-aab6-f53a6e5aa088","year":2020},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:4a59089794cacaace527bd3d3cd5f4f552a04baf4513a2c2c6b346b98357b6da","observation_id":"2dd34f3a-72dc-40a8-a5ba-5093857f671e","resolution":{"observed_at":"2026-05-17T11:16:32.009823Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lm-infinite: Zero-shot extreme length generalization for large language models","venue":null,"work_id":"b0440fb7-e462-4b1d-87eb-32116ffb70dc","year":2024},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:15d827f570cbf2852f4d8f4c99b02092d6ae2dd27f2567f5568a58e54b899fe2","observation_id":"eff59542-4dd8-41a3-92d5-4eb3ccd9cee3","resolution":{"observed_at":"2026-05-17T11:16:32.169379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":"2309.17453","doi":"10.48550/arxiv.2309.17453","metadata_source":"pith","pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Streaming Language Models with Attention Sinks","venue":"cs.CL","work_id":"a8d25452-c237-48c9-88a4-682717c3979a","year":2023},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:b1cf6c77a1f4f86d8c60de174ffc0f1550a9924f5d43073b56cb3ca1a6735bd1","observation_id":"4ba508c6-0cc0-4e36-9495-180237eefdc4","resolution":{"observed_at":"2026-05-17T11:16:32.032488Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scissorhands: Exploiting the persistence of impor- tance hypothesis for llm kv cache compression at test time","venue":null,"work_id":"9aeec069-dad8-4d69-8beb-3c1582fa8f89","year":2024},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:09999bf51857720b866c9517caa18348608650c0eac77d34d5c00a3578ed48a4","observation_id":"40d20c6a-c160-4d4a-8f16-849b124557e6","resolution":{"observed_at":"2026-05-17T11:16:32.173735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06262","last_updated":"2024-02-17T10:08:14Z","snapshot_observed_at":"2026-08-03T16:19:48.429086Z","submitted_at":"2024-02-09T09:20:59Z","title":"On the Efficacy of Eviction Policy for Key-Value Constrained Generative Language Model Inference","version":2},"cited_work":{"arxiv_id":"2402.06262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.06262","snapshot_observed_at":"2026-07-10T00:56:40.724162Z","title":"On the efficacy of eviction policy for key-value constrained generative language model inference","venue":"cs.CL","work_id":"eff2d2c6-2666-4f5b-8155-82d9f907ee66","year":2024},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2402.06262","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:e5995c23989ad0d3c199143dbe6c54c1ee58db27a7e64f4e67b0fe82b26e972a","observation_id":"f0367217-df7e-48ff-b663-070b8cdaadd4","resolution":{"observed_at":"2026-05-17T11:16:32.074216Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minference 1.0: Accelerating pre-filling for long-context llms via dynamic sparse attention","venue":null,"work_id":"fe119510-fa33-45cf-8b81-7376f32114b0","year":2024},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:20ae4a3f6aa3423a30f64c455d8319d2ced3da12fa22aac2532709b0dd31d203","observation_id":"56663dad-0c07-4e19-93c0-13bffa7734f0","resolution":{"observed_at":"2026-05-17T11:16:32.177378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16083","last_updated":"2025-05-23T10:09:51Z","snapshot_observed_at":"2026-07-06T21:13:13.686703Z","submitted_at":"2025-04-22T17:59:51Z","title":"MMInference: Accelerating Pre-filling for Long-Context VLMs via Modality-Aware Permutation Sparse Attention","version":2},"cited_work":{"arxiv_id":"2504.16083","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16083","snapshot_observed_at":"2026-07-03T23:59:06.827217Z","title":"Abdi, Dongsheng Li, Jianfeng Gao, Yuqing Yang, and Lili Qiu","venue":null,"work_id":"fedcce41-1539-4e66-bd9d-81f729758db4","year":2025},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2504.16083","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:f1a9e872d0115f76f214bf5b9ffbede69e72fdfcb18789f9bea025aa362275ca","observation_id":"54676c93-14c6-49be-b5a7-f9b12295e6ef","resolution":{"observed_at":"2026-05-17T11:16:32.106754Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-07-06T19:16:14.638445Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":"2409.10516","doi":"10.48550/arxiv.2409.10516","metadata_source":"pith","pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","venue":"cs.LG","work_id":"96e08aaa-a828-4d47-8eb6-182994c0f8f2","year":2024},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:95b8e0b85acf993205df680f81c67afa6506b5e5a07a0eec803e31a0233337df","observation_id":"0e5c3793-50d4-462e-903e-5c8340166dfe","resolution":{"observed_at":"2026-05-18T08:12:02.395521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Arkvale: Efficient generative llm inference with recallable key-value eviction","venue":null,"work_id":"579f6f34-deff-4c76-9d34-15a25715ebe7","year":2024},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:3fc39868460753661fefd5f7fd42a8cf61dcaf1202716e61aa24d2884b7b7121","observation_id":"a804081c-3403-4281-befb-1f02ba20aa63","resolution":{"observed_at":"2026-05-17T11:16:32.180782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pqcache: Product quantization-based kvcache for long context llm inference","venue":null,"work_id":"18c2b9f3-a94d-4264-8b52-bad47423bf7c","year":2025},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:0c589dc75f5a10e954ef833bd3ca094818e39faf03588c13d7815003df282fc1","observation_id":"42a2eb19-cc67-414d-aaf5-48f46890d3aa","resolution":{"observed_at":"2026-05-17T11:16:32.184132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20187","last_updated":"2025-07-02T05:12:29Z","snapshot_observed_at":"2026-08-06T22:52:20.173236Z","submitted_at":"2025-06-25T07:26:42Z","title":"Breaking the Boundaries of Long-Context LLM Inference: Adaptive KV Management on a Single Commodity GPU","version":2},"cited_work":{"arxiv_id":"2506.20187","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20187","snapshot_observed_at":"2026-07-04T07:59:40.383102Z","title":"Breaking the boundaries of long- context llm inference: Adaptive kv management on a single commodity gpu","venue":null,"work_id":"9e433d53-4c8a-4793-abe1-a84014993974","year":2025},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2506.20187","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:47f6c8a6a6cb5ccbd92e1aaedc3a899359e90a39066733409eea69cec2a3eea4","observation_id":"9933c708-0a8d-4273-8971-2369de29cb48","resolution":{"observed_at":"2026-05-17T11:16:32.022030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deja vu: Contextual sparsity for efficient llms at inference time","venue":null,"work_id":"26a09761-22b6-4a40-ba2b-1ed7810a02e7","year":2023},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:0b20906e7c8bcff467e0fbe34a0643c11500a6bf86870c864f91333326cbb64f","observation_id":"00ee77e9-1e50-4904-9ec6-9c218efbadae","resolution":{"observed_at":"2026-05-17T11:16:32.187182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness.Advances in Neural Information Processing Systems, 35:16344–16359","venue":null,"work_id":"3e33869a-9182-4187-90f6-0a1149bdbb50","year":2022},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:dc5dae165f44d9371215cfe9edfb3900d56934ee3282b7481c6e5eaaf157e382","observation_id":"29963ae4-5f82-4d45-96a6-b7d89aafd617","resolution":{"observed_at":"2026-05-17T11:16:32.190958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":"2307.08691","doi":"10.48550/arxiv.2307.08691","metadata_source":"pith","pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","venue":"cs.LG","work_id":"fff3953b-5efb-4753-bee4-002f59995810","year":2023},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:b40291a9a17f8b27bed74613b48f153820688b3ce0458b2706c020b9edd9159c","observation_id":"3cf3797b-d1cc-4f4c-900e-dbd69cf3ffec","resolution":{"observed_at":"2026-05-17T11:16:32.049856Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:18.243793+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:18.243793+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":"82959691-fce8-4c65-a800-31ba2bad7411","year":2023},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:a6b3b842160b957e0e196021178dd1520de0db1d27fa43862db650f0a868271b","observation_id":"33c67fdc-d48f-4b52-b0f5-0a5565ad6ad0","resolution":{"observed_at":"2026-05-17T11:16:32.194755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The llama 3 herd of models","venue":null,"work_id":"2eed2c7d-cb1d-4f61-8a80-f12cdb559f09","year":2024},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:7c57d628b6fb080b4b403c668b8d996ba78799b4cbee8ca9fe2b431a6c36510e","observation_id":"f684ebbd-af63-4be8-85fc-84561b063492","resolution":{"observed_at":"2026-05-17T11:16:32.197601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":"2310.06825","doi":"10.48550/arxiv.2310.06825","metadata_source":"pith","pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mistral 7B","venue":"cs.CL","work_id":"eb5e1305-ad11-4875-ad8d-ad8b8f697599","year":2023},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:5f44a57ade44a9c53de1ad857c331f13a23de8c4182df2d774e6fce8d6c05df7","observation_id":"f1802368-12fb-469b-ae7e-285d5a4f5f58","resolution":{"observed_at":"2026-05-17T11:16:32.082945Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:12.282824+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:12.282824+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":"fa96f94f-da03-4951-8bb7-8f1f81f2f2ff","year":2023},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:d688e5c86059ab265e9aec35ebcaff0feed766d0a40e11805cd320a13f69d750","observation_id":"6d0feab6-a4fe-4240-87cd-d1856d040a83","resolution":{"observed_at":"2026-05-17T11:16:32.200995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:6f4613190ce470e6874de53d525f5d73c85d7fef25867d32ade738bea936967b","observation_id":"ebba2fa9-a7f8-4386-8b23-c4a196d7a320","resolution":{"observed_at":"2026-05-17T11:16:32.092177Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-02T11:20:36.216220Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":"2308.14508","doi":"10.48550/arxiv.2308.14508","metadata_source":"pith","pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","venue":"cs.CL","work_id":"ba7831c4-9427-4e0e-a5c1-4e98511f4b53","year":2023},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:e05875da4d066e18ed57372088084434405ec3125e19c374b24da65c4c0f893a","observation_id":"881c827d-22a1-41b4-853d-275e2f81b98c","resolution":{"observed_at":"2026-05-17T11:16:32.101465Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prompt cache: Modular attention reuse for low-latency inference","venue":null,"work_id":"08f1c19d-0552-48ed-b5a6-69bb4fea8310","year":2024},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:d901c1f867c865847726da7897c1c6a182b960b691c361d1071e8f8a896e409d","observation_id":"888260fa-eedc-4e31-81ed-9504421253f7","resolution":{"observed_at":"2026-05-17T11:16:32.204467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":"2312.07104","doi":"10.48550/arxiv.2312.07104","metadata_source":"pith","pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","venue":"cs.AI","work_id":"bcc79aed-93ef-4b91-94e6-e62b5fa15ce7","year":2023},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:4830b6af2025ac4edd0818eee6c6489eeeb9d9b4f0f08e6bc1c369e0523b972f","observation_id":"c34b8ce4-76bf-4cc0-b6fe-4eca1d791962","resolution":{"observed_at":"2026-05-17T11:16:32.126000Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.23416","doi":"10.48550/arxiv.2505.23416","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kvzip: Query-agnostic kv cache compression with context reconstruction","venue":"arXiv (Cornell University)","work_id":"5f731372-7406-4bf9-9ea7-10b18aad3813","year":2026},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:b0525f99bfe78d0709dd18ca38b0533eb5f6b34dc3a0b9b47f52ae8c99ef56c4","observation_id":"7b29fa69-6d24-4661-b68a-814c11724ce0","resolution":{"observed_at":"2026-05-17T11:16:31.953933Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.00636","doi":"10.48550/arxiv.2510.00636","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expected attention: KV cache compression by estimating attention from future queries distribution","venue":"arXiv (Cornell University)","work_id":"06043450-dbd9-4e7f-92b5-07811314b835","year":2025},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:7dfb9705f68574f4135caf73138a8726964d19726572e405a6eb464fa3ac24f5","observation_id":"9ff5bc83-ac8b-42c2-85f1-80dc7ed31a8c","resolution":{"observed_at":"2026-05-17T11:16:31.960407Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:29.197878+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:29.197878+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.08373","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Draft-based approximate inference for llms","venue":null,"work_id":"b4a7ffe2-35df-4437-8dc7-8487387e6169","year":2025},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:b3ee91952012fb8291df71e546521bcb37e3215f7ad6e18e3f812b9801926f57","observation_id":"3066825f-7ce1-44da-9c44-7079e82dfe8f","resolution":{"observed_at":"2026-05-17T11:16:31.965616Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03805","last_updated":"2026-05-28T09:11:35Z","snapshot_observed_at":"2026-07-06T20:32:00.585460Z","submitted_at":"2025-02-06T06:31:47Z","title":"CriticalKV: Optimizing KV Cache Eviction from an Output Perturbation Perspective","version":2},"cited_work":{"arxiv_id":"2502.03805","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.03805","snapshot_observed_at":"2026-07-01T21:56:15.438972Z","title":"Identify critical kv cache in llm inference from an output perturbation perspective","venue":"cs.CL","work_id":"452d93e3-672c-49ca-8954-8fd56a0d4ed1","year":2025},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2502.03805","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:daf136ef785c2ce86b566651154766a802e48313a7a5d32c8ce60cfda7e042a5","observation_id":"878c43ec-0a9c-4c42-88a5-870334e7df6c","resolution":{"observed_at":"2026-05-29T02:04:52.226407Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kevin Zhou, and Xike Xie","venue":null,"work_id":"0884338c-946a-470f-8ff6-27e38cb13b0f","year":2025},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:9a8409b3d1e2d985980bb160154f5d6f1bd7fc08055312184a3ca3247ca30e26","observation_id":"baa7e92d-55ac-44be-8258-189d42b518f1","resolution":{"observed_at":"2026-05-17T11:16:32.208025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10819","last_updated":"2024-10-14T17:59:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-14T17:59:58Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","version":1},"cited_work":{"arxiv_id":"2410.10819","doi":"10.48550/arxiv.2410.10819","metadata_source":"pith","pith_arxiv_id":"2410.10819","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","venue":"cs.CL","work_id":"dcb5f5ed-ec94-4386-bfa7-02fcaeb844f1","year":2024},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2410.10819","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:ecf9addfe28d9605d9fe6b16fa7b30e75320c60c82d2a71fd89db5c678d2e68f","observation_id":"f75913c8-e146-41e6-ae50-9eda9dffd818","resolution":{"observed_at":"2026-05-18T11:49:16.947404Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.19258","doi":"10.48550/arxiv.2410.19258","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Not all heads matter: A head-level KV cache compression method with integrated retrieval and reasoning","venue":"arXiv (Cornell University)","work_id":"fef1d60f-7438-4fe3-98bf-842ff43eac33","year":2025},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:afec1c474dc20d55fef5c858d7d84a2706d79c5494f21ee43fd1a0652a5871f8","observation_id":"8002f619-d4c6-4141-b7ba-177b8900a38d","resolution":{"observed_at":"2026-05-17T11:16:31.985382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.795347+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.795347+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zeroquant: Efficient and affordable post-training quantization for large-scale transformers","venue":null,"work_id":"3649efb5-7413-4271-bec1-97ac236eddb3","year":2022},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:65dd759117e9bd5cc6bbab3b4e39be837c9b450bb25a6b85b79ac8dce002ddf8","observation_id":"9afbe2d5-bf62-4dca-8beb-82a8acdd06ec","resolution":{"observed_at":"2026-05-17T11:16:32.212024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-07-06T17:25:18.238343Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":"2402.02750","doi":"10.48550/arxiv.2402.02750","metadata_source":"pith","pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","venue":"cs.CL","work_id":"735737c3-24e5-41c3-ab4f-04edcb36731c","year":2024},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:6f083d97667678b254a0844d28a609ea35a9b72c5378820406f7d66950a33cdf","observation_id":"67793422-d0da-48fe-b7ee-cb62b56261b4","resolution":{"observed_at":"2026-05-17T11:16:31.994648Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04643","last_updated":"2024-04-12T13:00:25Z","snapshot_observed_at":"2026-08-04T07:21:43.170218Z","submitted_at":"2024-03-07T16:42:37Z","title":"QAQ: Quality Adaptive Quantization for LLM KV Cache","version":2},"cited_work":{"arxiv_id":"2403.04643","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.04643","snapshot_observed_at":"2026-07-10T00:56:40.966385Z","title":"Shichen Dong, Wen Cheng, Jiayu Qin, and Wei Wang","venue":"cs.CL","work_id":"d70bef43-c14b-4123-9165-73982b68b6e2","year":2024},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2403.04643","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:2622386d8b17f97a499f97264b0fee7686e6a8dfaefce7005d6ed275a5af4903","observation_id":"31a68326-fa4a-4a09-a223-3158675baa1e","resolution":{"observed_at":"2026-05-17T11:16:32.000177Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11912","last_updated":"2024-08-04T00:58:04Z","snapshot_observed_at":"2026-07-06T18:01:57.998555Z","submitted_at":"2024-04-18T05:25:54Z","title":"TriForce: Lossless Acceleration of Long Sequence Generation with Hierarchical Speculative Decoding","version":3},"cited_work":{"arxiv_id":"2404.11912","doi":"10.48550/arxiv.2404.11912","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.11912","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Triforce: Lossless acceleration of long sequence generation with hierarchical speculative decoding.arXiv preprint arXiv:2404.11912","venue":"arXiv (Cornell University)","work_id":"560ec1d2-b178-4310-bb8a-8a341c3cc3d5","year":2024},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2404.11912","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:536504b0236dc7f99266477edae302c13266d3920a7ee495ef6211f69576bc50","observation_id":"ae37c6f8-7817-4566-a999-0629ccfaa6a5","resolution":{"observed_at":"2026-05-17T11:16:32.005322Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Longspec: Long-context lossless speculative decoding with efficient drafting and verification","venue":null,"work_id":"a95be86a-968b-4931-9014-bc03d7aa0305","year":null},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:732018b370a300d1e5d546dfff46158a98f34f65b6c86d862afab8b31747d681","observation_id":"332355d8-0f65-4d5c-aafd-94ea9845a0d8","resolution":{"observed_at":"2026-05-17T11:16:32.215607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16201","last_updated":"2025-08-28T06:44:28Z","snapshot_observed_at":"2026-08-05T17:29:10.778969Z","submitted_at":"2025-08-22T08:23:09Z","title":"SpecVLM: Enhancing Speculative Decoding of Video LLMs via Verifier-Guided Token Pruning","version":2},"cited_work":{"arxiv_id":"2508.16201","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.16201","snapshot_observed_at":"2026-06-28T19:02:34.517061Z","title":"Specvlm: Enhancing speculative decoding of video llms via verifier-guided token pruning","venue":null,"work_id":"1693286b-edb2-4fea-9074-cca3b126bb19","year":2025},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2508.16201","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:fa52ad29136b8611f9928dd23ad57cb6a22fb30b54b7331c64b2202e63ee49a2","observation_id":"dd3f8a06-a3df-43a0-9bdc-cbffc120524d","resolution":{"observed_at":"2026-05-17T11:16:32.015576Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Needle In A Haystack - pressure testing LLMs","venue":null,"work_id":"6a268f48-78ed-45e0-a3ad-f467d6b5d41b","year":2023},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:97c539ab10b72a29e7148584816ba4794ca464bb01e7fa14300773f29d2702e5","observation_id":"05ba65c9-975f-4cd9-8ab3-0f27e64dfd22","resolution":{"observed_at":"2026-05-17T11:16:32.218999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zoology: Measuring and improving recall in efficient language models","venue":null,"work_id":"9b61f6fe-ffba-4381-b04f-8b2a32fcfb3b","year":2024},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:b9deb367c9be95f2e6b700599b333cb9aaaeb1dd7a3cab2a754724ea44f9e094","observation_id":"ff9240fd-688c-422e-b8ea-04691a7129f6","resolution":{"observed_at":"2026-05-17T11:16:32.222444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The narrativeqa reading comprehension challenge","venue":null,"work_id":"2e661ee1-13f4-469d-b054-6b5bb2e5a896","year":2018},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:b7745e6626d6d61080269dd616200f81600dff63e1ffe38e5ca39e02cb6da89c","observation_id":"a0a9affe-2bae-48ed-a176-7ef6e0cec775","resolution":{"observed_at":"2026-05-17T11:16:32.225564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.03011","last_updated":"2021-05-07T00:12:34Z","snapshot_observed_at":"2026-08-05T23:00:05.031488Z","submitted_at":"2021-05-07T00:12:34Z","title":"A Dataset of Information-Seeking Questions and Answers Anchored in Research Papers","version":1},"cited_work":{"arxiv_id":"2105.03011","doi":"10.48550/arxiv.2105.03011","metadata_source":"arxiv_reference","pith_arxiv_id":"2105.03011","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A dataset of information-seeking questions and answers anchored in research papers","venue":"arXiv (Cornell University)","work_id":"a52f872a-7afa-4ac3-9a74-74f8fb148aa9","year":2021},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2105.03011","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:39295b047a5f2c9fc313e662605a2bf96a6544a09c7d6c0aed17c7a5b6ff50a1","observation_id":"045b2a96-9a3a-4eb3-831c-b90c51bcdeb6","resolution":{"observed_at":"2026-05-17T11:16:32.038376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-07-31T11:19:06.421362Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":"1809.09600","doi":"10.48550/arxiv.1809.09600","metadata_source":"pith","pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","venue":"cs.CL","work_id":"c87d7e5f-b81a-41c8-beca-f0b9d598aae4","year":2018},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:ad681cfc5badff6b1cbf7c54b1ae33bd53be4253014d36a67da1cc4db7e1df5f","observation_id":"9e10dcc3-d9a1-4269-a067-56d40627b938","resolution":{"observed_at":"2026-05-17T11:16:32.043803Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Constructing a multi-hop QA dataset for comprehensive evaluation of reasoning steps","venue":null,"work_id":"7a961781-4efa-401a-8d50-63abcbab2117","year":2020},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:318a236d0b74ecf7bda85eec4d271bce06d6d44446905a19ac0664da65d4a115","observation_id":"9b2ad6bf-8a6f-45c1-b259-956c9962ce22","resolution":{"observed_at":"2026-05-17T11:16:32.228381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Musique: Multihop questions via single-hop question composition","venue":null,"work_id":"59bf3f1b-0423-410e-915a-01ba14bc8429","year":2022},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:a87298629aeca83a58b1718d04eb6f7949602c04c98b1613eae46d887b222b21","observation_id":"9727104d-89be-42bc-b647-bb5fab16d6a4","resolution":{"observed_at":"2026-05-17T11:16:32.231534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.02112","last_updated":"2021-04-11T21:04:26Z","snapshot_observed_at":"2026-07-06T10:56:39.571860Z","submitted_at":"2021-04-05T18:45:13Z","title":"Efficient Attentions for Long Document Summarization","version":2},"cited_work":{"arxiv_id":"2104.02112","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.02112","snapshot_observed_at":"2026-07-02T21:57:26.175240Z","title":"Effi- cient attentions for long document summarization.arXiv preprint arXiv:2104.02112","venue":null,"work_id":"aae5a10a-401d-4f18-8d91-43ed236a42aa","year":2021},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2104.02112","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:a619bd91bad155b5db01c466fe3cb9e388a27316e6d4dbaaf1f0bde21175d609","observation_id":"58304fc4-6592-4cf3-916f-6b12d957eeb9","resolution":{"observed_at":"2026-05-17T11:16:32.060641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.05938","last_updated":"2021-04-13T05:00:35Z","snapshot_observed_at":"2026-07-06T10:58:57.821607Z","submitted_at":"2021-04-13T05:00:35Z","title":"QMSum: A New Benchmark for Query-based Multi-domain Meeting Summarization","version":1},"cited_work":{"arxiv_id":"2104.05938","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.05938","snapshot_observed_at":"2026-06-30T07:24:21.374510Z","title":"Qmsum: A new benchmark for query-based multi-domain meeting summarization","venue":null,"work_id":"9057d42d-de09-4a4e-a564-2eac1fd71dd4","year":2021},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2104.05938","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:3a6847e66f2df5acf217e316f5cc69146b7f2a9c0933712503dc6f0cfab39446","observation_id":"0fda1443-aa59-46ae-a7fb-01ad7f27c369","resolution":{"observed_at":"2026-05-17T11:16:32.065330Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.01749","last_updated":"2019-06-19T20:26:03Z","snapshot_observed_at":"2026-07-06T07:58:00.005620Z","submitted_at":"2019-06-04T23:00:43Z","title":"Multi-News: a Large-Scale Multi-Document Summarization Dataset and Abstractive Hierarchical Model","version":3},"cited_work":{"arxiv_id":"1906.01749","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.01749","snapshot_observed_at":"2026-07-04T01:09:19.097681Z","title":"Multi-News: a Large-Scale Multi-Document Summarization Dataset and Abstractive Hierarchical Model","venue":"cs.CL","work_id":"62141570-1c8e-437e-a28e-586b1a76cb28","year":2019},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/1906.01749","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:45066c0570993c3cedd5053b511bd4099f43c660e415ced2ec6ee04bea618550","observation_id":"df2560f3-8962-41cc-9726-3b1cd63b4999","resolution":{"observed_at":"2026-05-17T11:16:32.069748Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Weld, and Luke Zettlemoyer","venue":null,"work_id":"4eee1634-14c3-4c5c-825c-9a01c104c2a5","year":2017},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:492094a62e73c87858e1a209208ab25187c232327ae2ab42219467af55de2b95","observation_id":"1e9e909c-87ee-4b7d-96cf-aa963c6151ad","resolution":{"observed_at":"2026-05-17T11:16:32.234499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.12237","last_updated":"2019-11-29T09:55:22Z","snapshot_observed_at":"2026-08-06T13:50:27.106878Z","submitted_at":"2019-11-27T15:54:55Z","title":"SAMSum Corpus: A Human-annotated Dialogue Dataset for Abstractive Summarization","version":2},"cited_work":{"arxiv_id":"1911.12237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1911.12237","snapshot_observed_at":"2026-07-03T05:17:40.236379Z","title":"Samsum corpus: A human-annotated dialogue dataset for abstractive summarization","venue":null,"work_id":"13d87488-8d82-4a1a-b6ca-be21a5695dd2","year":1911},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/1911.12237","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:82b11db56a5d28f75bd3713630492f0e1ffe43f5bed2c4fd794644b316e79191","observation_id":"64227a81-109f-45a8-a76b-75afadec75d6","resolution":{"observed_at":"2026-05-17T11:16:32.079227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning question classifiers","venue":null,"work_id":"360e8ca9-352c-4a9d-bf7d-5d137e0cbebf","year":2002},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:bc434f0c542ac8ff46304f37befea7f8e61bc8896c614ad899882004c9c976bf","observation_id":"12e5b9d5-93e2-4051-b2a4-54f83b952702","resolution":{"observed_at":"2026-05-17T11:16:32.237749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Longcoder: A long-range pre-trained language model for code completion","venue":null,"work_id":"045c24cf-d7aa-41fd-b4ca-00a5a97ac60e","year":2023},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:206d7fe426cb8633d6bfbfc202c3712dfc85693bd3a1b3b48b171b50c170289a","observation_id":"b9fd830c-5b19-4062-8ad8-3b2b5e0e0134","resolution":{"observed_at":"2026-05-17T11:16:32.240745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Repobench: Benchmarking repository-level code auto-completion systems","venue":null,"work_id":"1f0b27dc-6aae-45f2-b2d5-0f3805c7ee2a","year":2023},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:f5be7c026a3d1928f42574ee9fde429101f3a692321ec5baf8bc668c0724bdc4","observation_id":"64b8c0e7-4a09-4653-af0e-2f894b8b12a4","resolution":{"observed_at":"2026-05-17T11:16:32.243644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03172","last_updated":"2023-11-20T23:09:34Z","snapshot_observed_at":"2026-07-06T15:51:12.179086Z","submitted_at":"2023-07-06T17:54:11Z","title":"Lost in the Middle: How Language Models Use Long Contexts","version":3},"cited_work":{"arxiv_id":"2307.03172","doi":"10.1162/tacl","metadata_source":"pith","pith_arxiv_id":"2307.03172","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Lost in the Middle: How Language Models Use Long Contexts","venue":"cs.CL","work_id":"37c05e13-4a24-44f8-a1c4-da1bbe7223aa","year":2023},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2307.03172","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:97215e31c9e73a446c18084f612f1a3f6fe69178ebaf33d8cc25586ce59fc915","observation_id":"a5fa0aa7-9481-43c1-ae89-56182d47fa58","resolution":{"observed_at":"2026-05-17T11:16:32.097026Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:31:00.140340Z","title":"Constructing a multi-hop qa dataset for comprehensive evaluation of reasoning steps","venue":null,"work_id":"cac81466-30eb-4560-a5c1-1a696f075b48","year":2020},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:2187ad41286a767291bda1a9ada8dc1651d67ceaf9fdd2da130274ad339fec89","observation_id":"570d521e-c74f-4c58-b934-a37305a94e27","resolution":{"observed_at":"2026-05-17T11:16:32.246861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Triviaqa: A large scale distantly supervised challenge dataset for reading comprehension","venue":null,"work_id":"521fd4d8-b2ed-4d58-a825-b1eaa36c640b","year":2017},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:d82931b804bd611759ebd5ca1ccf5a8663c2e277ae82c0fb3f94fa2c7c3835e5","observation_id":"b936adde-37fc-45f8-8b68-46ff94f0b7e9","resolution":{"observed_at":"2026-05-17T11:16:32.249528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14893","last_updated":"2023-06-26T17:59:24Z","snapshot_observed_at":"2026-07-06T15:46:55.111790Z","submitted_at":"2023-06-26T17:59:24Z","title":"LongCoder: A Long-Range Pre-trained Language Model for Code Completion","version":1},"cited_work":{"arxiv_id":"2306.14893","doi":"10.48550/arxiv.2306.14893","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.14893","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Longcoder: A long-range pre-trained language model for code completion","venue":"arXiv (Cornell University)","work_id":"4f1cd69e-bdc1-4030-a4fc-ca9c553ef6b5","year":2023},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2306.14893","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:f54289b2181d90a5397e6ac218ea33e2f31157fbb968dafabb046efdf1417961","observation_id":"2c18b871-6722-4361-a7a5-97b9ec96ced0","resolution":{"observed_at":"2026-05-17T11:16:32.111686Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03091","last_updated":"2023-10-04T01:13:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-05T17:59:41Z","title":"RepoBench: Benchmarking Repository-Level Code Auto-Completion Systems","version":2},"cited_work":{"arxiv_id":"2306.03091","doi":"10.48550/arxiv.2306.03091","metadata_source":"pith","pith_arxiv_id":"2306.03091","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RepoBench: Benchmarking Repository-Level Code Auto-Completion Systems","venue":"cs.CL","work_id":"24b24ba5-b21c-43c6-866f-4b874305372e","year":2023},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"cited_paper":"/paper/2306.03091","citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:c305a3e1b1e437372ddd7e4b6e64baa27258475d7d8582205cb1239cc9e3d2a3","observation_id":"15a10e3a-e594-451f-855f-1642d46a6b6a","resolution":{"observed_at":"2026-05-17T11:16:32.115902Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-21T21:53:10.253516+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T21:53:10.253516+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"unanswerable","venue":null,"work_id":"2e82f48a-3459-42b9-9493-71dfb41696c8","year":null},"citing_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-17T11:16:31.904921Z"},"links":{"citing_paper":"/paper/2407.11550"},"observation_digest":"sha256:26ab5727e9a30c36f40563848f5e995872fd4c4bf90e7fc5950bca09bd5cfd4a","observation_id":"8a53ed5a-b99e-4e70-babd-5adcda5a929c","resolution":{"observed_at":"2026-05-17T11:16:32.129916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","latest_version":5,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":32,"verified_fuzzy":34},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 59 inbound Pith citation observations for arXiv:2407.11550."}