{"as_of":"2026-08-07T09:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:85129b846a7132442d3a3ef6879b50b710a436ebf4a8dea5a378132af103324a","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T17:54:40.241144Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.01237/citation-record","integrity":"/paper/2607.01237/integrity","json":"/paper/2607.01237/citation-record.json","paper":"/paper/2607.01237"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:4a3beac3196e296b5213da3938b9edebd894aa827684d2c729151a7f871751dd","observation_id":"80d8136a-b205-4969-8543-214a27830729","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:330d6cc2a83e35fcf3429f8eb51bfc297ca760dfb38c47569fb987623bfe2b5f","observation_id":"8fec53c5-7593-415f-8f71-ab3edcf77ef2","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:8e2be829583295acc767e0ca7bb580d097e0914adc1b5c92288199d295fea12c","observation_id":"6e18fe63-e85f-441f-9519-2d6d0825cebf","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"CRANE: Reasoning with constrained LLM generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:aad72f6749fbd9fc2a2ae718d450d22a29d919239c0209a3b826e6700fe49630","observation_id":"0b339e05-75aa-4724-ab84-c3047cb81653","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19442","last_updated":"2025-07-30T05:24:46Z","snapshot_observed_at":"2026-08-07T06:25:14.802049Z","submitted_at":"2024-12-27T04:17:57Z","title":"A Survey on Large Language Model Acceleration based on KV Cache Management","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19442","snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"A survey on large language model acceleration based on kv cache management.arXiv preprint arXiv:2412.19442, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"cited_paper":"/paper/2412.19442","citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:7079f94b00c6f8cdd09430bae21551d424ccbcab464c0af2ed4221f2a771f923","observation_id":"3d897440-0980-48d5-b75b-aac80246a55d","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"Llm inference unveiled: Survey and roofline model insights.arXiv preprint arXiv:2402.16363, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:96f546b5de85e5a91b50221be8d527682282137b820a1dfdef4a7664b6b6d9a1","observation_id":"335dbaa4-29f2-468a-a406-8b2e36a447af","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"R-KV: Redundancy-aware KV cache compression for reasoning models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:356b5260a2f36a6a22024e45448260561a562e99b9820fd4fa33b5852fb2ab65","observation_id":"d93f3c0a-8555-47ff-9b4b-af02c91d07da","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"Ada-KV: Optimizing KV cache eviction by adaptive budget allocation for efficient LLM inference","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:b5572acccd92a9a61ffdb970d8f750fa40f680788210163e3da88e7c049ef859","observation_id":"d2a3af9d-b160-416e-868d-1f48e120884f","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"SnapKV: LLM knows what you are looking for before generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:19199ff8ffd3bc42d029452edc29bca2fe1812f503b60615a8be3ec4b043137f","observation_id":"ed5bee5c-3c90-41b8-8291-083765bb628b","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"KV cache compression, but what must we give in return? a comprehensive benchmark of long context capable approaches","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:0373a9df657f4fe8604eafc49a4c9d012bc129b979c80d924c0b6937d1b73223","observation_id":"63c4c100-f793-4e9f-af04-8c88ccf4e9cc","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:dc9f19c2ee9c2a444bb39d064c7b5cb2f6ca00be4d38cc366688220497893bb9","observation_id":"3345f60f-9dc5-4f5d-b6ab-8de28f5de93c","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"Beyond text-visual attention: Exploiting visual cues for effective token pruning in vlms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:de980b35bed6685251d6ac7f6a0adbd168b3b3f99eeb47851d769191c98f0b3e","observation_id":"1e478993-cd24-4aeb-8541-ed3bd8c5c5a2","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"Inference-time hyper-scaling with KV cache compression","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:f78a43369f5f17f62bbedb564e5e650325f9fbcbb3f4e8a3b9ce284c9bff4a87","observation_id":"5116eaeb-bf7c-4fb6-a92e-60434d4dc6db","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"Lee, Sangdoo Yun, and Hyun Oh Song","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:73faf399fce85a255119e8fa67099b5983d77b6da3882bb9c3403399d353a40c","observation_id":"15b06e5f-d426-4701-94ad-eeb15ebfaef3","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"Expected attention: Kv cache compres- sion by estimating attention from future queries distribution.arXiv preprint arXiv:2510.00636, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:171b43792317bb5f9a6342b0979b4a53679927d06450b9e33643b103165ccfb0","observation_id":"82ceb0a5-06db-4e0d-ac3e-37b2dc3541f5","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:88a9d2945f87105ddcc4de479112615455ef18786fa7de90ebb9001de50de856","observation_id":"dbbab5dc-b0d4-4e5d-b221-7b9f76b6d62d","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"Criticbench: Benchmarking llms for critique-correct reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:248409c8150659cd5efe65309fa00c7422cdf20cf18f1e1ba016f7400014813a","observation_id":"0bfc3dce-0fec-4c44-8810-353f7a78a7c8","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:850c41999e0bda36873437cb1bfd63971da9c564b1e41d6b1fa497d661d49e10","observation_id":"5d8bc600-dc96-494d-a2ee-bfcfe26830aa","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"ChunkKV: Semantic-preserving KV cache compression for efficient long-context LLM inference","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:a21f595f95769f001f25e699d62c61fdbf135a35ac1e371e5f6a72c05ea1b039","observation_id":"5fb4f415-7e74-4c7d-a47f-539e634a7b93","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"Efficient many- shot in-context learning with dynamic block-sparse attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:fdcc89eb80af8d91e18f339cc7ccc7c5aa2ca095adaf48cc354c9a88be29e49a","observation_id":"e30c151d-eb63-4b81-ac4c-b5860959317a","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"ThinKV: Thought-adaptive KV cache compression for efficient reasoning models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:ed5a0232579828a09150b074d798ce31da28aa9bb7e66390197c7c5294c77ac7","observation_id":"c9e6893b-1cfb-4058-aa25-7a2a7c835586","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"QuoKA: Query-oriented KV selection for efficient LLM prefill","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:841943fde044966baadcfdf4f18c06e969da78d430f364b18c13c67834d17864","observation_id":"750fa320-e1a8-478d-8bcc-4bb9ce9bc88a","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"Icecache: Memory-efficient KV-cache management for long-sequence LLMs","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:4b262a7357668ea55fa34a8aee925752f06df9ea8d6172daf5f33980d589a610","observation_id":"79c718dc-7f54-45a4-9361-af01cab2e35c","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"Cache what lasts: Token retention for memory-bounded KV cache in LLMs","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:b3d7ffe11392a67e34d5eb01e481745df3ec9d0b5e3a15e628f6edbcc447d9a3","observation_id":"b5a24779-c8b7-4b78-82f7-9a24bd5cb16e","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"Keydiff: Key similarity-based KV cache eviction for long-context LLM inference in resource-constrained environments","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:664e8007926566056e205f66da2b36fd5267c54af391b5eb1e1b95e950ee28cb","observation_id":"999036f9-037c-43e6-8e96-5112f799346d","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"Spargeattention: Accurate and training-free sparse attention accelerating any model inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:23e39a386f6ff7ed7c4ec164f1965512c8438950a6cbc6eace04c829fd0d71ee","observation_id":"3e383c10-4093-4d2f-8011-0cbb4b6de5a3","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"MoBA: Mixture of block attention for long-context LLMs","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:1a451ef2bdbb0eeb763c638fc680308fce9b5589b3c605337a1b3cb73e43ccef","observation_id":"677ab63c-0793-4954-88c1-c2af34493308","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"Twilight: Adaptive attention sparsity with hierarchical top-$p$ pruning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:fb91650c20ba72822ef9049f00663ef62a0cc7fa17055d62b6081d8b3f9a5bea","observation_id":"c0eeae7f-99e4-49bf-9d91-04e44b6701e9","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"Xattention: Block sparse attention with antidiagonal scoring","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:2b1936ae7ab2e57199dabb47bd172b9d5b957ef0272e248affccb6aa9ba0119f","observation_id":"118e17f8-1133-4b77-82f2-038bbc8cab5a","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"Efficient attention mechanisms for large language models: A survey.arXiv preprint arXiv:2507.19595, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:b94f276af322532cdc25060e19fb70a7e0817ad83f056c296306c4b5f59e13bc","observation_id":"ee3d6372-d41e-40d7-9753-1b6458120aa0","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"Deepseek-v4: Towards highly efficient million-token context intelligence, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:54a417389b3a4bd8e4997cb20a1c8866020c17a26e83d5cd0ae2dfeb169e4495","observation_id":"76cad784-ca42-43f8-9b26-23cd6d04ee87","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24432","last_updated":"2026-04-27T12:59:53Z","snapshot_observed_at":"2026-07-06T23:10:29.508602Z","submitted_at":"2026-04-27T12:59:53Z","title":"Kwai Summary Attention Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.24432","snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"Kwai summary attention technical report.arXiv preprint arXiv:2604.24432, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"cited_paper":"/paper/2604.24432","citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:9bd0619a0182e4f0153750187355115b86fbef44b043f86c641507cf5cfb51eb","observation_id":"028e36d6-ed91-4bc3-bfb8-bbc1187b1239","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"Where does in-context learning \\\\ happen in large language models? InThe Thirty-eighth Annual Conference on Neural Information Processing Systems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:50657d281b970bb37ef3a0542f1338b9719fe6348033918a53ef5aa8b1a56af6","observation_id":"b312c64b-aaae-4a59-baf1-cb57768ac2b7","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:53420c4fb275af7a953e9458ee62dc838962c266409aa60fe13fbe06de712047","observation_id":"10ac2138-1f68-4805-a52e-61ab2333a2f0","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"A survey on large language model acceleration based on KV cache management.Transactions on Machine Learning Research, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:3df9dc74037f35ecb0daee2d482ee863300a6c1b20a7473532341ffe260db89c","observation_id":"d48e8749-ea35-4244-969d-1251a3e85bb6","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"Gonzalez, Clark Barrett, and Ying Sheng","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:dff2e239179a1191504c9fc2bbe565dbb574020cd09393a78c67b17d27374e5b","observation_id":"a7cc8594-c288-4b44-9823-d51196e2b317","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:d11c4e50dc33adfb80b749a7d2997e4beef58f9e82da6888e753c83b324a3761","observation_id":"dd657f61-0eb9-4b77-b823-fa4fdc01e8bc","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"CAKE: Cascading and adaptive KV cache eviction with layer preferences","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:3d0922159be8db0c4528d6df2e1db73cf938574e9cbcdb361a7985e9dea809ff","observation_id":"d94c1bf0-fc2c-4c66-9078-7f105845093d","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"American invitational mathematics examination (aime) 2024, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:2cc614a2a70b817799bd9abda0d62271ccfaa8f151193a48783bc50e80bf09d1","observation_id":"4c5d13d9-9675-4c0a-b820-c72e1fc49d62","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02069","snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"Pyramidkv: Dynamic kv cache compression based on pyramidal information funneling.arXiv preprint arXiv:2406.02069, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"cited_paper":"/paper/2406.02069","citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:895434fc126fdf39c6b14eee87acfefee6aeec80fdace33ff820f44edebb85fb","observation_id":"1a37132e-3a93-4810-8d07-c4668696b1d5","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T17:54:40.241144Z","title":"Data engineering for scaling language models to 128k context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-12T17:54:40.241144Z"},"links":{"citing_paper":"/paper/2607.01237"},"observation_digest":"sha256:6f56b32c2eda465996868189877b535aa03c0acb7c9e410d7efa3d29b6d07775","observation_id":"2edd8f80-9b6d-4e67-86f7-278ed53eb693","resolution":{"observed_at":"2026-07-12T17:54:40.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.01237","last_updated":"2026-07-03T02:55:22Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-01T23:58:30.893639Z","submitted_at":"2026-05-01T15:54:13Z","title":"KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2607.01237."}