{"as_of":"2026-08-10T21:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1e42db8c6c3747985b87f54fce177fe6c87b02128690e03391db58de0d7de9a0","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T20:53:30.792140Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.08315/citation-record","integrity":"/paper/2509.08315/integrity","json":"/paper/2509.08315/citation-record.json","paper":"/paper/2509.08315"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:26.291319Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:26.291319Z"},"links":{"citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:6b5a6e2c9f7149a1768857e322cdb40b2f80a3bd70b6ce6a3288d038b87d5110","observation_id":"4e95db61-9d48-40b4-87ce-6ed386ad51f7","resolution":{"observed_at":"2026-08-04T20:53:26.291319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:26.358653Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:26.358653Z"},"links":{"citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:23d114dcde15c84fb728db6cc28e8e26bf8490ede6f886daf17f3e511dc1a13e","observation_id":"038f5414-d74b-428b-88ff-b2c5ea509870","resolution":{"observed_at":"2026-08-04T20:53:26.358653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.12673","last_updated":"2020-06-05T14:34:33Z","snapshot_observed_at":"2026-08-10T03:31:42.592098Z","submitted_at":"2020-06-05T14:34:33Z","title":"Genetic Algorithm: Reviews, Implementations, and Applications","version":1},"cited_work":{"arxiv_id":"2007.12673","doi":null,"metadata_source":"pith","pith_arxiv_id":"2007.12673","snapshot_observed_at":"2026-08-04T20:53:32.161016Z","title":"Genetic Algorithm: Reviews, Implementations, and Applications","venue":"cs.OH","work_id":"10b10c6a-2aff-457e-9cc8-83670d7cb04c","year":2020},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:26.518273Z"},"links":{"cited_paper":"/paper/2007.12673","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:003b260e6fd5de9ddb84ced8c229821bd173091c6d48ef18ef00e58a5429fac4","observation_id":"9e27fdca-227a-41f1-882f-7a0ad92a7a99","resolution":{"observed_at":"2026-08-04T20:53:32.231576Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-04T20:53:26.644643Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:26.644643Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:2ec77c65ad4ab935640d1261375416f6089961d7f13c1915444c2b42605ce6f7","observation_id":"593b2dde-4a6e-472f-9c65-39b467271ec6","resolution":{"observed_at":"2026-08-04T20:53:26.644643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-04T20:53:26.772769Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:26.772769Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:d8801d97bc3cad771b9fde851233e18bf5f0ae456e5cbf82397d7e4fa79fb2a5","observation_id":"74b606d7-a608-4507-9008-6a668a2b8a28","resolution":{"observed_at":"2026-08-04T20:53:26.772769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-319-31471-6_9","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Lecture notes in computer science","work_id":"e87e0169-3a10-4e61-be98-6e43e7bc30d1","year":2015},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:26.981819Z"},"links":{"citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:75d3361ce5b3fc2337faa76594d69487bf5c3c7341b04ae91131854e3c39d2b5","observation_id":"806b7f12-12a1-4b0f-a31a-73fabaec4ad6","resolution":{"observed_at":"2026-08-04T20:53:31.588316Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-04T20:53:27.205605Z","title":"Peters, and Arman Cohan","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:27.205605Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:b6d8e9558931b782f2eca4fea998001a546b7fa7035ad65d2647fa5c58e4a894","observation_id":"37e36d34-34d6-458f-b35b-8db03f0729a8","resolution":{"observed_at":"2026-08-04T20:53:27.205605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02069","snapshot_observed_at":"2026-08-04T20:53:27.311694Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:27.311694Z"},"links":{"cited_paper":"/paper/2406.02069","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:c897daa254cc24b65dfd1707c7e3784ab3fa27a2b829b725ca0eeae6d69a0851","observation_id":"ec5e6bb3-5d9a-4eb8-be3f-f54dad7cc057","resolution":{"observed_at":"2026-08-04T20:53:27.311694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.emnlp-main.550","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"94f1ba07-01ac-470c-84d0-83eefe3138c6","year":2023},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:27.372470Z"},"links":{"citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:5217cab83438aa1214c747d51b60aa9e709939114e8ae84b1ab72c7eb4aa0421","observation_id":"8d1def59-fa32-485f-b2c1-cfb3e04dcd89","resolution":{"observed_at":"2026-08-04T20:53:31.437565Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:27.452212Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:27.452212Z"},"links":{"citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:6f87cf53385107b965cc52df6a435e3e50c44f18e203184f127934f01750ef80","observation_id":"9ef49c92-b34f-4faa-9cfa-c4499f9355f9","resolution":{"observed_at":"2026-08-04T20:53:27.452212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.182","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"f3e25dcc-43cb-4b66-92b7-8b669fd0d40a","year":2024},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:27.526927Z"},"links":{"citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:3fab2281b7cce0e8c2d0db34ef2dc8ee614668482570e7bd9dc17ef0cff7dcd2","observation_id":"a2b9a39e-aff6-4078-bc8b-a51f1dffcb31","resolution":{"observed_at":"2026-08-04T20:53:31.302934Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.findings-emnlp.8","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"224a892b-ce1e-4d4c-b6a0-250f2b851a1d","year":2022},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:27.618861Z"},"links":{"citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:8537631980df31cde0011d6ef3260bb17a44b346612e6cb8f53af3f50a674c2b","observation_id":"227e76f9-5a1e-42ce-a729-3f38e495cddf","resolution":{"observed_at":"2026-08-04T20:53:31.172668Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T19:46:04.857927Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-04T20:53:27.664702Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:27.664702Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:d2fc8afe2462c950864a1a0e00a9a2250419c6ed016b7ef6a77f4e8713794642","observation_id":"dc81beab-0131-4406-a83d-f52ac40a97be","resolution":{"observed_at":"2026-08-04T20:53:27.664702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-04T20:53:27.718150Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:27.718150Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:4ee259beecc4d50e28c6eccdfa22e0075281bfa8f9701da7d9b43bb55f34a3f1","observation_id":"b2a0d275-84b9-494b-a5c7-97df1e1d456b","resolution":{"observed_at":"2026-08-04T20:53:27.718150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14135","snapshot_observed_at":"2026-08-04T20:53:27.863745Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:27.863745Z"},"links":{"cited_paper":"/paper/2205.14135","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:2485afee693daef91ae99f9d5963cef836102e6d49073e8ac9dacc8e006000a0","observation_id":"b2669a8f-751b-4fc0-8631-0cfca693f10f","resolution":{"observed_at":"2026-08-04T20:53:27.863745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.03011","last_updated":"2021-05-07T00:12:34Z","snapshot_observed_at":"2026-08-05T23:00:05.031488Z","submitted_at":"2021-05-07T00:12:34Z","title":"A Dataset of Information-Seeking Questions and Answers Anchored in Research Papers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.03011","snapshot_observed_at":"2026-08-04T20:53:27.975894Z","title":"Smith, and Matt Gardner","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:27.975894Z"},"links":{"cited_paper":"/paper/2105.03011","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:d7dcdbcacc164e5139b26124fa863e51d41b1db5771d4a68f5c619b58ff5adf3","observation_id":"97110207-a1d0-4143-a3e6-5a3e99adea6f","resolution":{"observed_at":"2026-08-04T20:53:27.975894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:28.025096Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:28.025096Z"},"links":{"citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:2f6b24ff92c6f65682587c00c21f5c49748d025dfaf708dd62c7984ba98d43e0","observation_id":"d479713b-ab9a-4d4a-af37-fc942267fce2","resolution":{"observed_at":"2026-08-04T20:53:28.025096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-04T20:53:28.117122Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:28.117122Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:acee69ce09069cc3c25cfa37334cc372475de3d8a1e244f00f2d2294b754ce12","observation_id":"89d44375-6ca3-4c16-b863-3d71f108746a","resolution":{"observed_at":"2026-08-04T20:53:28.117122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:28.177042Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:28.177042Z"},"links":{"citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:a28eaf112cbc4ca5b081e329924332bb5c72b0cdfff542e11865b5a2e21d7395","observation_id":"ffd10026-e907-405f-b4ef-93185d0e7f7b","resolution":{"observed_at":"2026-08-04T20:53:28.177042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-04T20:53:28.280449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:28.280449Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:d8eaf7fc800cb5d25af908b6e9eb75be9105dcce4356529da65eb0df672871fb","observation_id":"25f304d6-cb41-4a7e-b292-c6c5c8907899","resolution":{"observed_at":"2026-08-04T20:53:28.280449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14893","last_updated":"2023-06-26T17:59:24Z","snapshot_observed_at":"2026-07-06T15:46:55.111790Z","submitted_at":"2023-06-26T17:59:24Z","title":"LongCoder: A Long-Range Pre-trained Language Model for Code Completion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14893","snapshot_observed_at":"2026-08-04T20:53:28.374598Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:28.374598Z"},"links":{"cited_paper":"/paper/2306.14893","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:2efbad15f1225ddd0d05fb7167cb329fe1feaea47a6d8c77f62a55927857321c","observation_id":"cce07c45-05bf-4860-8809-92152efa642c","resolution":{"observed_at":"2026-08-04T20:53:28.374598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:28.492763Z","title":"Müller, and Petros Koumoutsakos","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:28.492763Z"},"links":{"citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:03255e7594b95f6b5ce3d35eab942120d4b69241044b69c0d8de50e9959db5b2","observation_id":"c7da493d-c064-4e38-aab2-bb054bd88822","resolution":{"observed_at":"2026-08-04T20:53:28.492763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-08-04T20:53:28.604509Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:28.604509Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:d98cf751ae6c9b359f5b0dfcff979d837591187957f575f15f47a5ce329bd750","observation_id":"88d67d04-10e9-4b9e-91fb-5cbfd1af2c05","resolution":{"observed_at":"2026-08-04T20:53:28.604509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:28.708057Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:28.708057Z"},"links":{"citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:2672e94288b9cb533f0c84fc3cb469d70c0614a3b549aea8eceffd6f806c0de7","observation_id":"02bce1f9-b549-4454-89d1-0fae7b300aff","resolution":{"observed_at":"2026-08-04T20:53:28.708057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-08-10T09:20:57.804343Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-04T20:53:28.828244Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:28.828244Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:15367dcb156db44574f4144c1ca6ea9c005eaae012d58fedb63a8d3f3c62408c","observation_id":"2aa56bfe-9d3d-4cfb-8a1b-2fa388d93e0b","resolution":{"observed_at":"2026-08-04T20:53:28.828244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:29.006808Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:29.006808Z"},"links":{"citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:467ab48ba3810a2dd89220f95461cf3eb26494e9e095365896e0245604a0c012","observation_id":"dd278312-35d1-4ccc-a742-c2ccea7cd444","resolution":{"observed_at":"2026-08-04T20:53:29.006808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.02112","last_updated":"2021-04-11T21:04:26Z","snapshot_observed_at":"2026-08-07T06:17:18.648613Z","submitted_at":"2021-04-05T18:45:13Z","title":"Efficient Attentions for Long Document Summarization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.02112","snapshot_observed_at":"2026-08-04T20:53:29.091290Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:29.091290Z"},"links":{"cited_paper":"/paper/2104.02112","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:c0d1d3973a12ea578b674c79d4206616fd9b4cfab0ba058a52f1a815ce2e118c","observation_id":"3cf5adb1-59b7-46cb-b6ee-be469b6c2134","resolution":{"observed_at":"2026-08-04T20:53:29.091290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-04T20:53:29.222206Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:29.222206Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:112ab218d170f326673cfa3d5bca99715a45597a7aae37639d7ac81677ee1a67","observation_id":"1f9b3a52-e930-4d2c-88a6-387b61f4d6e5","resolution":{"observed_at":"2026-08-04T20:53:29.222206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:29.329672Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:29.329672Z"},"links":{"citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:9685068ef2e10372292ae0bb08d1d95ccf98a5b856ec618a069f163263adf5f7","observation_id":"3aff6643-38d1-4803-a35e-cdf8c451fdf9","resolution":{"observed_at":"2026-08-04T20:53:29.329672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:29.384326Z","title":"Kennedy and R","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:29.384326Z"},"links":{"citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:a3f6229c47e064ab81089951caf323a4762cbd16b58c8608414951bff54adfc9","observation_id":"28bc5f7d-8fc1-495e-87c5-bde3063a1d2b","resolution":{"observed_at":"2026-08-04T20:53:29.384326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:32.675629Z","title":null,"venue":null,"work_id":"52878237-e940-4b86-a3b7-8b64a7ab0fba","year":1992},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:29.443038Z"},"links":{"citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:b316557d8658c2b92eaeb480ee42c933133f2deabec1db0d25d56206caa04c6a","observation_id":"217b08b5-b4f7-47c9-acf3-a86a751fc34e","resolution":{"observed_at":"2026-08-04T20:53:32.773075Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.07040","last_updated":"2017-12-19T16:48:05Z","snapshot_observed_at":"2026-07-31T01:20:29.856066Z","submitted_at":"2017-12-19T16:48:05Z","title":"The NarrativeQA Reading Comprehension Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.07040","snapshot_observed_at":"2026-08-04T20:53:29.536470Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:29.536470Z"},"links":{"cited_paper":"/paper/1712.07040","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:61032303656bff72734314bf5b4594a6fcaa1d1cf4011f992fa6974e16923410","observation_id":"710b9a84-f8e7-4dee-b917-7c5ebf46d614","resolution":{"observed_at":"2026-08-04T20:53:29.536470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:32.493148Z","title":null,"venue":null,"work_id":"eacdec46-a750-47ea-8595-7397a3187c6f","year":2002},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:29.595373Z"},"links":{"citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:1c43c50c8d3e795b566c58418b1833dc322442f544bd4dc67fd73b995ce815b2","observation_id":"007b7138-efe7-469d-a343-b3a8c91df1dc","resolution":{"observed_at":"2026-08-04T20:53:32.569127Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-07T22:57:56.263839Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-08-04T20:53:29.655289Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:29.655289Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:676b92d7152936f32a89533ac0bb25ad91c2943137a80662197d34043c45a114","observation_id":"a721037a-51e1-4aea-bf3e-cc4a3655fb36","resolution":{"observed_at":"2026-08-04T20:53:29.655289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03091","last_updated":"2023-10-04T01:13:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-05T17:59:41Z","title":"RepoBench: Benchmarking Repository-Level Code Auto-Completion Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03091","snapshot_observed_at":"2026-08-04T20:53:29.703129Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:29.703129Z"},"links":{"cited_paper":"/paper/2306.03091","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:e42b760a0d9f3e59650fce9c798446c757856d6db483011afc85bc06207cb60e","observation_id":"620f96f9-9081-457b-90e4-5d9cb31461cb","resolution":{"observed_at":"2026-08-04T20:53:29.703129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17118","last_updated":"2023-08-28T22:48:46Z","snapshot_observed_at":"2026-08-01T09:57:16.282788Z","submitted_at":"2023-05-26T17:39:58Z","title":"Scissorhands: Exploiting the Persistence of Importance Hypothesis for LLM KV Cache Compression at Test Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17118","snapshot_observed_at":"2026-08-04T20:53:29.751152Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:29.751152Z"},"links":{"cited_paper":"/paper/2305.17118","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:37bcd21745dcc452cafa39d2de1d2293ac0e1f8166ca4a7aa320d16e3e8ff77a","observation_id":"11cc42c4-5729-4e86-9a55-7f13fbb5c03b","resolution":{"observed_at":"2026-08-04T20:53:29.751152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19173","last_updated":"2024-02-29T13:53:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T13:53:35Z","title":"StarCoder 2 and The Stack v2: The Next Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19173","snapshot_observed_at":"2026-08-04T20:53:29.804774Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:29.804774Z"},"links":{"cited_paper":"/paper/2402.19173","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:5866b6156ceb3979b22428d7860ca97a995c489bc9f3512fdab25de5d6f2c0d5","observation_id":"85e4721f-70b0-40ec-9c85-57f601f6a962","resolution":{"observed_at":"2026-08-04T20:53:29.804774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-04T20:53:29.842871Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:29.842871Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:ce35c189eef29989dd66a4d305c19551b13494da9695ea49cf2711ac3992dfac","observation_id":"3881c240-8c37-4ffd-86b0-e6b050091b4c","resolution":{"observed_at":"2026-08-04T20:53:29.842871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:29.906574Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:29.906574Z"},"links":{"citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:d20541c0f669ce618c21f1d4dbafcd066ad113b78ff0e039fced1f7f9b9728b8","observation_id":"f833dff9-0183-4bd6-ac51-7b99147bfd01","resolution":{"observed_at":"2026-08-04T20:53:29.906574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.06991","last_updated":"2023-04-26T15:27:35Z","snapshot_observed_at":"2026-08-07T08:09:12.822364Z","submitted_at":"2022-07-14T15:20:36Z","title":"Language Modelling with Pixels","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.06991","snapshot_observed_at":"2026-08-04T20:53:29.956650Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:29.956650Z"},"links":{"cited_paper":"/paper/2207.06991","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:fc6d6378143217f1f740f8f867bb992f1b9600c8934683d3da89a17fc29c1ac9","observation_id":"a2ab1ab1-e008-4d84-959a-dbcb3bf958eb","resolution":{"observed_at":"2026-08-04T20:53:29.956650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:32.306796Z","title":"Fu, Zhiqiang Xie, Beidi Chen, Clark W","venue":null,"work_id":"e33dac3c-2b4b-4fdf-b113-5feb5c8d89ef","year":2023},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:30.052751Z"},"links":{"citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:219afe84161aec51ab7a37ff577bb1504e9d8c665de09e456b89f72fc0d5530f","observation_id":"411d3c69-623e-4cf4-a814-2ca78ee496be","resolution":{"observed_at":"2026-08-04T20:53:32.356461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18003","last_updated":"2024-11-20T02:04:10Z","snapshot_observed_at":"2026-07-06T18:51:49.871551Z","submitted_at":"2024-07-25T12:56:22Z","title":"Keep the Cost Down: A Review on Methods to Optimize LLM' s KV-Cache Consumption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18003","snapshot_observed_at":"2026-08-04T20:53:30.115688Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:30.115688Z"},"links":{"cited_paper":"/paper/2407.18003","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:4d2ed8f25ce69155bc20682dfe3e5f31ff36ad8682a434f0e1edf6f63f36486d","observation_id":"64453fe3-4c28-4191-8b70-bc5a7136d4cb","resolution":{"observed_at":"2026-08-04T20:53:30.115688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02013","last_updated":"2025-06-15T18:27:17Z","snapshot_observed_at":"2026-08-01T16:50:50.645857Z","submitted_at":"2025-02-04T05:03:42Z","title":"Layer by Layer: Uncovering Hidden Representations in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02013","snapshot_observed_at":"2026-08-04T20:53:30.156275Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:30.156275Z"},"links":{"cited_paper":"/paper/2502.02013","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:393ac587bf564ede44c06ccbd42955302023979be0b5274564b4d00aaef7f9ad","observation_id":"d8738f86-aa29-4df8-809c-ad338e73fd5c","resolution":{"observed_at":"2026-08-04T20:53:30.156275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:53:30.208315Z","title":null,"venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:30.208315Z"},"links":{"citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:446f5510a54096c06522a860be9649248f002ac4ba4092f465f2c333c8b1dfc7","observation_id":"4c26b3d9-2503-4607-9a8c-225d265e964c","resolution":{"observed_at":"2026-08-04T20:53:30.208315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-04T20:53:30.257649Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:30.257649Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:f51d83e2b5544cc6744e3ab7f4a96ac001a567390031f5431d58aa7b43ea4231","observation_id":"2fb67ddc-9f16-427a-8fe6-591cdc4b8232","resolution":{"observed_at":"2026-08-04T20:53:30.257649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.00573","last_updated":"2022-05-05T05:50:50Z","snapshot_observed_at":"2026-08-05T14:23:49.315145Z","submitted_at":"2021-08-02T00:33:27Z","title":"MuSiQue: Multihop Questions via Single-hop Question Composition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.00573","snapshot_observed_at":"2026-08-04T20:53:30.299251Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:30.299251Z"},"links":{"cited_paper":"/paper/2108.00573","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:1d2b89edaa3ff659eef9d9fc82fa383f4ae158b4ad9322688b3895c142f7eaec","observation_id":"8264b62f-82ed-4454-8939-f2b0d50d5de0","resolution":{"observed_at":"2026-08-04T20:53:30.299251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/fedr.19750860506","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Feddes Repertorium","work_id":"580cdb83-e123-401a-95dd-c6a62a99d498","year":1975},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:30.361487Z"},"links":{"citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:07e152968af27e7b74ee3fc8d41cb8fe5e2ec9f63a2794d4655995430f0f3a22","observation_id":"514806e7-e6b7-442c-8cc4-2365e51547d8","resolution":{"observed_at":"2026-08-04T20:53:31.024481Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.03803","last_updated":"2020-11-07T16:31:45Z","snapshot_observed_at":"2026-08-03T20:42:05.538475Z","submitted_at":"2020-11-07T16:31:45Z","title":"Rethinking the Value of Transformer Components","version":1},"cited_work":{"arxiv_id":"2011.03803","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.03803","snapshot_observed_at":"2026-08-04T20:53:31.725980Z","title":"Rethinking the Value of Transformer Components","venue":"cs.CL","work_id":"dc58388f-5b3c-4c30-8d8d-70b0fce6f761","year":2020},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:30.417248Z"},"links":{"cited_paper":"/paper/2011.03803","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:e685b9c510066216d6efe35d9ddd04bcf0e63f908d8d44303a3ea439a83f7dca","observation_id":"118dd673-bb33-4469-9a45-f1d5d9bf49c2","resolution":{"observed_at":"2026-08-04T20:53:31.795752Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-04T20:53:30.488876Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:30.488876Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:f63a9c778a92a3d25ed9e3117d6f474b29f20c4f75fc29b23861d3062f23f8ed","observation_id":"e9f72f18-0519-4052-abec-3a59ada6d253","resolution":{"observed_at":"2026-08-04T20:53:30.488876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-10T10:11:00.171926Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-08-04T20:53:30.523155Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:30.523155Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:cc6287b7501c1d3985ebf905d5ee3e973866f5689c51f30a26644ee2a5b71cb2","observation_id":"9ac1f9ac-caa9-43a1-85fd-33854434a692","resolution":{"observed_at":"2026-08-04T20:53:30.523155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-08-09T10:11:58.541007Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-04T20:53:30.564217Z","title":"Cohen, Ruslan Salakhutdinov, and Christopher D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:30.564217Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:c8212413ecef7f26284c181c84f3924fcde85c92dabdf9ba52e76f9f4e8f1af3","observation_id":"03a53764-862b-4270-90a3-bc611a1c7698","resolution":{"observed_at":"2026-08-04T20:53:30.564217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14381","last_updated":"2024-09-22T09:53:13Z","snapshot_observed_at":"2026-07-06T19:19:24.759288Z","submitted_at":"2024-09-22T09:53:13Z","title":"Investigating Layer Importance in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14381","snapshot_observed_at":"2026-08-04T20:53:30.630054Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:30.630054Z"},"links":{"cited_paper":"/paper/2409.14381","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:fd47a9c4196fda82390a633c4e2661d31dda1a86c2ade9ece8bf2c614aa62134","observation_id":"acec151c-263f-4e90-81a4-32562f1924b2","resolution":{"observed_at":"2026-08-04T20:53:30.630054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-08-06T19:19:02.165567Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14048","snapshot_observed_at":"2026-08-04T20:53:30.705096Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:30.705096Z"},"links":{"cited_paper":"/paper/2306.14048","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:6ac8ac85cb23dff150ec89fae4edd4aaab07debeac37228205d6f88541c73af5","observation_id":"451a3792-123c-43ed-b4ce-a1a3e8bebde6","resolution":{"observed_at":"2026-08-04T20:53:30.705096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.05938","last_updated":"2021-04-13T05:00:35Z","snapshot_observed_at":"2026-08-08T14:49:34.085953Z","submitted_at":"2021-04-13T05:00:35Z","title":"QMSum: A New Benchmark for Query-based Multi-domain Meeting Summarization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.05938","snapshot_observed_at":"2026-08-04T20:53:30.792140Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-04T20:53:30.792140Z"},"links":{"cited_paper":"/paper/2104.05938","citing_paper":"/paper/2509.08315"},"observation_digest":"sha256:342a08c59a1d4735c122ca816fc9a694a0418e18615c7d583eb1c884eba7b25d","observation_id":"e4422975-3d6f-4edc-a58b-11aa2d9e8ac6","resolution":{"observed_at":"2026-08-04T20:53:30.792140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.08315","last_updated":"2025-09-10T06:32:49Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T03:09:32.640766Z","submitted_at":"2025-09-10T06:32:49Z","title":"EvolKV: Evolutionary KV Cache Compression for LLM Inference"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":7,"verified_fuzzy":1},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2509.08315."}