{"as_of":"2026-08-08T21:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:996105bacea8e220071a3d5104ecbbe38e75ba40edad55a0a480b5f504738b85","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T04:58:48.072701Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.22389/citation-record","integrity":"/paper/2607.22389/integrity","json":"/paper/2607.22389/citation-record.json","paper":"/paper/2607.22389"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-01T04:58:41.116950Z","title":"Mistral 7b,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:41.116950Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:0fe995504815cf1773043a8db2912f83ae2c0442ca76711e7764a99180a6b80c","observation_id":"4a5eb13f-1a44-446a-a3a8-4ad8c73ae0c6","resolution":{"observed_at":"2026-08-01T04:58:41.116950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-01T04:58:41.221977Z","title":"Qwen2 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:41.221977Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:5e5d9e8a297094fd9ee42b51d35ab476008b00b426402bb447cc73a881f77935","observation_id":"d393a459-3d3a-45d5-8569-c0bd97478b75","resolution":{"observed_at":"2026-08-01T04:58:41.221977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:41.318115Z","title":"Llama 3 model card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:41.318115Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:1564eabf657b97a6e01a263205661f465d33c03ece8451d4ce97f02cb6d25c03","observation_id":"b9b2bd9c-f749-42eb-9cb7-980212cc8ceb","resolution":{"observed_at":"2026-08-01T04:58:41.318115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:41.469197Z","title":"How long can context length of open-source llms truly promise?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:41.469197Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:8085b642b207dd405b89ace9736f2a7cae58718b645457de572a077d682b477b","observation_id":"da7909b2-9490-49a6-86de-26876e8dbc64","resolution":{"observed_at":"2026-08-01T04:58:41.469197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:41.553081Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:41.553081Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:2977532506a2ce8158157f42f610a36189077814d0cb40a7c4fef0ecd75edb6d","observation_id":"aa6817ee-8830-46ac-a1cf-e0de2eed627d","resolution":{"observed_at":"2026-08-01T04:58:41.553081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:41.719217Z","title":"Mathcoder: Seamless code integration in llms for enhanced mathematical reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:41.719217Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:069030b16706ac3069ecb3c6907981f4dd9c06a93f6122840f47dda43f2e81c4","observation_id":"a9d9bc7c-6939-467d-bd4f-49f6c3eb6c83","resolution":{"observed_at":"2026-08-01T04:58:41.719217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:41.837251Z","title":"Longbench: A bilingual, multitask benchmark for long context understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:41.837251Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:07add6b0b2a70b3b2a49249a5685e7886fcc3626baabbb6148690d446db9a795","observation_id":"265aae74-fe63-4ce2-bff8-76c421346c67","resolution":{"observed_at":"2026-08-01T04:58:41.837251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:41.915830Z","title":"P3-llm: An integrated npu-pim accelerator for llm inference using hybrid numerical formats,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:41.915830Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:d0a932ddc6f58a4fb72bfd24598f206144604bb04b289b2cd16a8d991800af53","observation_id":"b66a1dd3-0fe1-46a0-9064-8ec084fbd602","resolution":{"observed_at":"2026-08-01T04:58:41.915830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:42.060439Z","title":"A survey on large language model acceleration based on kv cache management,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:42.060439Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:e33340849208175052322ec5e8e2980741e3be95a428d006e54c3dd131e0b394","observation_id":"64458efa-d583-4833-b270-826b924a6558","resolution":{"observed_at":"2026-08-01T04:58:42.060439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:42.210027Z","title":"Codec: Prefix-shared decoding kernel for llms,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:42.210027Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:ae2d4916dd568d105be8a1777d5df9686fcd07d806e0477f7deec82c1ad7e78c","observation_id":"1efbd9f7-260f-488c-b7d1-d0c26ae5ee0b","resolution":{"observed_at":"2026-08-01T04:58:42.210027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:42.300437Z","title":"Orca: A distributed serving system for transformer- based generative models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:42.300437Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:7dd94add3f7d9c8d442037d0b90bf177f2e1584d15423b766a1ae6b458b1faf2","observation_id":"d7ddd9b6-e43d-45d6-aeea-f49e8bbffe2f","resolution":{"observed_at":"2026-08-01T04:58:42.300437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:42.410203Z","title":"Splitwise: Efficient generative llm inference using phase splitting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:42.410203Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:9570545fe20cd6e7aeacdff69846c863d490330b2f9822ec95023a7fe5f98ad9","observation_id":"f2bc9d2b-61b4-461b-8350-8052822ef91a","resolution":{"observed_at":"2026-08-01T04:58:42.410203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:42.511116Z","title":"Kivi: A tuning-free asymmetric 2bit quantization for kv cache,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:42.511116Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:cda14e8e3e4699755eed189fac3379732b81702f509395351ccd1c51b9d858eb","observation_id":"91226077-408b-4a62-8895-c59e6dead0e7","resolution":{"observed_at":"2026-08-01T04:58:42.511116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:42.619086Z","title":"Efficient streaming language models with attention sinks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:42.619086Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:aa4e6fedbd60e4f0846a616a7afaa2506f0a5a0f74539efd449f48325c8cfab5","observation_id":"9444d6e0-37ff-4da2-b119-2d5ac9ffbcad","resolution":{"observed_at":"2026-08-01T04:58:42.619086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:42.712200Z","title":"Duoattention: Efficient long-context llm inference with retrieval and streaming heads,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:42.712200Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:34366b45ea9243169f6e3100cceef4c43ed2fe4e648a4f3cd1918c882714c304","observation_id":"64b35529-fa0f-45f7-9700-bc509221e412","resolution":{"observed_at":"2026-08-01T04:58:42.712200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:42.821069Z","title":"Snapkv: Llm knows what you are looking for before gener- ation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:42.821069Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:c901d9d6c1fc05355408e890dc512f4848834b343cfdfe105e709ba3bcbbcba7","observation_id":"17e9a2ab-f619-4ccc-8439-672908bf54cf","resolution":{"observed_at":"2026-08-01T04:58:42.821069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:42.925778Z","title":"Sepllm: Accelerate large language models by com- pressing one segment into one separator,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:42.925778Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:c4f4d873aa2e7782cbd602ea27786e26cb8e1bb6060af8c2cb596edbe08f1ea4","observation_id":"f01aef9d-f544-4f9e-81b1-22137343fa9d","resolution":{"observed_at":"2026-08-01T04:58:42.925778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:42.999165Z","title":"Lm-infinite: Zero-shot extreme length generalization for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:42.999165Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:bbee0d8ccce3ce97e946f41c113869df17e85bc029e16d45fae78bc9cb9d9d53","observation_id":"71c03b91-62dc-4df3-88b6-452aaa2d9d7b","resolution":{"observed_at":"2026-08-01T04:58:42.999165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-01T04:58:43.070342Z","title":"Longformer: The long-document transformer,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:43.070342Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:c74aac908a7ddcb2e6d6f9871bb319054385ecaa343a0fe9160d933632a53c8d","observation_id":"9f39ce39-6cc0-495b-966b-d541fcf165f6","resolution":{"observed_at":"2026-08-01T04:58:43.070342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:43.182267Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:43.182267Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:c9e6764e9d8df9875a838301d22a52b80c7b87c1a1093299fac41232cc379945","observation_id":"23a69917-216f-40a3-b323-06d044da6719","resolution":{"observed_at":"2026-08-01T04:58:43.182267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:43.305148Z","title":"Scissorhands: Exploiting the persistence of importance hypothesis for llm kv cache compression at test time,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:43.305148Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:20adf9abdc6d51936e9a3e070b00b15537afd9a27c3e469187811c7fc45adfed","observation_id":"54487552-cbc4-45c4-a1d4-2f33166ce04a","resolution":{"observed_at":"2026-08-01T04:58:43.305148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:43.394240Z","title":"Kvo-llm: Boosting long-context generation throughput for batched llm inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:43.394240Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:f12ce67315ad3b4adbfd52998e1445269240a0ef8983d8aed080e88837ee3f07","observation_id":"318a4ef6-4f36-4e23-939a-687ecb7d8edd","resolution":{"observed_at":"2026-08-01T04:58:43.394240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:43.506772Z","title":"Keyformer: Kv cache reduction through key tokens selection for efficient generative inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:43.506772Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:92a661b970c1a67793615cd31bacdda65dcb53f2f74809be87d62aa747476733","observation_id":"8e2cabfc-b120-4daf-86f8-207a0a322d8b","resolution":{"observed_at":"2026-08-01T04:58:43.506772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:43.606157Z","title":"Alisa: Accelerating large language model inference via sparsity-aware kv caching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:43.606157Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:54c38457027f8167b53f7022a1e3d2b11d0d4b5ef8e86ac7c221356dae28604e","observation_id":"313f3b18-dce6-4810-b5ce-f1a393fa2957","resolution":{"observed_at":"2026-08-01T04:58:43.606157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:43.696933Z","title":"Mata: A memory-efficient attention accelerator for llms exploiting look-back kv cache pruning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:43.696933Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:d6b40307046323640ed2c0bf57ad05b0716f727630f428f7f21b73e9bfc42156","observation_id":"2d78b5e8-4f14-4873-93fa-b52b7a00c4d3","resolution":{"observed_at":"2026-08-01T04:58:43.696933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:43.829479Z","title":"Unicaim: A unified cam/cim architecture with static- dynamic kv cache pruning for efficient long-context llm inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:43.829479Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:28a099f69d93a768a25cb20d9fc45424e8ececb415bf7c5fa5b3f0f881e6ed43","observation_id":"88bcf029-6fc7-4492-8f9d-7280cd5933e4","resolution":{"observed_at":"2026-08-01T04:58:43.829479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:43.934750Z","title":"Token-picker: Accelerating attention in text generation with minimized memory transfer via probability estimation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:43.934750Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:ac06560b2fd2b69e29680fec144f5bc0761520a0f3e3731aaacd0eb3317d251a","observation_id":"d746782c-237a-4ea6-850b-e105d2e2bfc5","resolution":{"observed_at":"2026-08-01T04:58:43.934750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:44.011211Z","title":"Dias: Distance-based attention sparsity for ultra-long- sequence transformer with tree-like processing-in-memory architecture,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:44.011211Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:92cfa3709d437771d0c0dc16f13aedcf667ee90df3a4d7554b8738b895c97e36","observation_id":"79c477fa-51e5-4b0a-8746-14a8ec912734","resolution":{"observed_at":"2026-08-01T04:58:44.011211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:44.075196Z","title":"Veda: Efficient llm generation through voting-based kv cache eviction and dataflow-flexible accelerator,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:44.075196Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:871f67364d417eb1b5baab8d1c1008ad1bdc58395a3cda35860eba32875bcba4","observation_id":"fd5d4989-9e38-45d6-93e6-795bbd388645","resolution":{"observed_at":"2026-08-01T04:58:44.075196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:44.170208Z","title":"Kv-cache oriented query-aware sparse attention accelerator with cross-stage precision-configurable digital cim,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:44.170208Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:761d4c33715d8c7590bbe0ac2492e9a685e038472a6608904d0cb59a7aa96bf8","observation_id":"20e531de-bec9-4f9a-b671-a9e308b1d187","resolution":{"observed_at":"2026-08-01T04:58:44.170208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:44.321904Z","title":"End-to-end acceleration of generative models with runtime regularized kv cache management,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:44.321904Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:a225317614cf90aff58f779550f7020af0172db82263f708e9d9a684f1684585","observation_id":"fc0f6cc6-865f-4b67-af00-7818900e3b05","resolution":{"observed_at":"2026-08-01T04:58:44.321904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:44.430466Z","title":"Edgellm: A highly efficient cpu-fpga heterogeneous edge accelerator for large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:44.430466Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:364318b64a238cf64a55a6104d9dc2e0e1faa494d0b78e3625fa6dddb2dab5b7","observation_id":"deeb2018-df6f-49d8-af1b-701c3b66cca0","resolution":{"observed_at":"2026-08-01T04:58:44.430466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:44.529874Z","title":"Distserve: Disaggregating prefill and decoding for goodput-optimized large language model serving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:44.529874Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:3344eb6d00e124eec747211346182e5a431150c761c94331dde241ebbbd3eeb9","observation_id":"082819a2-cf6e-4748-b2e9-7663597bb079","resolution":{"observed_at":"2026-08-01T04:58:44.529874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:44.760684Z","title":"Flightllm: Efficient large language model inference with a complete mapping flow on fpgas,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:44.760684Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:1329a84e24c99ddf3565fc6b9711f88ae529b71616eda5d5ec7001c7f2b4abed","observation_id":"63bd56cf-985d-4172-ba8b-b72d0e54149a","resolution":{"observed_at":"2026-08-01T04:58:44.760684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:44.943518Z","title":"Ofq-llm: Outlier-flexing quantization for efficient low- bit large language model acceleration,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:44.943518Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:b078a3bb73e9929a4d233e0a667979b037f65579e1f450337c09217e5b443e3f","observation_id":"7f0df5c5-732d-48a8-902d-ee7f519581f4","resolution":{"observed_at":"2026-08-01T04:58:44.943518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:45.144166Z","title":"Kv cache compression, but what must we give in return? a comprehensive benchmark of long context capable approaches,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:45.144166Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:173a6f0217efc50c18f30458835096a1d05e6d10c7b412598731f5704bf6b6c7","observation_id":"ca253343-8b28-448c-901b-7b5abf8a5582","resolution":{"observed_at":"2026-08-01T04:58:45.144166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:45.303812Z","title":"Apt-llm: Exploiting arbitrary-precision tensor core comput- ing for llm acceleration,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:45.303812Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:af7545c9f849b2abce4197a37597b817672cf8f65141a2c26058d4ed60e87301","observation_id":"e20f6a49-0c49-43c5-94ad-f2b9c415ab98","resolution":{"observed_at":"2026-08-01T04:58:45.303812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14294","snapshot_observed_at":"2026-08-01T04:58:45.474492Z","title":"A survey on efficient inference for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:45.474492Z"},"links":{"cited_paper":"/paper/2404.14294","citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:90a85033391f6e6935f697ccbf59b9a2867b02788cfbb4f26f1bcd7a2dfb6483","observation_id":"abc3d7e8-46f9-48a6-b05e-c1b19e0be6fb","resolution":{"observed_at":"2026-08-01T04:58:45.474492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:45.605674Z","title":"When to stop? towards efficient code generation in llms with excess token prevention,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:45.605674Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:4d89cf21bb97de1c9108c6ec048eda2773ee46eab28763a5b527ae02f2a3c659","observation_id":"b3a0208c-2ad0-46de-b0b8-7c0713d15844","resolution":{"observed_at":"2026-08-01T04:58:45.605674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:45.795483Z","title":"Llmcompass: Enabling efficient hardware design for large language model inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:45.795483Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:e4bdc8fadd76171ea07528a9478cae77eec9c14159ff9d134ea795479bef6e4b","observation_id":"d6ec201e-38ec-4d68-a31d-44fe07b3fea5","resolution":{"observed_at":"2026-08-01T04:58:45.795483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:46.038243Z","title":"Energy cost modelling for optimizing large language model inference on hardware accelerators,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:46.038243Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:047cf8d66c347ee73fac3ff20636a8f15350f4e613d058619f97db3192e3e450","observation_id":"604e267d-01bf-49e1-805d-3ab2733c5df8","resolution":{"observed_at":"2026-08-01T04:58:46.038243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16363","last_updated":"2024-05-01T20:42:28Z","snapshot_observed_at":"2026-08-01T22:52:35.092898Z","submitted_at":"2024-02-26T07:33:05Z","title":"LLM Inference Unveiled: Survey and Roofline Model Insights","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16363","snapshot_observed_at":"2026-08-01T04:58:46.181845Z","title":"Llm inference unveiled: Survey and roofline model insights,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:46.181845Z"},"links":{"cited_paper":"/paper/2402.16363","citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:1b4b743e5f524218d38282cc34e2d9c64ea1de6d4d6b8d891a788b834f213190","observation_id":"9168e695-d063-4ad4-9634-4fa85f8a9393","resolution":{"observed_at":"2026-08-01T04:58:46.181845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:46.374845Z","title":"Skipkv: Selective skipping of kv generation and storage for efficient inference with large reasoning models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:46.374845Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:242fa51e6f2f8cad3347deb290f4d5f90e9c3d875c84b1afb7937d9f2abfd844","observation_id":"89491f21-4613-47d2-8be2-e7c1ee4649b6","resolution":{"observed_at":"2026-08-01T04:58:46.374845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:46.548695Z","title":"Titanus: Enabling kv cache pruning and quantization on-the-fly for llm acceleration,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:46.548695Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:6a7c6ef0027704157ca32c5b69b4132950cc7e88ac377270727f07a7e2675193","observation_id":"9a0e496a-1570-4ff2-900b-8d6699310dce","resolution":{"observed_at":"2026-08-01T04:58:46.548695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:46.763518Z","title":"Infinigen: Efficient generative inference of large language models with dynamic kv cache management,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:46.763518Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:59591e4d90aea870c02a93fb098df4102d55f80bd8d64843f2b2f3c25e60efe7","observation_id":"605bc04d-cf93-41d7-a727-1a6322b69f05","resolution":{"observed_at":"2026-08-01T04:58:46.763518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:47.016141Z","title":"Sparq attention: Bandwidth-efficient llm inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:47.016141Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:6c43fd90100ea59c180a3d6a5052f2e8662097cf91b4ca3e53485ee2284e648d","observation_id":"3fe095db-cf41-4bfe-b822-d71c0a6c13f6","resolution":{"observed_at":"2026-08-01T04:58:47.016141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:47.163798Z","title":"Algorithm 232: Heapsort,","venue":null,"work_id":null,"year":1964},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:47.163798Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:ac46a5f21887b44712a1efbbe3cb5c0f035d969baf68f85782fa8161d89f362b","observation_id":"610a51a3-5140-4cf8-873c-e171f7a54f2f","resolution":{"observed_at":"2026-08-01T04:58:47.163798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:47.269194Z","title":"Sorting networks and their applications,","venue":null,"work_id":null,"year":1968},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:47.269194Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:4bb020c7045cc3d78a4d5fd8f4e8015ff3074e85d63c157832998be6c5523367","observation_id":"f3832966-788f-4656-a365-4e0ff33f09a0","resolution":{"observed_at":"2026-08-01T04:58:47.269194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:47.421112Z","title":"Efficient memory management for large language model serving with PagedAttention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:47.421112Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:ef8deb48c951999e05e466264fd45d18207a7419e23458417279924fffabeccb","observation_id":"1da2e8d6-b1c9-4d46-ab3b-8d346b62474f","resolution":{"observed_at":"2026-08-01T04:58:47.421112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:47.516573Z","title":"Anda: Unlocking efficient llm inference with a variable- length grouped activation data format,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:47.516573Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:c8b9925e4293738942ba157ac15b3723d5bd400f28af23655282b85a707eac6a","observation_id":"5bbae7ab-3070-43ee-8ecf-b4e80e042fe3","resolution":{"observed_at":"2026-08-01T04:58:47.516573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:47.631238Z","title":"Ten lessons from three generations shaped google’s tpuv4i: Industrial product,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:47.631238Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:f26fffff17f7d2596d05f57245a646ba83d4bc4ac5bd84364f5a5d6d57c7f77f","observation_id":"ef6216b1-3f70-4659-8ed8-230610832737","resolution":{"observed_at":"2026-08-01T04:58:47.631238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:47.771700Z","title":"Dramsim3: A cycle-accurate, thermal-capable dram sim- ulator,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:47.771700Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:b391fce2c56f0cdfc7e684f9c36b059dec2df24330a8c875aebe2d056aff14e7","observation_id":"ab6c5676-5725-4df3-8714-ccfd8c9d5462","resolution":{"observed_at":"2026-08-01T04:58:47.771700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:47.864332Z","title":"Ada-kv: Optimizing kv cache eviction by adaptive budget allocation for efficient llm inference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:47.864332Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:1b7605a980701dce308536ae359998bdfd92b46d352e678fca2f9b1fcbc0cc03","observation_id":"6d45b6d6-2d5b-49e7-83f1-77b9cf4008f3","resolution":{"observed_at":"2026-08-01T04:58:47.864332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:47.969320Z","title":"Dynamickv: Task-aware adaptive kv cache compression for long context llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:47.969320Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:beb640362bd8a69a505366bac4e19d1814dbd6d3d6bc47401495f58caf595bd0","observation_id":"469204c9-e339-46d2-a2b8-a54f42bcba56","resolution":{"observed_at":"2026-08-01T04:58:47.969320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T04:58:48.072701Z","title":"DeepScaleTool: A tool for the accurate estimation of technology scaling in the deep-submicron era,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T04:58:48.072701Z"},"links":{"citing_paper":"/paper/2607.22389"},"observation_digest":"sha256:faa2c515df7cddcc5e9d126e7861e98dc61d51c0d198429029eccfcbefe00d59","observation_id":"9345b92f-f78d-4469-8e47-d447e96ef55d","resolution":{"observed_at":"2026-08-01T04:58:48.072701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.22389","last_updated":"2026-07-24T15:15:10Z","latest_version":1,"primary_category":"cs.AR","snapshot_observed_at":"2026-08-06T23:11:26.538089Z","submitted_at":"2026-07-24T15:15:10Z","title":"HiKV: Hierarchical Importance-Aware KV Cache with Hardware Acceleration for LLM Decoding"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2607.22389."}