{"as_of":"2026-08-07T23:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:405909a76b76fd74d7c2e37b401f3c160556496b6dcd8eddc87b8e9d4fc29420","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:06:38.022879Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.19823/citation-record","integrity":"/paper/2507.19823/integrity","json":"/paper/2507.19823/citation-record.json","paper":"/paper/2507.19823"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:41.029720Z","title":"2 In the approximate attention score computation, the computation is performed group-wise","venue":null,"work_id":"8b34c2f0-b947-41dc-8667-3dc137041e4d","year":null},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.876858Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:d74dcb165e7c6d591206270a1dfd7dc2a53074d38c5914271a6a3825f4657c82","observation_id":"ee6a794a-a478-4d69-b76b-a1f91e63179e","resolution":{"observed_at":"2026-08-06T14:06:41.183917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:40.870508Z","title":"needles\" on the task performance. We take “The best thing to do in Paris is buy a fresh croissant and lounge by the Seine at twilight","venue":null,"work_id":"c4e426bd-a892-44a2-b74d-b04d17158d0b","year":null},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.880928Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:6371fe0746cc3d0e1c4d008bf1b22ddb904bacb1c3d53028721a4ff5b2ac8e17","observation_id":"0414ced1-bf2c-4593-b73d-89948ed9b6be","resolution":{"observed_at":"2026-08-06T14:06:40.923973Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T14:06:37.884942Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.884942Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:737a530492a426fc49a957a2bbc8821dd8b2894284458d57f2e5992ae73d5d4e","observation_id":"96117a3d-8e7e-4b5d-ae64-ca5412b25625","resolution":{"observed_at":"2026-08-06T14:06:37.884942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:40.599377Z","title":"Keyformer: Kv cache reduction through key tokens selection for efficient generative inference","venue":null,"work_id":"4e44fbcf-7b1d-4a20-aa79-19574b5090f4","year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.887582Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:2cd8b7c85c2184794ff77e12eb4f83e676c4bfb45ef814ce1b04fd44b2822c8f","observation_id":"fdebe3d6-067d-43c2-837a-d187f24ae57a","resolution":{"observed_at":"2026-08-06T14:06:40.739676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T14:06:37.890090Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.890090Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:fe9820be3615b3d4c480e134d75901bab48ba618291080c5551eadfe732ef6c3","observation_id":"606dceea-355c-4ae0-bf69-50c93b47d171","resolution":{"observed_at":"2026-08-06T14:06:37.890090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:40.352060Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Under- standing","venue":null,"work_id":"e594e97a-ef87-422f-994f-941cab1a4001","year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.892704Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:39b30b18b0eaaf310c3424299280e11772adf1c679f6dc7d93cd66a52819fd1d","observation_id":"ecfac449-9f5c-462e-a6f0-a0adf0e10d7e","resolution":{"observed_at":"2026-08-06T14:06:40.465957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-06T14:06:37.895942Z","title":"Longformer: The long-document transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.895942Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:0ade6cc4f1a1e17f53127dff7ca320f319f6a42a133e0acd11a2e5d6acce9c54","observation_id":"8130c8ad-6e46-4174-b1ca-29ef63735ca7","resolution":{"observed_at":"2026-08-06T14:06:37.895942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:40.115978Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","venue":null,"work_id":"cba95efd-5b82-4f3c-9bc1-f6c57e41721d","year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.898719Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:96fc35ce6473d0f8bd1bd2a4553fdd4c1ef8bf2231f42a97a8728ebc49cb72d5","observation_id":"389002f8-0351-49b5-8c60-8f50422b2ee5","resolution":{"observed_at":"2026-08-06T14:06:40.235668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-06T14:06:37.901469Z","title":"Model tells you what to discard: Adaptive kv cache compression for llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.901469Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:52388db9831bac1651abb7a9e70f87964e56cd1a3ee02a3033016d1bdb1745bf","observation_id":"1a40cc01-238f-4c1e-9b65-cfe96b455c10","resolution":{"observed_at":"2026-08-06T14:06:37.901469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T14:06:37.904247Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.904247Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:151b5cefc714e15e7e559bc1802394e4ad731ac1e3e8bd6b6e7fc39858009e36","observation_id":"adfc8e26-5816-431e-8d23-388877f32cbe","resolution":{"observed_at":"2026-08-06T14:06:37.904247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11421","last_updated":"2024-03-18T02:30:23Z","snapshot_observed_at":"2026-08-06T20:15:05.193939Z","submitted_at":"2024-03-18T02:30:23Z","title":"FastDecode: High-Throughput GPU-Efficient LLM Serving using Heterogeneous Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11421","snapshot_observed_at":"2026-08-06T14:06:37.907873Z","title":"Fastdecode: High-throughput gpu-efficient llm serving using heterogeneous pipelines","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.907873Z"},"links":{"cited_paper":"/paper/2403.11421","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:e0e10dcc9452fda08e201ca94c4f42d52dd97b21917201a38fd8c8bacec6d94a","observation_id":"950360d6-18a2-4927-9922-c48f3179ece1","resolution":{"observed_at":"2026-08-06T14:06:37.907873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:39.962193Z","title":"ZipCache: Accurate and Efficient KV Cache Quantization with Salient Token Identification","venue":null,"work_id":"bb4a7e0a-10f5-4bc7-aa47-5ffdd2765f0e","year":null},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.910383Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:233e39a84e0b01804709040c66464b6ce3be35c6867c72d849482ee716e4cd5a","observation_id":"cca51106-df38-4722-a13a-e74117eb2f5a","resolution":{"observed_at":"2026-08-06T14:06:40.051532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-07T13:04:50.040909Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-06T14:06:37.917505Z","title":"Mixtral of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.917505Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:fa798797ce44c4ca666f6656411b3d1b1117b0c0bb7883727fb4a425e1a6930f","observation_id":"4e7b22e9-2adb-4006-a7d2-5f6170baf825","resolution":{"observed_at":"2026-08-06T14:06:37.917505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01142","last_updated":"2024-11-02T05:15:44Z","snapshot_observed_at":"2026-07-06T19:43:59.326124Z","submitted_at":"2024-11-02T05:15:44Z","title":"NEO: Saving GPU Memory Crisis with CPU Offloading for Online LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01142","snapshot_observed_at":"2026-08-06T14:06:37.921530Z","title":"Neo: Saving gpu memory crisis with cpu offloading for online llm inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.921530Z"},"links":{"cited_paper":"/paper/2411.01142","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:36eb6641b96189e1add238b647f599b6dc1bd811434af165a7a2ad23711073a5","observation_id":"5fc44e7c-d87c-46d0-83a0-a26cfd1a7dce","resolution":{"observed_at":"2026-08-06T14:06:37.921530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:39.831016Z","title":"Kamradt.Llmtest_needleinahaystack: Doing simple retrieval from llm models at vari- ous context lengths to measure accuracy","venue":null,"work_id":"4458ecfd-d61f-4d67-884d-a3c4bbf6c443","year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.924853Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:17d41f017c0fa381c3c4257e4025a9290d2de1ad6bf07040ee30dd8a50b9c264","observation_id":"615aef19-ece2-4278-b6c8-72c8a1b22de4","resolution":{"observed_at":"2026-08-06T14:06:39.903944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04717","last_updated":"2026-04-20T02:55:07Z","snapshot_observed_at":"2026-07-06T21:05:11.303685Z","submitted_at":"2025-04-07T04:00:08Z","title":"Beyond Single-Turn: A Survey on Multi-Turn Interactions with Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04717","snapshot_observed_at":"2026-08-06T14:06:37.929141Z","title":"Beyond Single- Turn: A Survey on Multi-Turn Interactions with Large Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.929141Z"},"links":{"cited_paper":"/paper/2504.04717","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:6071bf76f20111c91ace90a7425118858d8ac4e7b950a6bdda87d6a62886f264","observation_id":"c4c7c256-85e4-49b5-bfb6-54a9f96df94b","resolution":{"observed_at":"2026-08-06T14:06:37.929141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11745","last_updated":"2024-12-23T15:36:32Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T16:11:59Z","title":"FocusLLM: Precise Understanding of Long Context by Dynamic Condensing","version":2},"cited_work":{"arxiv_id":"2408.11745","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.11745","snapshot_observed_at":"2026-08-06T14:06:38.185510Z","title":"FocusLLM: Precise Understanding of Long Context by Dynamic Condensing","venue":"cs.CL","work_id":"4ef26d44-0cfa-438b-9334-8f23fd7bd96d","year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.933299Z"},"links":{"cited_paper":"/paper/2408.11745","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:4e507c6bb18b585a209154f0032b078b91bb8a7eafba3f6336fa70dd95b25ca5","observation_id":"540ef15f-0219-466f-b0bd-cb6a60457dd6","resolution":{"observed_at":"2026-08-06T14:06:38.215398Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-06T14:06:37.937463Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.937463Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:1117f8fcfc0955357a4e925dfa8883cb7cf04fdea846ec504d83a45edcbc3249","observation_id":"b1537645-a823-4aaf-aae9-821058aae735","resolution":{"observed_at":"2026-08-06T14:06:37.937463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:39.677567Z","title":"KIVI: a tuning- free asymmetric 2bit quantization for KV cache","venue":null,"work_id":"e9d6e0a4-26be-4117-adc0-0a33a96d807b","year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.941514Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:1a9e6ea48a15509ba26a10c7f3fb82294834ea89257d6a496f99a4af6bf9632d","observation_id":"2f1c78db-f234-4b0d-b048-757ca3fc22ec","resolution":{"observed_at":"2026-08-06T14:06:39.751585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13626","last_updated":"2024-12-18T09:04:55Z","snapshot_observed_at":"2026-08-05T03:31:32.788019Z","submitted_at":"2024-12-18T09:04:55Z","title":"LIFT: Improving Long Context Understanding Through Long Input Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2412.13626","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.13626","snapshot_observed_at":"2026-08-06T14:06:38.107747Z","title":"LIFT: Improving Long Context Understanding Through Long Input Fine-Tuning","venue":"cs.CL","work_id":"9127f03d-7af2-417a-aead-21057c76c149","year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.947046Z"},"links":{"cited_paper":"/paper/2412.13626","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:bcca4d498a4d86567e676de4c29e777c0582745d16fad5421ab04ed3b15e24d1","observation_id":"288d86ab-58a8-495f-a228-5b9ee5ec114d","resolution":{"observed_at":"2026-08-06T14:06:38.123954Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.08877","last_updated":"2021-12-14T06:19:33Z","snapshot_observed_at":"2026-08-06T08:28:54.662531Z","submitted_at":"2021-08-19T18:58:02Z","title":"Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.08877","snapshot_observed_at":"2026-08-06T14:06:37.951435Z","title":"Sentence-t5: Scalable sentence encoders from pre-trained text-to-text models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.951435Z"},"links":{"cited_paper":"/paper/2108.08877","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:ce031791eab3234ed92151e14a855ed145901b6e1960b0af9e5cd78d61b731bc","observation_id":"db751f23-2830-4e43-b0c2-665b4dc94514","resolution":{"observed_at":"2026-08-06T14:06:37.951435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:39.569420Z","title":"Transformers are Multi-State RNNs","venue":null,"work_id":"8128b4fa-fe84-4c2f-b016-026e8c749e7e","year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.954862Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:ef4b589c1d8419a35152ebf237a1bf5ed54a2badf09dea692fd7a70b0e25a38c","observation_id":"e5083c6d-33ab-49cf-825d-b81d20220c1c","resolution":{"observed_at":"2026-08-06T14:06:39.609049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:39.468337Z","title":"Scikit-learn: Machine learning in Python","venue":null,"work_id":"3b304252-5405-4b42-8967-4c58f1c8dc65","year":2011},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.958718Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:e47211f72ece5375b8541c8c9800e6eeac97c8a39936342ad7f2574056a5c4d7","observation_id":"cf1c9358-62f9-4a64-bdc7-b1ac7d5880f6","resolution":{"observed_at":"2026-08-06T14:06:39.500139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:39.375609Z","title":"Web-scale k-means clustering","venue":null,"work_id":"8e2da9a7-44b2-414b-91cf-d3f924badb6b","year":2010},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.961351Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:ba205338b5115f48e9f3396a9a3cbabd2ae67d6a7901bc0bf4ed5b28189485ee","observation_id":"93f5acea-eed0-44a1-a7f2-d3b38187eb1b","resolution":{"observed_at":"2026-08-06T14:06:39.418351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:39.279976Z","title":"Adafactor: Adaptive learning rates with sublinear memory cost","venue":null,"work_id":"93f4644c-534a-4e45-b6c4-de0abf988cc7","year":2018},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.963935Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:587dd1d3bd85d8a41381d2155d31db5312eae164ec25bdcc4e251b4cffaa35be","observation_id":"acf8426f-15ab-4ec1-bc9f-acf90e0f47f7","resolution":{"observed_at":"2026-08-06T14:06:39.338961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:39.166244Z","title":"QUEST: Query-Aware Sparsity for Efficient Long-Context LLM Inference","venue":null,"work_id":"7caf6d34-575b-46da-93c4-f1ec909b1734","year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.966289Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:52631d33e31715f022929c358d05f41e409c45422e00e5a7abc52f8a142da909","observation_id":"d8d2ff7a-a944-4ac6-88d1-a65a44d82955","resolution":{"observed_at":"2026-08-06T14:06:39.207679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:39.029566Z","title":"AsymKV: Enabling 1-Bit Quantization of KV Cache with Layer- Wise Asymmetric Quantization Configurations","venue":null,"work_id":"2faab054-16f2-4740-8cf8-55046cf68764","year":2025},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.970390Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:10178e5cbfcfce3f3ece8dd0a81715b457abffdd2e37714019bd28a36a753660","observation_id":"9b79bf44-ecb7-4a4f-b923-8ee1d1742da8","resolution":{"observed_at":"2026-08-06T14:06:39.135861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T14:06:37.974660Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.974660Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:2c6dea7df4cd05b2b02f3a852775b16155b3d210cfe43bbbe6a7611a2732ded5","observation_id":"4a804256-821c-4af7-941a-011ea97cf392","resolution":{"observed_at":"2026-08-06T14:06:37.974660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T14:06:37.978694Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.978694Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:3a201e76659ff69881506f935a2ddefadbbac7970f233ce00ee1ffc18951f06c","observation_id":"4b2a5842-f14a-4cf0-827c-9eb9dfbe3fb6","resolution":{"observed_at":"2026-08-06T14:06:37.978694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:38.803907Z","title":"Attention is all you need","venue":null,"work_id":"45ac30c4-b92b-4447-91ed-cc47a918ace2","year":2017},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.981698Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:d3432339da9694399a04f662a22e1e0800d263e63830441f8c23ca3e450d5e5f","observation_id":"11c6413d-c09a-4c77-9d51-63c2b6c1ab0a","resolution":{"observed_at":"2026-08-06T14:06:38.904377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:38.716214Z","title":"Fast transformers with clustered attention","venue":null,"work_id":"1f16cd15-7ba6-48ae-a1ab-af29e5967ba7","year":2020},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.984746Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:925f1a90e942e446fee147a6d8b4be793c3946b34df8af396e20e9499b2d997b","observation_id":"98f37da9-ea15-4352-a0a8-bdd8e46ac2f7","resolution":{"observed_at":"2026-08-06T14:06:38.751720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:38.589244Z","title":"SqueezeAttention: 2D Management of KV-Cache in LLM Inference via Layer-wise Optimal Budget","venue":null,"work_id":"e27108e7-2570-4762-9c23-15dea2f06efe","year":null},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.988527Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:6321a09951ce1239aaa91e4bf4685ccf69b93237a7dc06ed49da56aaaaf34bb0","observation_id":"0f0aea8d-7a86-400a-859c-ac0a51eaf6ae","resolution":{"observed_at":"2026-08-06T14:06:38.630982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10819","last_updated":"2024-10-14T17:59:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-14T17:59:58Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10819","snapshot_observed_at":"2026-08-06T14:06:37.990797Z","title":"Duoattention: Ef- ficient long-context llm inference with retrieval and streaming heads","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.990797Z"},"links":{"cited_paper":"/paper/2410.10819","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:0103e6db01884507aeee83e1d7a2f9aaab2a219787262058f2a16a9966adc312","observation_id":"1c1e24bb-8c80-462b-a0a0-6e64696e4b37","resolution":{"observed_at":"2026-08-06T14:06:37.990797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:38.532898Z","title":"Efficient Streaming Language Models with Attention Sinks","venue":null,"work_id":"b857dbae-d792-48e6-afb9-b296e4b60487","year":null},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.993929Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:dc40f9adf92fda39c1b6743232ce55b9b533deec320b32b15bb26bef005b2aad","observation_id":"a73e0ec4-c5a0-47a7-8d9a-0825d23228ff","resolution":{"observed_at":"2026-08-06T14:06:38.560300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15309","last_updated":"2024-07-22T14:37:58Z","snapshot_observed_at":"2026-07-06T18:49:46.992782Z","submitted_at":"2024-07-22T14:37:58Z","title":"vTensor: Flexible Virtual Tensor Management for Efficient LLM Serving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15309","snapshot_observed_at":"2026-08-06T14:06:37.998948Z","title":"vtensor: Flexible virtual tensor management for efficient llm serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:37.998948Z"},"links":{"cited_paper":"/paper/2407.15309","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:85b34cc9166c97ba5f184924aea35b82d18ad2df0e002d50bfbb00173ef77227","observation_id":"58d002b9-2bf8-478d-9a61-9193fcab74e8","resolution":{"observed_at":"2026-08-06T14:06:37.998948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21018","last_updated":"2025-02-27T12:30:43Z","snapshot_observed_at":"2026-08-02T14:11:02.770149Z","submitted_at":"2024-07-30T17:59:08Z","title":"ThinK: Thinner Key Cache by Query-Driven Pruning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21018","snapshot_observed_at":"2026-08-06T14:06:38.003459Z","title":"Think: Thinner key cache by query-driven pruning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:38.003459Z"},"links":{"cited_paper":"/paper/2407.21018","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:3eb37ddd7471ab3c4fe098d40f4ad3138e481cabc409f73db9ebc1939395862e","observation_id":"5e20b226-1612-4e36-adc7-a2a165d53f6b","resolution":{"observed_at":"2026-08-06T14:06:38.003459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09959","last_updated":"2025-01-17T05:21:49Z","snapshot_observed_at":"2026-07-06T20:22:19.281265Z","submitted_at":"2025-01-17T05:21:49Z","title":"A Survey on Multi-Turn Interaction Capabilities of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09959","snapshot_observed_at":"2026-08-06T14:06:38.007767Z","title":"A Survey on Multi-Turn Interaction Capabilities of Large Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:38.007767Z"},"links":{"cited_paper":"/paper/2501.09959","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:1187e44978771b5858fd5d9a11d4bbc10432158bcd69b86c7db7784b2d0a3a90","observation_id":"c31314c2-8d44-479e-893e-6badf21f3034","resolution":{"observed_at":"2026-08-06T14:06:38.007767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03462","last_updated":"2024-10-11T02:18:24Z","snapshot_observed_at":"2026-08-05T14:53:23.650244Z","submitted_at":"2024-01-07T11:57:40Z","title":"Long Context Compression with Activation Beacon","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03462","snapshot_observed_at":"2026-08-06T14:06:38.011516Z","title":"Soaring from 4k to 400k: Extending llm’s context with activation beacon","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:38.011516Z"},"links":{"cited_paper":"/paper/2401.03462","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:265f9bd62ed61d1bc8a789ff49b225ab18fbee5b6d0cc8cd6c91b07428f634b3","observation_id":"4fe2a94b-3a14-4169-a780-0272201307f5","resolution":{"observed_at":"2026-08-06T14:06:38.011516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-06T14:06:38.014118Z","title":"Opt: Open pre-trained transformer language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:38.014118Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:b7fba73b1e41c8ebdff17b93c9bfd3828ba59758196ece248dd91bfd2a61f794","observation_id":"f2ae781a-3c43-4df4-9adf-74184f70c325","resolution":{"observed_at":"2026-08-06T14:06:38.014118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:38.435701Z","title":"KV cache is 1 bit per channel: Efficient large language model inference with coupled quantization","venue":null,"work_id":"6786b75b-2d9f-4b39-9d03-70dd5141940f","year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:38.017818Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:160fc8e78a3b4e1389587de52d28a972de1df02094ed935682e0fb9bc39362e0","observation_id":"31fd5540-f7d2-41fc-9bd2-b3a1764fdc57","resolution":{"observed_at":"2026-08-06T14:06:38.481242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:38.357604Z","title":"Chain of agents: Large language models collaborating on long-context tasks","venue":null,"work_id":"7062bdb1-838c-4088-87fa-ef66b46483a9","year":2024},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:38.020684Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:497c3ed0518de4587095b7602d217132e2c7570d274a6b450b8b22d974bb0486","observation_id":"7cb6c8ec-a7bd-4690-8ba2-937a9b53679a","resolution":{"observed_at":"2026-08-06T14:06:38.392823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:06:38.319634Z","title":"H2O: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":"8b7b2c51-2c2d-47c8-b34b-59cce18b3a5b","year":2023},"citing_paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T14:06:38.022879Z"},"links":{"citing_paper":"/paper/2507.19823"},"observation_digest":"sha256:0713507ad03f9d3c76551953ab8905cf6c3c90c2a9e18c507aa87891428924a1","observation_id":"03539e17-272c-4263-9570-932b78338fe3","resolution":{"observed_at":"2026-08-06T14:06:38.330399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.19823","last_updated":"2025-07-26T06:43:14Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T14:06:37.459069Z","submitted_at":"2025-07-26T06:43:14Z","title":"HCAttention: Extreme KV Cache Compression via Heterogeneous Attention Computing for LLMs"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":2,"verified_fuzzy":20},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2507.19823."}