{"as_of":"2026-08-11T14:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9459b35b891fcb2d58458c36b9d79af5c5789e53f6f6ae6bd8014c34b31e8fb4","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":51,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T13:52:48.712247Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T01:36:44.078109Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-08-11T10:42:54.633244Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:2ecc9a0bb80eb2fd324fc9b6e1e63390d462e00cede6dee6e06933591141dbdb","observation_id":"4c274a29-48b0-4191-a303-036c206199ef","resolution":{"observed_at":"2026-05-12T08:20:01.181115Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2403.14608","last_updated":"2024-09-16T02:54:50Z","snapshot_observed_at":"2026-08-04T09:07:42.158421Z","submitted_at":"2024-03-21T17:55:50Z","title":"Parameter-Efficient Fine-Tuning for Large Models: A Comprehensive Survey","version":7},"reference_index":183,"source":"pdf_text","source_observed_at":"2026-05-13T11:32:36.738536Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2403.14608"},"observation_digest":"sha256:b807bee06baed9f4f6f191977da3ac9d09b88f034fd4896962dbdb3f33a18f45","observation_id":"1c1458c6-6319-4acf-bd58-3c52b8d758d3","resolution":{"observed_at":"2026-05-13T11:32:36.921300Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-11T13:52:48.712247Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12706","last_updated":"2025-02-20T12:14:49Z","snapshot_observed_at":"2026-08-11T13:47:03.201260Z","submitted_at":"2024-12-17T09:20:31Z","title":"More Tokens, Lower Precision: Towards the Optimal Token-Precision Trade-off in KV Cache Compression","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T13:52:48.712247Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2412.12706"},"observation_digest":"sha256:aa228e5916919f95527e957b90af63314fd91eb0518a87ffbe679a7f2e1f0d1e","observation_id":"ae71be05-5aad-457e-b094-8edc2005b616","resolution":{"observed_at":"2026-08-11T13:52:48.712247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-11T12:22:38.849655Z","title":"Gear: An efficient kv cache compression recipefor near-lossless generative inference of llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14363","last_updated":"2025-02-03T21:45:32Z","snapshot_observed_at":"2026-08-11T12:16:09.927617Z","submitted_at":"2024-12-18T22:01:55Z","title":"ResQ: Mixed-Precision Quantization of Large Language Models with Low-Rank Residuals","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T12:22:38.849655Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2412.14363"},"observation_digest":"sha256:d892b9c292dac4929a5bc399305d4499cc603ca6c36de24effdc9a8c9017ced7","observation_id":"8a50b5f7-d468-4e8b-bfbc-e2ed5fb7edd7","resolution":{"observed_at":"2026-08-11T12:22:38.849655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-11T11:57:17.934982Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14838","last_updated":"2025-05-27T03:08:57Z","snapshot_observed_at":"2026-08-11T11:49:59.553649Z","submitted_at":"2024-12-19T13:28:42Z","title":"DynamicKV: Task-Aware Adaptive KV Cache Compression for Long Context LLMs","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T11:57:17.934982Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2412.14838"},"observation_digest":"sha256:0c73531d2e8b59f53e832b4a834ce1e2d7f174b0d0146517834bfda35b4ab79f","observation_id":"8108889f-c38f-4a3f-b0bb-daabff8c9a4b","resolution":{"observed_at":"2026-08-11T11:57:17.934982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-11T00:38:47.324395Z","title":"Gear: An efficient kv cache compression recipefor near-lossless generative inference of llm,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19442","last_updated":"2025-07-30T05:24:46Z","snapshot_observed_at":"2026-08-11T00:33:34.388194Z","submitted_at":"2024-12-27T04:17:57Z","title":"A Survey on Large Language Model Acceleration based on KV Cache Management","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T00:38:47.324395Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2412.19442"},"observation_digest":"sha256:0d18b0218c17964e3d3a04367149e6f04bedb533cc0c7264c1bae4288b7e748a","observation_id":"564100b0-98ef-440b-bb33-3416f19c907b","resolution":{"observed_at":"2026-08-11T00:38:47.324395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-11T04:29:34.728199Z","title":"Gear: An efficient kv cache compression recipefor near-lossless generative inference of llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05460","last_updated":"2025-06-28T03:53:17Z","snapshot_observed_at":"2026-08-11T04:21:43.212736Z","submitted_at":"2024-12-25T10:11:31Z","title":"Efficiently Serving Large Multimodal Models Using EPD Disaggregation","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T04:29:34.728199Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2501.05460"},"observation_digest":"sha256:2df033d7862a2aeedc40453d539fddf8f92ed81235a020a85df311ed8ba7f59c","observation_id":"2377e117-9098-4867-96d4-78956e29de2a","resolution":{"observed_at":"2026-08-11T04:29:34.728199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-09T20:34:01.250786Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19392","last_updated":"2025-02-28T18:04:52Z","snapshot_observed_at":"2026-08-09T20:48:28.727060Z","submitted_at":"2025-01-31T18:47:42Z","title":"Cache Me If You Must: Adaptive Key-Value Quantization for Large Language Models","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T20:34:01.250786Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2501.19392"},"observation_digest":"sha256:7dd39753672532bf11a51290c11990f38500fbd23119f74ca7d4fb4751262884","observation_id":"d80ec495-591c-4b2b-98d8-d3be9eca364f","resolution":{"observed_at":"2026-08-09T20:34:01.250786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-09T18:46:51.073129Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00527","last_updated":"2026-06-05T09:55:33Z","snapshot_observed_at":"2026-08-09T18:37:46.718097Z","submitted_at":"2025-02-01T18:59:03Z","title":"PolarQuant: Leveraging Polar Transformation for Efficient Key Cache Quantization and Decoding Acceleration","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T18:46:51.073129Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2502.00527"},"observation_digest":"sha256:969b920c2decd5fa4aff1418b377c3e7c40ee62fd21e60b11332bb64b5c701a4","observation_id":"b1c3a8f3-05a1-48fe-98ae-f71f82e1b2af","resolution":{"observed_at":"2026-08-09T18:46:51.073129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-09T13:26:55.388294Z","title":"Gear: An efficient kv cache compression recipefor near-lossless generative inference of llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02617","last_updated":"2025-02-04T08:52:13Z","snapshot_observed_at":"2026-08-10T18:16:37.005924Z","submitted_at":"2025-02-04T08:52:13Z","title":"PolarQuant: Quantizing KV Caches with Polar Transformation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T13:26:55.388294Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2502.02617"},"observation_digest":"sha256:fe25b7cbfe73d4c1e9b6e70516b7a6365be0d13b92d51aaef3fdcd74274b9271","observation_id":"e6284fb8-9ee7-4f61-9079-8df0022ccc90","resolution":{"observed_at":"2026-08-09T13:26:55.388294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-09T04:32:01.224806Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03589","last_updated":"2025-02-05T20:09:51Z","snapshot_observed_at":"2026-08-10T08:40:31.667962Z","submitted_at":"2025-02-05T20:09:51Z","title":"HACK: Homomorphic Acceleration via Compression of the Key-Value Cache for Disaggregated LLM Inference","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T04:32:01.224806Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2502.03589"},"observation_digest":"sha256:4a9cef0b664ea3e8f3f913236c6cf0cd58a748ba28cf52365d2ee1e243d64b6c","observation_id":"a312f7a9-8693-4c31-a9e8-20d62d99656f","resolution":{"observed_at":"2026-08-09T04:32:01.224806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-08T13:44:00.538291Z","title":"Gear: An efficient kv cache compression recipefor near-lossless generative inference of llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07832","last_updated":"2025-02-11T00:21:40Z","snapshot_observed_at":"2026-08-10T01:10:52.838340Z","submitted_at":"2025-02-11T00:21:40Z","title":"SHARP: Accelerating Language Model Inference by SHaring Adjacent layers with Recovery Parameters","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T13:44:00.538291Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2502.07832"},"observation_digest":"sha256:13e3cc5e169f7ca0e8f116ff3f166239cb04809022df8d4b24efdc599cec614b","observation_id":"0872bdf5-f05e-4ce2-b24d-f984a37244e5","resolution":{"observed_at":"2026-08-08T13:44:00.538291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-08T05:56:55.130242Z","title":"Hao Kang, Qingru Zhang, Souvik Kundu, Geonhwa Jeong, Zaox- ing Liu, Tushar Krishna, and Tuo Zhao","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08246","last_updated":"2025-06-03T10:07:35Z","snapshot_observed_at":"2026-08-09T15:11:46.240343Z","submitted_at":"2025-02-12T09:39:54Z","title":"Inference-time sparse attention with asymmetric indexing","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T05:56:55.130242Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2502.08246"},"observation_digest":"sha256:50bc5b210183b2c3d0e8477d5bc0aaed2d5631d9f23db06f82edce9fb9f58099","observation_id":"5d3def96-2c07-4025-8407-26f66ab15109","resolution":{"observed_at":"2026-08-08T05:56:55.130242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-09T04:28:03.935822Z","title":"Gear: An efficient kv cache compression recipefor near-lossless generative inference of llm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10424","last_updated":"2025-02-05T20:43:48Z","snapshot_observed_at":"2026-08-09T15:11:12.836727Z","submitted_at":"2025-02-05T20:43:48Z","title":"QuantSpec: Self-Speculative Decoding with Hierarchical Quantized KV Cache","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T04:28:03.935822Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2502.10424"},"observation_digest":"sha256:b5c5cadbdd21159791a86274e6e22c667f7128b6d1a73670c99bebc7b1c0a039","observation_id":"d31dcdd4-0ac6-4064-8f01-5ef9ccc71d1c","resolution":{"observed_at":"2026-08-09T04:28:03.935822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2503.19950","last_updated":"2025-03-25T16:24:45Z","snapshot_observed_at":"2026-08-02T05:11:13.500453Z","submitted_at":"2025-03-25T16:24:45Z","title":"LogQuant: Log-Distributed 2-Bit Quantization of KV Cache with Superior Accuracy Preservation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T22:07:37.906916Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2503.19950"},"observation_digest":"sha256:0d991d46999694bac2fe3454e795314c3eca108dadaa311b354ac255a18d2edd","observation_id":"3ccfd40f-ed8b-4b96-b152-e504110dea8f","resolution":{"observed_at":"2026-05-22T22:12:11.639029Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2504.19874","last_updated":"2025-04-28T15:05:35Z","snapshot_observed_at":"2026-08-01T14:10:27.172555Z","submitted_at":"2025-04-28T15:05:35Z","title":"TurboQuant: Online Vector Quantization with Near-optimal Distortion Rate","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T08:09:22.226608Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2504.19874"},"observation_digest":"sha256:38b16f0feed9a6e9c5935026f669a566fba600574f14c18b856db38d07a86491","observation_id":"85e7572d-1ce2-4964-828f-7d62707c5a7a","resolution":{"observed_at":"2026-05-20T08:09:22.423835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-07T14:16:45.550536Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19481","last_updated":"2025-05-26T04:03:48Z","snapshot_observed_at":"2026-08-09T06:39:07.678380Z","submitted_at":"2025-05-26T04:03:48Z","title":"Win Fast or Lose Slow: Balancing Speed and Accuracy in Latency-Sensitive Decisions of LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:45.550536Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2505.19481"},"observation_digest":"sha256:aa535780e6b80db95c6a78b3e511c31b66466d1691d2e453549ff002825a8227","observation_id":"704c6af7-e828-4af3-a14c-e0b581fc656f","resolution":{"observed_at":"2026-08-07T14:16:45.550536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-07T14:16:40.300614Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19586","last_updated":"2025-05-27T03:16:32Z","snapshot_observed_at":"2026-08-10T23:44:35.850150Z","submitted_at":"2025-05-26T07:00:04Z","title":"TailorKV: A Hybrid Framework for Long-Context Inference via Tailored KV Cache Optimization","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:16:40.300614Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2505.19586"},"observation_digest":"sha256:57db6af50b51a2747c428152ac251e742cd64b2bb517f0685529ab425a0cf4e7","observation_id":"7e68ccd2-51c8-47b1-a411-fa6b04f267a7","resolution":{"observed_at":"2026-08-07T14:16:40.300614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-07T14:16:14.282281Z","title":"Gear: An efficient kv cache compression recipefor near-lossless generative inference of llm.arXiv preprint arXiv:2403.05527, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19602","last_updated":"2025-05-26T07:11:42Z","snapshot_observed_at":"2026-08-08T23:51:09.753030Z","submitted_at":"2025-05-26T07:11:42Z","title":"Memory-Efficient Visual Autoregressive Modeling with Scale-Aware KV Cache Compression","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:14.282281Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2505.19602"},"observation_digest":"sha256:4c0c14ab55348d6c44854f1190c4f7a1622ec723f2708bb866eb662bdd4beef2","observation_id":"38eff18d-581c-469e-8f75-d9b88ac6bfaf","resolution":{"observed_at":"2026-08-07T14:16:14.282281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-07T10:45:09.879572Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04642","last_updated":"2025-06-05T05:23:38Z","snapshot_observed_at":"2026-08-11T12:22:25.485792Z","submitted_at":"2025-06-05T05:23:38Z","title":"TaDA: Training-free recipe for Decoding with Adaptive KV Cache Compression and Mean-centering","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:09.879572Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2506.04642"},"observation_digest":"sha256:66701e709a850155abe20cacbf79256bcef14d7536db42657d49bc2e412c9cad","observation_id":"d693ca11-8206-4880-b0da-41d86b5d3cf7","resolution":{"observed_at":"2026-08-07T10:45:09.879572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-06T13:57:15.727858Z","title":"GEAR: an efficient KV cache compression recipe for near-lossless generative inference of LLM","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19906","last_updated":"2025-08-04T08:19:26Z","snapshot_observed_at":"2026-08-08T09:20:56.167689Z","submitted_at":"2025-07-26T10:34:53Z","title":"CaliDrop: KV Cache Compression with Calibration","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:15.727858Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2507.19906"},"observation_digest":"sha256:da10a67e98be16b9eb37f2fdf1d52b31098f01ac4793c1b51fcea34cca7a490c","observation_id":"5310eae0-5bb4-4afe-ac14-c9176c428768","resolution":{"observed_at":"2026-08-06T13:57:15.727858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-06T05:00:04.860070Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02401","last_updated":"2025-08-04T13:26:16Z","snapshot_observed_at":"2026-08-10T18:28:54.722460Z","submitted_at":"2025-08-04T13:26:16Z","title":"CompressKV: Semantic Retrieval Heads Know What Tokens are Not Important Before Generation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T05:00:04.860070Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2508.02401"},"observation_digest":"sha256:955fa9d57189718aeb5f602155828e6ec8af831eda7321180993af4a0f1f8582","observation_id":"8c0fae0e-b197-4574-816e-8b75130645d1","resolution":{"observed_at":"2026-08-06T05:00:04.860070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2508.15601","last_updated":"2026-05-15T15:18:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-21T14:24:52Z","title":"LMDeploy Accelerates Mixed-Precision LLM Inference with TurboMind","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T22:16:07.638869Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2508.15601"},"observation_digest":"sha256:16e71a591d7e5f27a56bb11e9b8b902df84ba1e2460b77baa46192fe82176bfb","observation_id":"5270e236-184d-421b-947a-e5617649799a","resolution":{"observed_at":"2026-05-21T22:20:42.120063Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-05T10:16:13.082094Z","title":"Kwon, W.; Li, Z.; Zhuang, S.; Sheng, Y .; Zheng, L.; Yu, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04377","last_updated":"2025-09-04T16:40:01Z","snapshot_observed_at":"2026-08-06T07:33:15.787399Z","submitted_at":"2025-09-04T16:40:01Z","title":"PagedEviction: Structured Block-wise KV Cache Pruning for Efficient Large Language Model Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T10:16:13.082094Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2509.04377"},"observation_digest":"sha256:4534d412e8c327f1d51a08dba10b8582c5ab85fd46c3b65001228b85416c4dca","observation_id":"e588fc88-901c-4328-a74b-94078c24fee2","resolution":{"observed_at":"2026-08-05T10:16:13.082094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2602.02958","last_updated":"2026-05-05T23:46:52Z","snapshot_observed_at":"2026-08-11T02:29:46.998602Z","submitted_at":"2026-02-03T00:54:32Z","title":"Quant VideoGen: Auto-Regressive Long Video Generation via 2-Bit KV-Cache Quantization","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T07:58:24.456859Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2602.02958"},"observation_digest":"sha256:3fe784e1f8137b0ab4d7d7e81d67df7847f1943ef570dcca7cdabedbd9a7e987","observation_id":"17518d99-034c-4515-9726-e2b0bf2e9a12","resolution":{"observed_at":"2026-05-16T08:00:44.636266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2604.02525","last_updated":"2026-05-07T21:33:53Z","snapshot_observed_at":"2026-08-11T01:47:33.577783Z","submitted_at":"2026-04-02T21:24:15Z","title":"AdaHOP: Fast and Accurate Low-Precision Training via Outlier-Pattern-Aware Rotation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T20:51:39.641700Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2604.02525"},"observation_digest":"sha256:d010463233e94de84ff3350c449251c17f2494add7d9d458f187ad16e67990e6","observation_id":"26180e94-c9d8-4f74-b93b-983fce023816","resolution":{"observed_at":"2026-05-13T20:53:15.737296Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2604.11501","last_updated":"2026-04-13T14:06:18Z","snapshot_observed_at":"2026-07-06T22:59:54.573362Z","submitted_at":"2026-04-13T14:06:18Z","title":"Quantization Dominates Rank Reduction for KV-Cache Compression","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-10T15:43:48.986845Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2604.11501"},"observation_digest":"sha256:8d06398d1fd9863b297a95bc5cc5cac0bf375ad00587ffe56a5c91b5d2e470ec","observation_id":"ec38aa1a-be53-4a07-baac-d56e0703140e","resolution":{"observed_at":"2026-05-11T09:56:04.560722Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2604.16957","last_updated":"2026-04-18T10:39:28Z","snapshot_observed_at":"2026-08-11T10:34:34.054849Z","submitted_at":"2026-04-18T10:39:28Z","title":"Open-TQ-Metal: Fused Compressed-Domain Attention for Long-Context LLM Inference on Apple Silicon","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T07:18:26.936652Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2604.16957"},"observation_digest":"sha256:630a5c5499255562ee0908a3a16e3ea677163fec1ae68bc5f558c2754d476a08","observation_id":"e33bd435-4711-41ab-9309-1743ef658143","resolution":{"observed_at":"2026-05-10T07:52:14.192689Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2604.19157","last_updated":"2026-04-21T07:12:23Z","snapshot_observed_at":"2026-08-11T08:30:34.261679Z","submitted_at":"2026-04-21T07:12:23Z","title":"SAW-INT4: System-Aware 4-Bit KV-Cache Quantization for Real-World LLM Serving","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T03:09:51.453839Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2604.19157"},"observation_digest":"sha256:c569e978eedb47250621b69689e9a16d956f57713efb07ef879bef9d9243732b","observation_id":"8196466f-24c9-400c-b563-0b79058b682c","resolution":{"observed_at":"2026-05-10T03:14:08.289804Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2605.02905","last_updated":"2026-04-06T02:05:52Z","snapshot_observed_at":"2026-08-11T13:40:20.680814Z","submitted_at":"2026-04-06T02:05:52Z","title":"eOptShrinkQ: Near-Lossless KV Cache Compression Through Optimal Spectral Denoising and Quantization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T20:18:04.392331Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2605.02905"},"observation_digest":"sha256:0b72b33be18c641fcedd407b897f313684b44c5bd1089468566d1121c7d9d95d","observation_id":"853184f9-946d-43a3-97c6-c185c304cb92","resolution":{"observed_at":"2026-05-10T22:00:50.797121Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2605.03562","last_updated":"2026-05-19T17:40:13Z","snapshot_observed_at":"2026-07-06T23:16:30.147006Z","submitted_at":"2026-05-05T09:34:51Z","title":"HeadQ: Model-Visible Distortion and Score-Space Correction for KV-Cache Quantization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-07T17:07:28.163304Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2605.03562"},"observation_digest":"sha256:1f590b2bd4337417276f69c68484b7379c0f7b14857285c27820cf16790c0290","observation_id":"797c33ad-141e-49f6-8239-64969751bc78","resolution":{"observed_at":"2026-05-12T11:01:29.722007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2605.03562","last_updated":"2026-05-19T17:40:13Z","snapshot_observed_at":"2026-07-06T23:16:30.147006Z","submitted_at":"2026-05-05T09:34:51Z","title":"HeadQ: Model-Visible Distortion and Score-Space Correction for KV-Cache Quantization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T18:33:19.999707Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2605.03562"},"observation_digest":"sha256:16f0340b5b415187f651e00c6b3c0183f3f0923126eb080f8a57506157c44561","observation_id":"df78a131-79cd-47f3-88b3-b5c660288077","resolution":{"observed_at":"2026-05-09T06:20:42.525075Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2605.11478","last_updated":"2026-05-12T03:45:53Z","snapshot_observed_at":"2026-08-04T07:02:09.241482Z","submitted_at":"2026-05-12T03:45:53Z","title":"FibQuant: Universal Vector Quantization for Random-Access KV-Cache Compression","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T01:42:45.446358Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2605.11478"},"observation_digest":"sha256:c59b8eaa34f9ea51fb6e6740a66ca8c49bdee5d48bb6f9b04577284242d673f5","observation_id":"441450c7-0f1c-42e7-9131-5233b47e043f","resolution":{"observed_at":"2026-05-13T01:47:04.506719Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2605.12464","last_updated":"2026-05-12T17:50:08Z","snapshot_observed_at":"2026-08-11T12:14:06.348625Z","submitted_at":"2026-05-12T17:50:08Z","title":"Search Your Block Floating Point Scales!","version":1},"reference_index":129,"source":"arxiv_source","source_observed_at":"2026-05-13T05:52:26.558984Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2605.12464"},"observation_digest":"sha256:7248119ad2f93ca60532d787413af5493bfcaff7628277210716da7f06c634d9","observation_id":"13fa2f57-062c-406d-be67-dd173170a9b3","resolution":{"observed_at":"2026-05-13T06:02:24.096602Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2605.17757","last_updated":"2026-05-18T02:24:29Z","snapshot_observed_at":"2026-07-06T23:28:45.646975Z","submitted_at":"2026-05-18T02:24:29Z","title":"OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T12:16:07.797702Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2605.17757"},"observation_digest":"sha256:949d8aedb57f60e9c0a5b97b3ddcae965469914f21390bc41f9e951c506a558b","observation_id":"c1a85a81-d71c-4f62-829f-0e32b90b9bd7","resolution":{"observed_at":"2026-05-20T12:18:16.457796Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2605.18856","last_updated":"2026-06-07T06:58:25Z","snapshot_observed_at":"2026-08-02T07:58:37.314471Z","submitted_at":"2026-05-13T18:48:48Z","title":"SPHERICAL KV: Angle-Domain Attention and Rate-Distortion Retention for Efficient Long-Context Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T20:30:33.208386Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2605.18856"},"observation_digest":"sha256:7e7cf19299bbc6fba7ebdda9adec0c01b51c9cb2795b468d45db41d5fcc254af","observation_id":"ca781ce1-a450-4219-a64e-c587edc7e076","resolution":{"observed_at":"2026-05-20T20:33:43.288306Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2605.18856","last_updated":"2026-06-07T06:58:25Z","snapshot_observed_at":"2026-08-02T07:58:37.314471Z","submitted_at":"2026-05-13T18:48:48Z","title":"SPHERICAL KV: Angle-Domain Attention and Rate-Distortion Retention for Efficient Long-Context Inference","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T21:27:19.945653Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2605.18856"},"observation_digest":"sha256:adb0ff34ab30fd87b9ee72727db6cb7a687b170526d96ce749773dcdd9ee0200","observation_id":"2a04797a-b0e8-4365-b0dc-8c53e5360920","resolution":{"observed_at":"2026-06-30T21:35:04.844560Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2605.23258","last_updated":"2026-05-22T06:00:15Z","snapshot_observed_at":"2026-08-03T03:36:58.256274Z","submitted_at":"2026-05-22T06:00:15Z","title":"A Simple Plug-in for Improving Eviction-Based KV Cache Compression","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-25T04:51:04.068354Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2605.23258"},"observation_digest":"sha256:45f6936d2554e5e39a33e41d6619d05791b24100328c58a210274c3575ba5bc0","observation_id":"f7c3e792-1262-4343-8413-d6b058d1550a","resolution":{"observed_at":"2026-05-25T04:55:24.195044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2606.00365","last_updated":"2026-05-29T21:07:27Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T21:07:27Z","title":"SPARQLe: Sub-Precision Activation Representation for Quantized LLM Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T19:31:28.053090Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2606.00365"},"observation_digest":"sha256:2120cae4facaff8cf206b94c9936645c6b2dd3fe84fb6b2ca0e79458f83514da","observation_id":"9303a006-593e-45b9-a8f5-a8099fd3cf29","resolution":{"observed_at":"2026-06-28T19:32:34.748513Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2606.04557","last_updated":"2026-06-03T07:42:55Z","snapshot_observed_at":"2026-08-08T23:24:24.807467Z","submitted_at":"2026-06-03T07:42:55Z","title":"Cartridges at Scale: Training Modular KV Caches over Large Document Collections","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T06:11:18.942446Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2606.04557"},"observation_digest":"sha256:c130b50c30d7f649865fc47c9b998843d65643267a4bcef83656e21cd0eafdb3","observation_id":"b0381d89-0d97-4b00-8633-f384ba79211f","resolution":{"observed_at":"2026-07-02T08:16:48.165901Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2606.08302","last_updated":"2026-06-06T18:58:26Z","snapshot_observed_at":"2026-08-06T09:32:24.096311Z","submitted_at":"2026-06-06T18:58:26Z","title":"HACK++: Towards More Effective Head-Aware Key-Value Compression for Efficient Visual Autoregressive Modeling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T19:46:43.514413Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2606.08302"},"observation_digest":"sha256:812439ac033de2676f6af79be35ac84a2bc4b91a165121075c4f28567b2342f4","observation_id":"50e46d3f-fb28-403a-8037-c3b8c563c7ef","resolution":{"observed_at":"2026-07-02T21:27:24.340384Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2606.09916","last_updated":"2026-06-06T15:54:48Z","snapshot_observed_at":"2026-08-01T16:04:11.631139Z","submitted_at":"2026-06-06T15:54:48Z","title":"IntentKV: Cross-Turn Intent-Aware KV Cache Pruning for Agent Inference","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-27T20:04:44.703782Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2606.09916"},"observation_digest":"sha256:610939c57f2621011c78e31847f21f2d835e1d9de54e4052be440393f91008ab","observation_id":"17ab5027-5332-4216-9e0e-d8146a8dcd68","resolution":{"observed_at":"2026-07-02T20:57:22.957997Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2606.23581","last_updated":"2026-06-22T16:47:00Z","snapshot_observed_at":"2026-07-06T23:58:16.163783Z","submitted_at":"2026-06-22T16:47:00Z","title":"Kamera: Unified Position-Invariant Multimodal KV Cache for Training-Free Reuse","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-26T07:13:19.593093Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2606.23581"},"observation_digest":"sha256:8a614470644a501e040ff0b5aec5734c7ba5b13a6069bb0400eda67ac582efea","observation_id":"2783ee1a-32f5-46ff-a527-f7e05aed2797","resolution":{"observed_at":"2026-07-04T12:09:48.918409Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2606.24033","last_updated":"2026-06-23T00:17:48Z","snapshot_observed_at":"2026-08-05T22:30:32.069600Z","submitted_at":"2026-06-23T00:17:48Z","title":"RoPE-Aware Bit Allocation for KV-Cache Quantization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T01:05:13.790381Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2606.24033"},"observation_digest":"sha256:225817cd8eed405f559b046d2fc3d26863acac4122ab1802262bbeae0dd030b3","observation_id":"6e81c4dd-1205-4d79-a1a9-75556b9e8042","resolution":{"observed_at":"2026-07-04T15:59:57.355432Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-09T07:36:37.074805Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:b900a870f24a531af5b0d13451b3ec9f7c4ceae4d090c6c955cb398797e82fd1","observation_id":"95bb6d88-1f3e-47bd-8e44-4d6174afc6c8","resolution":{"observed_at":"2026-07-04T16:49:58.047166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2607.00760","last_updated":"2026-07-01T10:44:57Z","snapshot_observed_at":"2026-08-06T16:04:36.275537Z","submitted_at":"2026-07-01T10:44:57Z","title":"MosaicKV: Serving Long-Context LLM with Dynamic Two-D KV Cache Compression","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-02T16:12:12.043127Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2607.00760"},"observation_digest":"sha256:b964a07dbd095873d339b3814349056684959b99e1db815150b1b235b7ab0843","observation_id":"0ed7ecab-b701-4395-bc41-f5a5b61cc369","resolution":{"observed_at":"2026-07-02T16:17:08.402573Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-12T09:50:23.266920Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02574","last_updated":"2026-06-30T16:12:40Z","snapshot_observed_at":"2026-07-12T09:50:22.497230Z","submitted_at":"2026-06-30T16:12:40Z","title":"From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-12T09:50:23.266920Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2607.02574"},"observation_digest":"sha256:bd366638e450c8a1ea3be4f8a147ff82403829e6f823061a9ff866e93fbe4307","observation_id":"7cdd29e4-e91d-495a-807c-9983e269bd1a","resolution":{"observed_at":"2026-07-12T09:50:23.266920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2607.08032","last_updated":"2026-07-09T01:15:03Z","snapshot_observed_at":"2026-08-02T16:38:21.894642Z","submitted_at":"2026-07-09T01:15:03Z","title":"What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-10T01:26:59.421158Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2607.08032"},"observation_digest":"sha256:6ffdd2ad6a1b771470cb64bc8568eac89b3089693fb88dd850e2d07627655081","observation_id":"afa6ae33-80fd-418f-97e1-0fb83778e755","resolution":{"observed_at":"2026-07-10T01:36:44.079355Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":"2403.05527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-07-10T01:36:44.078109Z","title":"Gear: An efficient kv cache compression recipe for near-lossless generative inference of llm","venue":"cs.LG","work_id":"26d3dd66-4e37-4f27-a590-526883aef922","year":2024},"citing_paper":{"arxiv_id":"2607.08057","last_updated":"2026-07-09T02:11:18Z","snapshot_observed_at":"2026-08-04T11:12:32.355642Z","submitted_at":"2026-07-09T02:11:18Z","title":"Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-10T00:55:52.215700Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2607.08057"},"observation_digest":"sha256:f16b444581679b2f7457c49e7502a81a86ad10141b318f0873f783e60ee30375","observation_id":"c5c2f566-6573-44f2-83fe-7b5390964c35","resolution":{"observed_at":"2026-07-10T00:56:40.965166Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-06T00:48:33.732453Z","title":"Preprint, arXiv:2403.05527","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00902","last_updated":"2026-08-02T00:08:44Z","snapshot_observed_at":"2026-08-09T16:29:08.600847Z","submitted_at":"2026-08-02T00:08:44Z","title":"Practical Online KV Cache Compaction for LLM Agents: An Empirical Study","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T00:48:33.732453Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2608.00902"},"observation_digest":"sha256:f7ee821f649b8aa189881e5a7a1e9edcaae451dbf2934bf258af996d876f7387","observation_id":"b22813b0-b0d5-4967-9874-23a3fff43484","resolution":{"observed_at":"2026-08-06T00:48:33.732453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-07T22:11:58.745454Z","title":"Kang et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05863","last_updated":"2026-08-06T10:41:50Z","snapshot_observed_at":"2026-08-11T05:40:36.698252Z","submitted_at":"2026-08-06T10:41:50Z","title":"Runtime Observability for Heterogeneous Attention Memory","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T22:11:58.745454Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2608.05863"},"observation_digest":"sha256:b45cebd376f2a6e6bffdd57b6a830aa72bdff8496f4b76f84d1e9f31fdeeada4","observation_id":"9f2f53e8-1e16-4af1-b737-44aa270e9204","resolution":{"observed_at":"2026-08-07T22:11:58.745454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2403.05527/citation-record","integrity":"/paper/2403.05527/integrity","json":"/paper/2403.05527/citation-record.json","paper":"/paper/2403.05527"},"outbound":[],"paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T12:20:18.370756Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 51 inbound Pith citation observations for arXiv:2403.05527."}