{"as_of":"2026-08-04T10:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:186569a445d737b25388d553964233d4d8be39559781134cc0ec54b67940549a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":38,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T17:10:08.496622Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T06:15:00.866473Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2312.05821","last_updated":"2025-08-28T03:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-10T08:41:24Z","title":"ASVD: Activation-aware Singular Value Decomposition for Compressing Large Language Models","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T13:49:33.747672Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2312.05821"},"observation_digest":"sha256:0a82d88b5c53ea156d6267db58f9af45fc0f87c96cdf4d94b2322dc698287b0f","observation_id":"49358396-5a24-42bf-a26e-8110a97c2a08","resolution":{"observed_at":"2026-05-20T13:49:33.837276Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T08:20:01.011625Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2312.07104"},"observation_digest":"sha256:a4120df378da6abe650abd1489be5942f8d26c9445c285079bf16bbaf5621c62","observation_id":"f0ce2c05-fd48-4cd7-8700-7480987707f1","resolution":{"observed_at":"2026-05-12T08:20:01.106533Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-07-06T17:25:18.238343Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T08:53:12.253243Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2402.02750"},"observation_digest":"sha256:813d56690b16cb07a9cf6b3c69feeb14fb957aa10bc8bc4f224af1aa2400bbc4","observation_id":"1d83d1f5-4133-4531-ba96-1b93e15fbeb0","resolution":{"observed_at":"2026-05-12T08:53:12.320304Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"reference_index":219,"source":"pdf_text","source_observed_at":"2026-05-15T02:39:33.007894Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2404.14294"},"observation_digest":"sha256:0528f5963369bf3f3582a6e92eccab93900814f54279f8231880af36950bdca7","observation_id":"8d622d52-b7d1-44e9-8a56-00fc999812ca","resolution":{"observed_at":"2026-05-15T02:39:33.280738Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:8c2f3c55c5fba268acff924d42bcb504ab1b3e8e5f3e2df24cfb80e49fb6a6c2","observation_id":"b6d19c84-6bc0-4145-8471-c17e03e40217","resolution":{"observed_at":"2026-05-11T05:36:26.480168Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2407.08608","last_updated":"2024-07-12T22:15:02Z","snapshot_observed_at":"2026-07-06T18:44:53.587276Z","submitted_at":"2024-07-11T15:44:48Z","title":"FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T19:45:36.337956Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2407.08608"},"observation_digest":"sha256:1ee5ed2c1421ab443a98e27ddd07545c7b6f6678bca5a9d93b6aefc991ab5a20","observation_id":"b8ca3e16-9a01-4171-917a-ef22f8c98e96","resolution":{"observed_at":"2026-05-20T19:45:36.452789Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2504.19874","last_updated":"2025-04-28T15:05:35Z","snapshot_observed_at":"2026-08-01T14:10:27.172555Z","submitted_at":"2025-04-28T15:05:35Z","title":"TurboQuant: Online Vector Quantization with Near-optimal Distortion Rate","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T08:09:22.226608Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2504.19874"},"observation_digest":"sha256:7e345b6cec344dd3af5f59893d5a33dff4926b2f069393649b41594b9c2d281e","observation_id":"7b6d9095-11a4-4ee2-aac3-bd77a67b6b77","resolution":{"observed_at":"2026-05-20T08:09:22.397439Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2509.17396","last_updated":"2026-05-19T20:55:44Z","snapshot_observed_at":"2026-07-06T22:30:26.679189Z","submitted_at":"2025-09-22T06:56:35Z","title":"EpiCache: Episodic KV Cache Management for Long-Term Conversation on Resource-Constrained Environments","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-21T21:54:05.442769Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2509.17396"},"observation_digest":"sha256:b2a933783400d74345679bb5a7e7b00a5dd62bd75a3b277034389abb5fcb9672","observation_id":"983a32bc-107b-44c9-a3e0-41e1c4621837","resolution":{"observed_at":"2026-05-21T21:54:22.821265Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-03T17:10:08.496622Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10656","last_updated":"2026-06-08T08:57:35Z","snapshot_observed_at":"2026-08-03T17:10:05.838701Z","submitted_at":"2025-12-11T14:02:34Z","title":"Token Sample Complexity of Attention","version":3},"reference_index":1963,"source":"pdf_text","source_observed_at":"2026-08-03T17:10:08.496622Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2512.10656"},"observation_digest":"sha256:86bbc01d5e129f1018b66e44ba53aa7bc0d143581a5424e7a5ffc64ff63fca53","observation_id":"15760c83-790d-4e7a-b65e-b4d4e8dcae70","resolution":{"observed_at":"2026-08-03T17:10:08.496622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-02T20:43:37.256381Z","title":"(2024).KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantiza- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.06642","last_updated":"2026-07-22T21:06:43Z","snapshot_observed_at":"2026-08-02T20:43:35.550442Z","submitted_at":"2026-02-26T01:54:24Z","title":"SR-TTT Does Not Learn Retrieval: A Correction and Mechanistic Post-Mortem of Surprisal-Aware Residual Test-Time Training","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T20:43:37.256381Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2603.06642"},"observation_digest":"sha256:16e269e09b9b340925f7c666cc85fe058f5e865144bdadcdf0d9c8a0d9865ae5","observation_id":"d8e2c0b5-458f-4baf-b766-d3d418fc5841","resolution":{"observed_at":"2026-08-02T20:43:37.256381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2604.15356","last_updated":"2026-04-10T22:48:19Z","snapshot_observed_at":"2026-07-06T23:02:53.677687Z","submitted_at":"2026-04-10T22:48:19Z","title":"Sequential KV Cache Compression via Probabilistic Language Tries: Beyond the Per-Vector Shannon Limit","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T16:46:14.866351Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2604.15356"},"observation_digest":"sha256:71a5c51d5bdf546bfa0245747c224b7d0fbf8da881b03738d1cada4aa7e38fdf","observation_id":"d5d4f3d5-68a8-4f87-9c2e-6f24aedf0a2d","resolution":{"observed_at":"2026-05-11T08:11:05.119893Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2604.24971","last_updated":"2026-04-27T20:10:21Z","snapshot_observed_at":"2026-07-06T23:10:52.763251Z","submitted_at":"2026-04-27T20:10:21Z","title":"PolyKV: A Shared Asymmetrically-Compressed KV Cache Pool for Multi-Agent LLM Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T03:55:32.585495Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2604.24971"},"observation_digest":"sha256:6cff22b8c070a79bb4fdea26684b891ad18312ddbcb5cd99d7473693c4acbadd","observation_id":"cde0251b-0d4b-4c31-bb72-819a7691390c","resolution":{"observed_at":"2026-05-11T21:51:34.356303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:cb1b5d44176698539a79eedc270ec1f5c58a56665e5701d829f4bc458c06aa03","observation_id":"c7fc36aa-0ad4-44f9-93ab-ccb34322ac62","resolution":{"observed_at":"2026-05-11T16:36:08.002040Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2605.03562","last_updated":"2026-05-19T17:40:13Z","snapshot_observed_at":"2026-07-06T23:16:30.147006Z","submitted_at":"2026-05-05T09:34:51Z","title":"HeadQ: Model-Visible Distortion and Score-Space Correction for KV-Cache Quantization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-07T17:07:28.163304Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2605.03562"},"observation_digest":"sha256:deb284701aa22331c1fcb893674356a0fe4fd7695be1236cb4286ec0184d0e1b","observation_id":"d57de22e-4e01-405f-8866-348250b34b03","resolution":{"observed_at":"2026-05-12T11:01:29.776641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2605.03562","last_updated":"2026-05-19T17:40:13Z","snapshot_observed_at":"2026-07-06T23:16:30.147006Z","submitted_at":"2026-05-05T09:34:51Z","title":"HeadQ: Model-Visible Distortion and Score-Space Correction for KV-Cache Quantization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T18:33:19.999707Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2605.03562"},"observation_digest":"sha256:5d5a4cb9bdc257a1186e293f861953224ebefae6925d44ad2c88d677688329f9","observation_id":"0cd80202-ee07-453b-b303-5406d11e96aa","resolution":{"observed_at":"2026-05-09T06:20:42.515117Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2605.08966","last_updated":"2026-05-09T14:20:17Z","snapshot_observed_at":"2026-07-31T09:22:55.190123Z","submitted_at":"2026-05-09T14:20:17Z","title":"VORT: Adaptive Power-Law Memory for NLP Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T02:01:53.000938Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2605.08966"},"observation_digest":"sha256:cac49fa92627d16a578b25375e2dd8c20edf7e7d152ec2246e5ecfa410f5e722","observation_id":"6413a979-1151-4d0a-b089-2bb3db893e42","resolution":{"observed_at":"2026-05-12T07:46:26.259266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2605.18053","last_updated":"2026-05-18T08:41:34Z","snapshot_observed_at":"2026-07-06T23:28:59.503300Z","submitted_at":"2026-05-18T08:41:34Z","title":"Protection Is (Nearly) All You Need: Structural Protection Dominates Scoring in Globally Capped KV Eviction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T12:13:14.295659Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2605.18053"},"observation_digest":"sha256:17b952b453adbebebfdd2c9b0a3782d73bbcbea2f692ce13c7fdb79cd67b27ed","observation_id":"e94c01d3-5644-4303-8353-e0656cc4ef32","resolution":{"observed_at":"2026-05-20T12:13:15.987749Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2605.18856","last_updated":"2026-06-07T06:58:25Z","snapshot_observed_at":"2026-08-02T07:58:37.314471Z","submitted_at":"2026-05-13T18:48:48Z","title":"SPHERICAL KV: Angle-Domain Attention and Rate-Distortion Retention for Efficient Long-Context Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T20:30:33.208386Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2605.18856"},"observation_digest":"sha256:25e4d9c922228040663d0ca03c7ee1e7a5a3a60ac2044158ed484332af823de2","observation_id":"f06e10bb-9277-48af-bb23-f84e9d816afa","resolution":{"observed_at":"2026-05-20T20:33:43.345093Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2605.20868","last_updated":"2026-05-20T08:04:40Z","snapshot_observed_at":"2026-07-06T23:31:23.407780Z","submitted_at":"2026-05-20T08:04:40Z","title":"Runtime-Certified Bounded-Error Quantized Attention","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T05:45:42.295527Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2605.20868"},"observation_digest":"sha256:2bf2f05700e69b0159058fa9a56e67b25fe6ba0c4caa5567ad04c25d7358e4ef","observation_id":"cf1e2c40-e430-4817-aeb3-4d4d392feff0","resolution":{"observed_at":"2026-05-21T05:49:41.109858Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2605.23200","last_updated":"2026-05-22T03:32:52Z","snapshot_observed_at":"2026-08-02T09:14:38.688799Z","submitted_at":"2026-05-22T03:32:52Z","title":"Adaptive Mass-Segmented KV Compression for Long-Context Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-25T05:22:47.198185Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2605.23200"},"observation_digest":"sha256:5a6c7f2eb90273067ce3de0103d65fdace491dd441f4edf433d673db69ab9723","observation_id":"4bfb4e11-c9c5-404c-906c-7a5c0666f1d5","resolution":{"observed_at":"2026-05-25T05:25:23.488548Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2605.25203","last_updated":"2026-05-24T18:05:37Z","snapshot_observed_at":"2026-08-04T10:11:25.132076Z","submitted_at":"2026-05-24T18:05:37Z","title":"Influence-Inspired Spectral Rotations for Extreme Low-Bit LLM Quantization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T12:13:18.805668Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2605.25203"},"observation_digest":"sha256:d48ed6596a833dbdc14f55a08808efa4bef9e413fd2a7a864656e832d41eac0d","observation_id":"e1012cfb-6667-488f-bf37-162f4e42edaf","resolution":{"observed_at":"2026-06-30T12:14:39.072739Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2606.02780","last_updated":"2026-07-18T16:18:38Z","snapshot_observed_at":"2026-08-02T12:41:17.637289Z","submitted_at":"2026-06-01T18:43:34Z","title":"Do Value Vectors in Deep Layers Need Context from the Residual Stream?","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-06-28T14:35:48.292081Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2606.02780"},"observation_digest":"sha256:ead487257382f7115755b5d1d28ad77825b5d3a94e8eaf1636bdaae773a39150","observation_id":"e4e72868-c583-4321-a84e-da0be5a57f9e","resolution":{"observed_at":"2026-07-01T23:16:23.448886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-02T12:41:20.552739Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02780","last_updated":"2026-07-18T16:18:38Z","snapshot_observed_at":"2026-08-02T12:41:17.637289Z","submitted_at":"2026-06-01T18:43:34Z","title":"Do Value Vectors in Deep Layers Need Context from the Residual Stream?","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-02T12:41:20.552739Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2606.02780"},"observation_digest":"sha256:7d58a33d04414055cb7ef9a68d4ec2aac9f1fa75edce15f790156eba26202ebf","observation_id":"2c5b01e8-7ed2-4d15-b55c-7efbd6e447c3","resolution":{"observed_at":"2026-08-02T12:41:20.552739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2606.08382","last_updated":"2026-06-07T00:24:02Z","snapshot_observed_at":"2026-08-01T14:25:51.066603Z","submitted_at":"2026-06-07T00:24:02Z","title":"STAR-KV: Low-Rank KV Cache Compression via Soft Thresholding for Adaptive Rank Control","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T18:34:20.645677Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2606.08382"},"observation_digest":"sha256:31dae2dd9cc81026bb46475d2d07226ee9cafb998ee1082c2c0aac728cf35d8b","observation_id":"66f98172-5a50-4385-9606-d3916ec2c9c9","resolution":{"observed_at":"2026-07-02T22:57:26.297219Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2606.09508","last_updated":"2026-06-08T14:02:18Z","snapshot_observed_at":"2026-08-03T05:12:39.957667Z","submitted_at":"2026-06-08T14:02:18Z","title":"From Rigid to Dynamic: Entropy-Guided Adaptive Inference for Long-Context LLMs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-27T16:57:02.709967Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2606.09508"},"observation_digest":"sha256:6f6e6e24cc1a3a9d8bc34d0ca5e9931ef344ed3b80524dccf50c7213c4a5cf04","observation_id":"0d00ab5b-bcb2-46ef-b136-993c3c1a8dbf","resolution":{"observed_at":"2026-06-27T17:01:07.733642Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2606.09864","last_updated":"2026-06-01T02:02:20Z","snapshot_observed_at":"2026-08-03T01:43:21.917246Z","submitted_at":"2026-06-01T02:02:20Z","title":"Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-28T15:37:34.129339Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2606.09864"},"observation_digest":"sha256:ee37741025ab9639bddf8082d76732fff90b6a32364b0f762657d4590ae6188d","observation_id":"19ab3f4d-16ff-4062-b6f0-4af4d02abc83","resolution":{"observed_at":"2026-07-01T22:16:16.033365Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2607.01065","last_updated":"2026-07-01T15:25:21Z","snapshot_observed_at":"2026-07-07T00:06:39.908636Z","submitted_at":"2026-07-01T15:25:21Z","title":"GSRQ: Gain-Shape Residual Quantization for Sub-1-bit KV Cache","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-02T15:55:40.177742Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2607.01065"},"observation_digest":"sha256:d9d28545c25c5a16eb801a0f6e4b8d38c796ad2cbff6d4fead3aefd54b539bce","observation_id":"2bd10106-03ec-442b-b763-c59f9b220815","resolution":{"observed_at":"2026-07-02T15:57:06.412465Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-12T17:31:15.972423Z","title":"KVQuant: Towards 10M Context Length LLM Inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02523","last_updated":"2026-05-06T17:03:24Z","snapshot_observed_at":"2026-07-12T17:31:15.741658Z","submitted_at":"2026-05-06T17:03:24Z","title":"Edge-Deployable LLM Fine-Tuning on a Single GPU for Telecom Network Troubleshooting","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T17:31:15.972423Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2607.02523"},"observation_digest":"sha256:aef07d059ad160302b15ea77fad3b73678cd3410da158e77cd983fdfa1f0ef6a","observation_id":"8e5f9032-d7cd-4df2-aa58-ef1b88649739","resolution":{"observed_at":"2026-07-12T17:31:15.972423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2607.07144","last_updated":"2026-07-08T08:37:49Z","snapshot_observed_at":"2026-08-03T21:27:53.528630Z","submitted_at":"2026-07-08T08:37:49Z","title":"Fractal KV-Cache Archives: Lossless Symbolic Storage with In-Place Retrieval for Long-Context LLM Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-09T19:13:15.765652Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2607.07144"},"observation_digest":"sha256:6041388a52554639eab7fec4e1e346e0460791f8c7ed4e751de16adea162dcbc","observation_id":"318bfd26-f9f5-4a53-a10a-d232fb84b2f9","resolution":{"observed_at":"2026-07-09T19:16:27.748453Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2607.08032","last_updated":"2026-07-09T01:15:03Z","snapshot_observed_at":"2026-08-02T16:38:21.894642Z","submitted_at":"2026-07-09T01:15:03Z","title":"What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-10T01:26:59.421158Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2607.08032"},"observation_digest":"sha256:d45bda71a77b8c79f5eab107908329f42cdf547ca9ee11b6c847262535b84749","observation_id":"21137c33-95f5-443c-af0c-65450a67d571","resolution":{"observed_at":"2026-07-10T01:36:44.040808Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-14T12:07:13.700787Z","title":"Hooper, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10389","last_updated":"2026-07-11T16:36:47Z","snapshot_observed_at":"2026-07-31T10:41:09.482984Z","submitted_at":"2026-07-11T16:36:47Z","title":"Stateful Worlds, Stateless Elasticity: Exact-State Serving for Interactive World Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T12:07:13.700787Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2607.10389"},"observation_digest":"sha256:dcdd2da40cafb6c6331dbb91680b0a97cbd56ed6cf4a93640a6bc0524f2a3d30","observation_id":"079a02e3-8f49-4470-85f5-7c3e64a2be09","resolution":{"observed_at":"2026-07-14T12:07:13.700787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-02T03:55:40.433775Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization.arXiv preprint arXiv:2401.18079,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13735","last_updated":"2026-07-17T08:40:24Z","snapshot_observed_at":"2026-08-02T03:55:39.332940Z","submitted_at":"2026-07-15T11:47:24Z","title":"Constraint-Driven Model Optimization: An Industry Framework for Selecting Compression and Acceleration Techniques in Modern Machine Learning Systems","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T03:55:40.433775Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2607.13735"},"observation_digest":"sha256:7a5149ddbe574374454ed55356efdb7d0463b3170bee088e11195e083ad8c626","observation_id":"370400af-5b24-4d45-9b3e-a0fe5069a658","resolution":{"observed_at":"2026-08-02T03:55:40.433775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-01T23:22:30.957456Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15456","last_updated":"2026-07-24T02:15:23Z","snapshot_observed_at":"2026-08-02T19:24:36.291795Z","submitted_at":"2026-07-16T20:58:16Z","title":"Looped Latent Attention: Cross-Loop KV Compression for Looped Transformers","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T23:22:30.957456Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2607.15456"},"observation_digest":"sha256:05b8d5d6ee3243e235d596b39372b96e88a4378f3f62f16bc7a1deaec199e84a","observation_id":"c399909b-00ee-449b-aa0e-cdb766908015","resolution":{"observed_at":"2026-08-01T23:22:30.957456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-02T09:50:32.327649Z","title":"arXiv:2401.18079","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16248","last_updated":"2026-06-27T01:22:47Z","snapshot_observed_at":"2026-08-02T09:50:31.482150Z","submitted_at":"2026-06-27T01:22:47Z","title":"High-accuracy Low-Bit KV-Cache Quantization via Local Distribution Restoration","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T09:50:32.327649Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2607.16248"},"observation_digest":"sha256:686cc243c88a4c1c85f17ac294e150e6c861ffe4998eb48f3895f4d0f7a4df16","observation_id":"ad5553b7-0e5a-4377-b8c2-422f584943ce","resolution":{"observed_at":"2026-08-02T09:50:32.327649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-02T09:51:03.359796Z","title":"arXiv preprint arXiv:2401.18079 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16252","last_updated":"2026-06-27T03:25:36Z","snapshot_observed_at":"2026-08-03T16:48:30.105983Z","submitted_at":"2026-06-27T03:25:36Z","title":"SOS-LoRA: Static Orthogonal-Subspace Low-Rank Adaptation with Fixed Multi-Scale Scaling","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-02T09:51:03.359796Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2607.16252"},"observation_digest":"sha256:6658dc71f7050bd9577fcc572af7751d85c1dd6727d1d0d72a2a147c7f2b22e0","observation_id":"27aab2f4-0d4c-4593-9b3e-55914237ada8","resolution":{"observed_at":"2026-08-02T09:51:03.359796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-01T04:48:25.926385Z","title":"arXiv:2401.18079","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22448","last_updated":"2026-07-27T23:08:28Z","snapshot_observed_at":"2026-08-02T05:57:03.890923Z","submitted_at":"2026-07-24T16:10:21Z","title":"Where Facts Go Missing: A Layerwise Taxonomy and Per-Layer Attribution of Information Omission in Air-Gapped LLMAgent Pipelines","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T04:48:25.926385Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2607.22448"},"observation_digest":"sha256:d40e14579fe97a98403519b56733a8afea74edc6b91504adfac47bf5d6373d82","observation_id":"6ac5d3aa-ed7d-4947-bbca-b783de3c136c","resolution":{"observed_at":"2026-08-01T04:48:25.926385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-30T11:12:05.608333Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27187","last_updated":"2026-07-29T17:55:38Z","snapshot_observed_at":"2026-08-04T09:48:52.894295Z","submitted_at":"2026-07-29T17:55:38Z","title":"A Photonic-CXL Memory Appliance for Scalable KV Cache Management in LLM Inference","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-30T11:12:05.608333Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2607.27187"},"observation_digest":"sha256:17862784b3fb073b4078f22980c0f65338510272e190647fa2c2f05bcaa8dc05","observation_id":"270ca459-9ac7-4564-81ca-0a1b40cfb920","resolution":{"observed_at":"2026-07-30T11:12:05.608333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-03T00:43:49.304692Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28699","last_updated":"2026-07-30T11:04:45Z","snapshot_observed_at":"2026-08-04T10:26:15.517491Z","submitted_at":"2026-07-30T11:04:45Z","title":"WitCert: Sound Runtime Risk Observability and Gating for KV-Cache Quantization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T00:43:49.304692Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2607.28699"},"observation_digest":"sha256:c61b2bc3e6f25600ef6bd777b90c03346e5a4cd9c452f781aa4a526d7f386f37","observation_id":"4c113f63-5339-43b9-95e9-a9b797220e11","resolution":{"observed_at":"2026-08-03T00:43:49.304692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2401.18079/citation-record","integrity":"/paper/2401.18079/integrity","json":"/paper/2401.18079/citation-record.json","paper":"/paper/2401.18079"},"outbound":[],"paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","latest_version":6,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 38 inbound Pith citation observations for arXiv:2401.18079."}