{"as_of":"2026-08-13T17:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a8c5ad92d1d7caefa6988847e9ad4fd0c2ec32359e141cda9b2c0808c35fe24b","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:37:07.697300Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:38:47.483457Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T20:59:01.556666Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18077","snapshot_observed_at":"2026-08-11T00:38:47.483457Z","title":"Minikv: Pushing the limits of llm inference via 2-bit layer-discriminative kv cache,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19442","last_updated":"2025-07-30T05:24:46Z","snapshot_observed_at":"2026-08-11T00:33:34.388194Z","submitted_at":"2024-12-27T04:17:57Z","title":"A Survey on Large Language Model Acceleration based on KV Cache Management","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T00:38:47.483457Z"},"links":{"cited_paper":"/paper/2411.18077","citing_paper":"/paper/2412.19442"},"observation_digest":"sha256:c13be5166b3abebe44552c39dc80f44f41b1cad96e4a5d04047668df0c3e1a61","observation_id":"b1956160-20f3-4901-b2c6-5b51d48b213a","resolution":{"observed_at":"2026-08-11T00:38:47.483457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"cited_work":{"arxiv_id":"2411.18077","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.18077","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2411.18077 , archivePrefix=","venue":null,"work_id":"8b96ab00-6f39-497d-b161-17221f0b82ac","year":2024},"citing_paper":{"arxiv_id":"2605.14292","last_updated":"2026-05-17T02:21:29Z","snapshot_observed_at":"2026-08-07T18:13:26.175518Z","submitted_at":"2026-05-14T02:50:20Z","title":"Minimal-Intervention KV Retention via Set-Conditioned Diversity","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-20T20:58:07.403912Z"},"links":{"cited_paper":"/paper/2411.18077","citing_paper":"/paper/2605.14292"},"observation_digest":"sha256:72b8e82936109407852b986ed5f574b4e3edf7c68e394336f4766e666388089e","observation_id":"c752e517-becb-4267-8201-5ca35c10a045","resolution":{"observed_at":"2026-05-20T20:59:01.558729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"cited_work":{"arxiv_id":"2411.18077","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.18077","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2411.18077 , archivePrefix=","venue":null,"work_id":"8b96ab00-6f39-497d-b161-17221f0b82ac","year":2024},"citing_paper":{"arxiv_id":"2605.17757","last_updated":"2026-05-18T02:24:29Z","snapshot_observed_at":"2026-08-13T11:29:09.932959Z","submitted_at":"2026-05-18T02:24:29Z","title":"OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T12:16:07.797702Z"},"links":{"cited_paper":"/paper/2411.18077","citing_paper":"/paper/2605.17757"},"observation_digest":"sha256:bcde986e7bb3970dba00c355207af8b220fe1626806e9b91f85999e3df7f7d15","observation_id":"bbcf9321-28d6-400b-946f-c5dddb42a72e","resolution":{"observed_at":"2026-05-20T12:18:16.562435Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.18077/citation-record","integrity":"/paper/2411.18077/integrity","json":"/paper/2411.18077/citation-record.json","paper":"/paper/2411.18077"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:08.110511Z","title":null,"venue":null,"work_id":"6e12ee54-8c5f-4a3f-af22-fc986832c506","year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.544023Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:8a5d4c842744b7d4daa0fa10a5f6434d520de2895b36d34755be1b83c643b08f","observation_id":"e7ad4eaf-d1d5-4d47-a479-334cd7017ad5","resolution":{"observed_at":"2026-08-12T11:37:08.114579Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-12T11:37:07.548481Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.548481Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:20fa35acab0c90baed9180625e6cb2ab3c1c9f7d695435957467092275872846","observation_id":"5af67f7f-5cea-4d68-bef3-4751fcbf1add","resolution":{"observed_at":"2026-08-12T11:37:07.548481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12981","last_updated":"2024-05-21T17:59:29Z","snapshot_observed_at":"2026-08-13T00:02:45.706237Z","submitted_at":"2024-05-21T17:59:29Z","title":"Reducing Transformer Key-Value Cache Size with Cross-Layer Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12981","snapshot_observed_at":"2026-08-12T11:37:07.553067Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.553067Z"},"links":{"cited_paper":"/paper/2405.12981","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:b26fce2f4d5bf71810d0c5d3e0607d1fbd51df563849e80e280668452b79e706","observation_id":"592c3a29-2acc-4656-848d-50800257f37c","resolution":{"observed_at":"2026-08-12T11:37:07.553067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-08-13T04:39:30.300015Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02069","snapshot_observed_at":"2026-08-12T11:37:07.557293Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.557293Z"},"links":{"cited_paper":"/paper/2406.02069","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:c9b0488d2ade561eed44b07561cf7a1b24fd662659191dbe02a58092c8f82eb1","observation_id":"7d456d26-f44c-45d2-870e-b89f54a6f0c5","resolution":{"observed_at":"2026-08-12T11:37:07.557293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:07.561541Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher R \\' e","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.561541Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:e21a391b73db990006c6aa16da562039e2f8c32eb21f7594edbfb358bd3904f1","observation_id":"03199717-1dcd-425a-9376-503a74745195","resolution":{"observed_at":"2026-08-12T11:37:07.561541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-12T11:37:07.565472Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.565472Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:677233fedd6351f5637781499ad6e16c14c9634538b29c3c99c0d0c4898457c1","observation_id":"199d81b7-0328-4935-ada3-998fede18f89","resolution":{"observed_at":"2026-08-12T11:37:07.565472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-11T21:19:33.078277Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-12T11:37:07.570007Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.570007Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:e6bb35dc8735f6feb3b8cf284be37907efe49e5e129b6ba777c4be15d43207e1","observation_id":"e8433fc1-ed3c-4e87-9e95-4dd9418229ce","resolution":{"observed_at":"2026-08-12T11:37:07.570007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-08-13T17:20:07.444083Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-12T11:37:07.573793Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.573793Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:93c32323b25b1f6a3164d7756ca5306a07c5026d588c59843f5d2dfb9ad7d0ea","observation_id":"32394cf1-ad8c-4554-8e12-3cdc54a95116","resolution":{"observed_at":"2026-08-12T11:37:07.573793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-13T04:29:50.330115Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-12T11:37:07.577744Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.577744Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:8a4a93b6c9978daa6f9d6d172a1b25239c791dcffdfbefa190bb14765460f4ce","observation_id":"4cf2ff58-02f5-4c4c-91b4-2c10cc73130d","resolution":{"observed_at":"2026-08-12T11:37:07.577744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-12T11:37:07.581390Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.581390Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:06e72d576b29ab220f264cff6dfaf0579206d5af76ca1c7f8d4d1cec0a9c82f7","observation_id":"c6ce3c48-7d7e-4ca0-840a-3a7eb8132d43","resolution":{"observed_at":"2026-08-12T11:37:07.581390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:08.093030Z","title":null,"venue":null,"work_id":"a4379367-9b87-46b1-8bdf-16e9c40ea82c","year":2016},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.585359Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:7f24cddc8b8667ea65f2d972830d73a6da35ba42746c020bcbafffcb750e93e5","observation_id":"95b0495f-cc05-4fd9-b454-a6d9643c4add","resolution":{"observed_at":"2026-08-12T11:37:08.096814Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-07T22:57:56.263839Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-08-12T11:37:07.588847Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.588847Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:dabdb3e6fd4e77cbe558f6a0443d971f05522d76219d2ecb3365439479eadfe0","observation_id":"904d9b76-48d9-40e5-8e95-fd183426b773","resolution":{"observed_at":"2026-08-12T11:37:07.588847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:07.592449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.592449Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:bd08f1483858672de40575b0b25e7e348b7e9d94b3b1df131d0190c4305ab282","observation_id":"adbad6c2-b9d1-468a-b410-838668088066","resolution":{"observed_at":"2026-08-12T11:37:07.592449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-13T00:00:46.126397Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-12T11:37:07.595756Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.595756Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:bb60fb0be0ff058b23f644b53f6e15c581e8d13214df0ed668a9936a43a136e7","observation_id":"39ffc95a-dca4-42ef-829d-d6bc784359bd","resolution":{"observed_at":"2026-08-12T11:37:07.595756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09650","last_updated":"2021-06-17T16:53:22Z","snapshot_observed_at":"2026-08-13T14:50:44.097877Z","submitted_at":"2021-06-17T16:53:22Z","title":"Multi-head or Single-head? An Empirical Comparison for Transformer Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09650","snapshot_observed_at":"2026-08-12T11:37:07.599724Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.599724Z"},"links":{"cited_paper":"/paper/2106.09650","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:ecb0c70cbe3a820ec028743fffa9cfba86272b49a32325aab8a0b633e480b2b0","observation_id":"4f7676d9-5061-4d50-a2a4-ea539a3a263e","resolution":{"observed_at":"2026-08-12T11:37:07.599724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17888","last_updated":"2023-05-29T05:22:11Z","snapshot_observed_at":"2026-08-13T11:30:33.812255Z","submitted_at":"2023-05-29T05:22:11Z","title":"LLM-QAT: Data-Free Quantization Aware Training for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17888","snapshot_observed_at":"2026-08-12T11:37:07.603254Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.603254Z"},"links":{"cited_paper":"/paper/2305.17888","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:526d17d7ab58ee40fa83f90d8ba5ee1097cb73118fa2bfb18beb348430b3b9ea","observation_id":"e1734be7-5d10-467c-9a4d-755149e86b5a","resolution":{"observed_at":"2026-08-12T11:37:07.603254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:08.074652Z","title":null,"venue":null,"work_id":"57c10a12-a081-4eb5-a260-ff6c93a4e44a","year":2023},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.607108Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:dde46e51972aa66ad0b8fa937a3c9ee36a42d5ba5e8f7ad88c07f5e0d405701a","observation_id":"7ae1c708-e961-4a3a-b887-930d580ce0d4","resolution":{"observed_at":"2026-08-12T11:37:08.078454Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-08-12T17:03:50.984887Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-12T11:37:07.610637Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.610637Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:a38d1e5c55ca916fe3a7cee8c058264d1fdd48daf03251d45c09e52ee57acc15","observation_id":"1f830ab9-1b00-4ec0-95da-5b50c75c7476","resolution":{"observed_at":"2026-08-12T11:37:07.610637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09636","last_updated":"2024-07-23T17:55:30Z","snapshot_observed_at":"2026-08-13T00:54:02.180415Z","submitted_at":"2024-03-14T17:59:26Z","title":"Dynamic Memory Compression: Retrofitting LLMs for Accelerated Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09636","snapshot_observed_at":"2026-08-12T11:37:07.614689Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.614689Z"},"links":{"cited_paper":"/paper/2403.09636","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:e2d392e401d555312bace0c1d5e986dfb8c2b01d1fc28caf2d79a03265ddda27","observation_id":"e45af902-9bf3-44bc-bf9b-cd7f903b4e55","resolution":{"observed_at":"2026-08-12T11:37:07.614689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:08.063759Z","title":null,"venue":null,"work_id":"1bd66f24-1a22-4a5e-a8b6-6fb727500fdd","year":2025},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.618605Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:3f8d8aec6e87ac07695eebb81d22ad603a66b5f823961a54fff63a56ef50dce7","observation_id":"a8b8127c-4618-4611-bc2b-9dbea5525753","resolution":{"observed_at":"2026-08-12T11:37:08.067490Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:07.622246Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.622246Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:bf24a576a316123f7046e477001e43e0d53777a103460b3110dc4329ad644712","observation_id":"7057606f-fac1-4ad3-aeb0-15f972b7e1ae","resolution":{"observed_at":"2026-08-12T11:37:07.622246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:08.045486Z","title":null,"venue":null,"work_id":"68083b77-0251-4dff-aff4-fd84f6a73097","year":2023},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.625766Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:3e60aedd41d53e8d33aac6e3972d78fc06dad007fe79020e20efeadb767c2925","observation_id":"57c805ba-a686-4df7-9460-27b12a7190c3","resolution":{"observed_at":"2026-08-12T11:37:08.049427Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10774","last_updated":"2024-08-26T21:01:02Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-16T01:33:02Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10774","snapshot_observed_at":"2026-08-12T11:37:07.629296Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.629296Z"},"links":{"cited_paper":"/paper/2406.10774","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:b297e912bbaeb89ec48f4282170745cbbc76645f20b4e51e5a19bda062a175fc","observation_id":"3fa7a7c7-6b28-4d72-bb1f-86ea6ca9b1c5","resolution":{"observed_at":"2026-08-12T11:37:07.629296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:08.033829Z","title":null,"venue":null,"work_id":"94cf1923-99ac-41c1-bbcc-7de65fe70371","year":2019},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.633190Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:a3809b7db964ba437c27d307d898045179eba568321378be0afc24e6d66bdbe7","observation_id":"bd394d09-30f7-4f6c-bfe9-99f30fa42aff","resolution":{"observed_at":"2026-08-12T11:37:08.037753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T11:37:07.636669Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.636669Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:87ca709eb544c2eaf760055667dceab420a68b88310bdcf637c61a9be3e6414e","observation_id":"80ae3419-7cf7-48bd-860e-22fbb5e45893","resolution":{"observed_at":"2026-08-12T11:37:07.636669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:08.022398Z","title":null,"venue":null,"work_id":"e514598a-62dc-45f6-a473-bc87b7681c80","year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.640473Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:82af361f87f2cc6f719bd8d7f16f54b6fb03d6807437b9e017ed325812e0735c","observation_id":"3788dc32-33fe-4100-9964-5c88c6e2a9c1","resolution":{"observed_at":"2026-08-12T11:37:08.026080Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03461","last_updated":"2025-02-05T18:58:19Z","snapshot_observed_at":"2026-08-10T16:22:07.766175Z","submitted_at":"2025-02-05T18:58:19Z","title":"Do Large Language Model Benchmarks Test Reliability?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03461","snapshot_observed_at":"2026-08-12T11:37:07.644899Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.644899Z"},"links":{"cited_paper":"/paper/2502.03461","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:d3f5bb311921471b205a3f1f3dcea2e587782b19a2e7cfa280d0074c2a2ebc8e","observation_id":"97a6cc9b-743d-4e2d-8581-1a9877b43c1f","resolution":{"observed_at":"2026-08-12T11:37:07.644899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:08.011112Z","title":null,"venue":null,"work_id":"08f1d3c8-ed2b-47de-b47b-6b938a54ee80","year":2025},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.648882Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:ef364a16e87c0b451a5e919a8c5b6a15228ca70c6129167dcf6a46fcb9021a59","observation_id":"7e18dec0-c176-4357-b125-3a597f77447c","resolution":{"observed_at":"2026-08-12T11:37:08.014635Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:07.999886Z","title":null,"venue":null,"work_id":"5aec292c-6d6c-49ee-8368-e864512b766d","year":2019},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.652446Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:55bd68977768d541487cb191cf64d046cd91a5cd9e98ef35a3323e4ac1ebf4d9","observation_id":"04249263-2fab-41bd-a950-dabe643a7754","resolution":{"observed_at":"2026-08-12T11:37:08.003790Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13035","last_updated":"2025-03-13T03:16:43Z","snapshot_observed_at":"2026-08-13T08:49:48.714090Z","submitted_at":"2024-06-18T20:01:51Z","title":"D2O: Dynamic Discriminative Operations for Efficient Long-Context Inference of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13035","snapshot_observed_at":"2026-08-12T11:37:07.655879Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.655879Z"},"links":{"cited_paper":"/paper/2406.13035","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:2459e0d245584a2b87b486e4a662bd739227e9b0fb167024004342a9cfb51208","observation_id":"c5ca8fff-152a-451d-aea9-2bebe4f1518c","resolution":{"observed_at":"2026-08-12T11:37:07.655879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15574","last_updated":"2024-04-24T00:24:03Z","snapshot_observed_at":"2026-08-13T00:23:22.242528Z","submitted_at":"2024-04-24T00:24:03Z","title":"Retrieval Head Mechanistically Explains Long-Context Factuality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15574","snapshot_observed_at":"2026-08-12T11:37:07.659393Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.659393Z"},"links":{"cited_paper":"/paper/2404.15574","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:96c142b90a08ef276fe3b3becad195e54854e2aae4c32817de9bbc5b87b14382","observation_id":"e6564002-5de1-46ec-94b7-1698ddbae20a","resolution":{"observed_at":"2026-08-12T11:37:07.659393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:07.987439Z","title":null,"venue":null,"work_id":"156bc782-90e0-44a3-98c7-24a58484deb4","year":2023},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.663004Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:1d1525f823783ef99e4cd23e9daf1e81d444f058022519796a5bf582c17316e1","observation_id":"cd0916af-31f0-4431-ac51-2fc67cc52b04","resolution":{"observed_at":"2026-08-12T11:37:07.992453Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10819","last_updated":"2024-10-14T17:59:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-14T17:59:58Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10819","snapshot_observed_at":"2026-08-12T11:37:07.666624Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.666624Z"},"links":{"cited_paper":"/paper/2410.10819","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:c28589fdc451077f18aeb109b363a5b0a7fbb70b9fd3bcd1da4904787ca0edc5","observation_id":"20e63b59-4d5b-4e35-bafc-1cbcebf0873c","resolution":{"observed_at":"2026-08-12T11:37:07.666624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-12T11:37:07.670319Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.670319Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:be12b44ca1a5ce575b6a6c7a4894a112dece1bce797d06bab339f471b21f5c29","observation_id":"6c22d63e-a693-4633-bfd8-eb0c8e03e13b","resolution":{"observed_at":"2026-08-12T11:37:07.670319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12532","last_updated":"2024-06-05T09:01:24Z","snapshot_observed_at":"2026-08-13T00:03:16.448539Z","submitted_at":"2024-05-21T06:46:37Z","title":"PyramidInfer: Pyramid KV Cache Compression for High-throughput LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12532","snapshot_observed_at":"2026-08-12T11:37:07.674267Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.674267Z"},"links":{"cited_paper":"/paper/2405.12532","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:749cad9175add7db3a1d9db44e114ed7b6ef8e7746930983fd54fffe6fd3ea08","observation_id":"7ced9945-c15e-4e04-939c-711b8dbb8902","resolution":{"observed_at":"2026-08-12T11:37:07.674267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18096","last_updated":"2024-02-28T06:34:54Z","snapshot_observed_at":"2026-08-13T07:57:52.161268Z","submitted_at":"2024-02-28T06:34:54Z","title":"No Token Left Behind: Reliable KV Cache Compression via Importance-Aware Mixed Precision Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18096","snapshot_observed_at":"2026-08-12T11:37:07.678061Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.678061Z"},"links":{"cited_paper":"/paper/2402.18096","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:4cbe9b10a76f870d8a6cf84853dde9424a970336db0cdaab1ade7d8f02b70c73","observation_id":"c9d88fdc-0c2f-4b57-87f3-7a4dfaadb303","resolution":{"observed_at":"2026-08-12T11:37:07.678061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13718","last_updated":"2024-02-24T15:07:55Z","snapshot_observed_at":"2026-08-13T04:13:48.028514Z","submitted_at":"2024-02-21T11:30:29Z","title":"$\\infty$Bench: Extending Long Context Evaluation Beyond 100K Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13718","snapshot_observed_at":"2026-08-12T11:37:07.681788Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.681788Z"},"links":{"cited_paper":"/paper/2402.13718","citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:d602c954ab1f413057e655110f7c2d4222b23789d3657ef173e53712e5ff596c","observation_id":"7267b29a-8ed7-424e-b943-25a38825d5d3","resolution":{"observed_at":"2026-08-12T11:37:07.681788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:07.685940Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.685940Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:7f2e9a57a689fecec9374cc450e4781138f4bd09cb1c716dc08b55a67f9d3745","observation_id":"9340b39b-65a6-4abf-adff-3f0066468f2c","resolution":{"observed_at":"2026-08-12T11:37:07.685940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:07.689428Z","title":"Barrett, Zhangyang Wang, and Beidi Chen","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.689428Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:f4e71010317300fa163ff16b6ce8f1085107e91a3f51f720eb9b077726808765","observation_id":"248e51a3-32a2-4a0c-b655-ab701a21bfa8","resolution":{"observed_at":"2026-08-12T11:37:07.689428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:07.693059Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.693059Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:4cd119e90dc43f4126c0ae161ad0e7a6057397101f144d7186b04a27b33e72f7","observation_id":"93f5e1f6-0042-405c-9339-19fa85f70aa3","resolution":{"observed_at":"2026-08-12T11:37:07.693059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:37:07.697300Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T11:37:07.697300Z"},"links":{"citing_paper":"/paper/2411.18077"},"observation_digest":"sha256:8651eff549e9de56bd94ffbf58e00c7830e8eaf47ac574c02ab8a5efa56a489f","observation_id":"b66d035f-d673-4e4c-92c0-6329e84a19c7","resolution":{"observed_at":"2026-08-12T11:37:07.697300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.18077","last_updated":"2025-06-08T21:23:22Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T13:32:45.295519Z","submitted_at":"2024-11-27T06:10:49Z","title":"MiniKV: Pushing the Limits of LLM Inference via 2-Bit Layer-Discriminative KV Cache"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 3 inbound Pith citation observations for arXiv:2411.18077."}