{"as_of":"2026-08-16T18:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:531a413a1883562dc71b13f6e08370f118c7a1a25d55c5e635205ef1a64bfc33","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T14:54:14.123344Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04074/citation-record","integrity":"/paper/2608.04074/integrity","json":"/paper/2608.04074/citation-record.json","paper":"/paper/2608.04074"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-14T02:46:12.121034Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-08-15T14:54:13.974467Z","title":"gpt-oss-120b & gpt-oss-20b model card.arXiv preprint arXiv:2508.10925,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04074","last_updated":"2026-08-04T16:10:59Z","snapshot_observed_at":"2026-08-16T09:44:08.176218Z","submitted_at":"2026-08-04T16:10:59Z","title":"Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:13.974467Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2608.04074"},"observation_digest":"sha256:1be828d078be50267c0f71838825ad67ef0bdddab18f189ee247febecdd5165a","observation_id":"dffa9505-32f4-4a44-8b11-943e79995d5d","resolution":{"observed_at":"2026-08-15T14:54:13.974467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-08-15T18:01:46.669862Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-15T14:54:14.029950Z","title":"Ruler: What’s the real context size of your long-context language models?arXiv preprint arXiv:2404.06654,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04074","last_updated":"2026-08-04T16:10:59Z","snapshot_observed_at":"2026-08-16T09:44:08.176218Z","submitted_at":"2026-08-04T16:10:59Z","title":"Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:14.029950Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2608.04074"},"observation_digest":"sha256:b6ae3bc7bbe2ed8ffc422389e4cdc54a0a5094721199397b5d458e1cd3d75e63","observation_id":"f2463839-7179-43f1-8f21-facf893d71e5","resolution":{"observed_at":"2026-08-15T14:54:14.029950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:14.726098Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":"9487cb0c-4bf0-4087-8387-2e181029f18a","year":2025},"citing_paper":{"arxiv_id":"2608.04074","last_updated":"2026-08-04T16:10:59Z","snapshot_observed_at":"2026-08-16T09:44:08.176218Z","submitted_at":"2026-08-04T16:10:59Z","title":"Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:14.035404Z"},"links":{"citing_paper":"/paper/2608.04074"},"observation_digest":"sha256:17667b2cfcd45612ef51601533f10bec22c2ea334f38ba5df3fa37289c19ce99","observation_id":"2dc846ac-aa8f-4dca-b295-7140eb5ea9d3","resolution":{"observed_at":"2026-08-15T14:54:14.731144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04939","last_updated":"2024-09-06T05:06:51Z","snapshot_observed_at":"2026-08-16T14:45:06.045654Z","submitted_at":"2023-11-08T01:45:37Z","title":"LooGLE: Can Long-Context Language Models Understand Long Contexts?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04939","snapshot_observed_at":"2026-08-15T14:54:14.040515Z","title":"Loogle: Can long-context language models understand long contexts?arXiv preprint arXiv:2311.04939,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04074","last_updated":"2026-08-04T16:10:59Z","snapshot_observed_at":"2026-08-16T09:44:08.176218Z","submitted_at":"2026-08-04T16:10:59Z","title":"Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:14.040515Z"},"links":{"cited_paper":"/paper/2311.04939","citing_paper":"/paper/2608.04074"},"observation_digest":"sha256:d9004360a479499a6d04e01a064c7d2a4b507aa09675b25d9923c2c47a30ac5b","observation_id":"7ebaf411-d1b1-49d8-94fa-34c1c5beb7ae","resolution":{"observed_at":"2026-08-15T14:54:14.040515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18879","last_updated":"2025-06-23T17:50:11Z","snapshot_observed_at":"2026-08-16T01:51:29.045572Z","submitted_at":"2025-06-23T17:50:11Z","title":"CommVQ: Commutative Vector Quantization for KV Cache Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18879","snapshot_observed_at":"2026-08-15T14:54:14.045740Z","title":"Commvq: Commutative vector quantization for kv cache compression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04074","last_updated":"2026-08-04T16:10:59Z","snapshot_observed_at":"2026-08-16T09:44:08.176218Z","submitted_at":"2026-08-04T16:10:59Z","title":"Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:14.045740Z"},"links":{"cited_paper":"/paper/2506.18879","citing_paper":"/paper/2608.04074"},"observation_digest":"sha256:793cdb9b7b80565b5a69d156f7fd4870507a667f1ef46d5b5f9f8f7b84df093f","observation_id":"8e17b076-902a-442c-9477-b77ee178bbda","resolution":{"observed_at":"2026-08-15T14:54:14.045740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19887","snapshot_observed_at":"2026-08-15T14:54:14.050475Z","title":"Jamba: A hybrid transformer-mamba language model.arXiv preprint arXiv:2403.19887,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04074","last_updated":"2026-08-04T16:10:59Z","snapshot_observed_at":"2026-08-16T09:44:08.176218Z","submitted_at":"2026-08-04T16:10:59Z","title":"Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:14.050475Z"},"links":{"cited_paper":"/paper/2403.19887","citing_paper":"/paper/2608.04074"},"observation_digest":"sha256:3c8ddc2b35bd388f982694593f8f5284eeeedd1a0412b4414550df2574e1bfe9","observation_id":"5884f49d-38b9-46de-87c7-b7891340b358","resolution":{"observed_at":"2026-08-15T14:54:14.050475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:14.055320Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04074","last_updated":"2026-08-04T16:10:59Z","snapshot_observed_at":"2026-08-16T09:44:08.176218Z","submitted_at":"2026-08-04T16:10:59Z","title":"Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:14.055320Z"},"links":{"citing_paper":"/paper/2608.04074"},"observation_digest":"sha256:0953c2fdd8770253e2bcac722db37c81789c956babc14e229c8023b6c917427c","observation_id":"683bf42f-6190-4a5d-8f23-abce0a8533fd","resolution":{"observed_at":"2026-08-15T14:54:14.055320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-08-12T17:03:50.984887Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-15T14:54:14.065127Z","title":"Kivi: A tuning-free asymmetric 2bit quantization for kv cache.arXiv preprint arXiv:2402.02750, 2024b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04074","last_updated":"2026-08-04T16:10:59Z","snapshot_observed_at":"2026-08-16T09:44:08.176218Z","submitted_at":"2026-08-04T16:10:59Z","title":"Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:14.065127Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2608.04074"},"observation_digest":"sha256:af550d4e93f65f495ea213f0644ee1d96807c57d94b78e653d1b988ae242a7a0","observation_id":"6448dbdd-70ab-4cc5-993a-64b0028f97d3","resolution":{"observed_at":"2026-08-15T14:54:14.065127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-16T07:06:07.822225Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-15T14:54:14.075430Z","title":"Gpqa: A graduate-level google-proof q&a benchmark.arXiv preprint arXiv:2311.12022,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04074","last_updated":"2026-08-04T16:10:59Z","snapshot_observed_at":"2026-08-16T09:44:08.176218Z","submitted_at":"2026-08-04T16:10:59Z","title":"Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:14.075430Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2608.04074"},"observation_digest":"sha256:fc2ff9cbfc27369ddf89b41f07f4b2f93da8808f66397e8b15c573a735076f28","observation_id":"00318c5f-ff3f-4a87-ab9e-71b2e0d5eee2","resolution":{"observed_at":"2026-08-15T14:54:14.075430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:14.682260Z","title":"Magicdec: Breaking the latency-throughput tradeoff for long context generation with speculative decoding","venue":null,"work_id":"2d3439c9-8e82-495c-9d91-2c49a69d9463","year":2025},"citing_paper":{"arxiv_id":"2608.04074","last_updated":"2026-08-04T16:10:59Z","snapshot_observed_at":"2026-08-16T09:44:08.176218Z","submitted_at":"2026-08-04T16:10:59Z","title":"Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:14.080404Z"},"links":{"citing_paper":"/paper/2608.04074"},"observation_digest":"sha256:c4ebf5bf00630e13e46ef2a49fc3200b349f5dba4c619d36542111794b49e05d","observation_id":"5c26530b-5a78-49b2-b132-e37d20363a2a","resolution":{"observed_at":"2026-08-15T14:54:14.687491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-15T14:54:14.086026Z","title":"Fast transformer decoding: One write-head is all you need.arXiv preprint arXiv:1911.02150,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2608.04074","last_updated":"2026-08-04T16:10:59Z","snapshot_observed_at":"2026-08-16T09:44:08.176218Z","submitted_at":"2026-08-04T16:10:59Z","title":"Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:14.086026Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2608.04074"},"observation_digest":"sha256:f4b0f14e0b4e438df43c0dc2201741889bd7efe3a5000d960a1aa3128b518238","observation_id":"28187aa7-6b66-411d-acbf-b8e988321572","resolution":{"observed_at":"2026-08-15T14:54:14.086026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16383","last_updated":"2025-02-02T03:04:54Z","snapshot_observed_at":"2026-08-15T12:01:34.913489Z","submitted_at":"2025-01-25T01:45:29Z","title":"RotateKV: Accurate and Robust 2-Bit KV Cache Quantization for LLMs via Outlier-Aware Adaptive Rotations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16383","snapshot_observed_at":"2026-08-15T14:54:14.091576Z","title":"Rotatekv: Accurate and robust 2-bit kv cache quantization for llms via outlier-aware adaptive rotations.arXiv preprint arXiv:2501.16383,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04074","last_updated":"2026-08-04T16:10:59Z","snapshot_observed_at":"2026-08-16T09:44:08.176218Z","submitted_at":"2026-08-04T16:10:59Z","title":"Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:14.091576Z"},"links":{"cited_paper":"/paper/2501.16383","citing_paper":"/paper/2608.04074"},"observation_digest":"sha256:bcf67867acba26a6dc0d0dc7609dcf813a1374a95d9461347971c9c20c2b1c02","observation_id":"a05d0bf4-a162-4d4e-af95-648437d2875e","resolution":{"observed_at":"2026-08-15T14:54:14.091576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:14.665388Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":"bbe6c6ad-38db-434a-a5b7-69502cd5442a","year":2024},"citing_paper":{"arxiv_id":"2608.04074","last_updated":"2026-08-04T16:10:59Z","snapshot_observed_at":"2026-08-16T09:44:08.176218Z","submitted_at":"2026-08-04T16:10:59Z","title":"Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:14.108543Z"},"links":{"citing_paper":"/paper/2608.04074"},"observation_digest":"sha256:3728737e1cca65285e7e87f90db8c41a069f90596053c7b38621747f203164f9","observation_id":"bfa47726-d9bf-4943-a713-36c852ab965a","resolution":{"observed_at":"2026-08-15T14:54:14.671026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-15T14:54:14.113222Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04074","last_updated":"2026-08-04T16:10:59Z","snapshot_observed_at":"2026-08-16T09:44:08.176218Z","submitted_at":"2026-08-04T16:10:59Z","title":"Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:14.113222Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.04074"},"observation_digest":"sha256:a3b5a69af880cabfb4b434c5aefed5d0a4e5711ccef549b650efb22a38efaa6b","observation_id":"2a34392d-b271-4c82-855c-cad61477afb9","resolution":{"observed_at":"2026-08-15T14:54:14.113222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.17757","last_updated":"2026-05-18T02:24:29Z","snapshot_observed_at":"2026-08-15T00:39:44.412521Z","submitted_at":"2026-05-18T02:24:29Z","title":"OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.17757","snapshot_observed_at":"2026-08-15T14:54:14.123344Z","title":"Oscar: Offline spectral covariance-aware rotation for 2-bit kv cache quantization.arXiv preprint arXiv:2605.17757,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04074","last_updated":"2026-08-04T16:10:59Z","snapshot_observed_at":"2026-08-16T09:44:08.176218Z","submitted_at":"2026-08-04T16:10:59Z","title":"Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:14.123344Z"},"links":{"cited_paper":"/paper/2605.17757","citing_paper":"/paper/2608.04074"},"observation_digest":"sha256:eff2d045bf6fa61ccae19779acbf7ca3dd35ba74307cf89c68d1eba91cf0a47d","observation_id":"29d86e9c-3cb9-4aaf-ac2d-639523fdbbef","resolution":{"observed_at":"2026-08-15T14:54:14.123344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00805","last_updated":"2018-08-21T00:02:44Z","snapshot_observed_at":"2026-08-14T21:08:29.545204Z","submitted_at":"2017-04-03T20:50:29Z","title":"On the Properties of the Softmax Function with Application in Game Theory and Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00805","snapshot_observed_at":"2026-08-15T14:54:14.009025Z","title":"On the properties of the softmax function with application in game theory and reinforcement learning.arXiv preprint arXiv:1704.00805,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04074","last_updated":"2026-08-04T16:10:59Z","snapshot_observed_at":"2026-08-16T09:44:08.176218Z","submitted_at":"2026-08-04T16:10:59Z","title":"Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms","version":1},"reference_index":1949,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:14.009025Z"},"links":{"cited_paper":"/paper/1704.00805","citing_paper":"/paper/2608.04074"},"observation_digest":"sha256:5e13727226e4cfd71f317236c12067e6b93e70b877e62061300ddd29fc664fdf","observation_id":"c7a97561-1927-4eae-994c-3b2b5b9b3412","resolution":{"observed_at":"2026-08-15T14:54:14.009025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16210","last_updated":"2025-05-22T04:23:19Z","snapshot_observed_at":"2026-08-08T09:52:35.968307Z","submitted_at":"2025-05-22T04:23:19Z","title":"NQKV: A KV Cache Quantization Scheme Based on Normal Distribution Characteristics","version":1},"cited_work":{"arxiv_id":"2505.16210","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16210","snapshot_observed_at":"2026-08-15T14:54:14.610784Z","title":"NQKV: A KV Cache Quantization Scheme Based on Normal Distribution Characteristics","venue":"cs.LG","work_id":"6a73de4f-8958-4be9-b1bf-a9e61598b549","year":2025},"citing_paper":{"arxiv_id":"2608.04074","last_updated":"2026-08-04T16:10:59Z","snapshot_observed_at":"2026-08-16T09:44:08.176218Z","submitted_at":"2026-08-04T16:10:59Z","title":"Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms","version":1},"reference_index":1971,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:13.992944Z"},"links":{"cited_paper":"/paper/2505.16210","citing_paper":"/paper/2608.04074"},"observation_digest":"sha256:0ea57578c5eeec9a664d27da092f6c45856ab9370cff688f3f0a358fae5e771c","observation_id":"ae330aa2-8bc2-43e9-aa41-b3782d315ff2","resolution":{"observed_at":"2026-08-15T14:54:14.618846Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19874","last_updated":"2025-04-28T15:05:35Z","snapshot_observed_at":"2026-08-14T14:45:14.744168Z","submitted_at":"2025-04-28T15:05:35Z","title":"TurboQuant: Online Vector Quantization with Near-optimal Distortion Rate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19874","snapshot_observed_at":"2026-08-15T14:54:14.118227Z","title":"Turboquant: Online vector quantization with near-optimal distortion rate.arXiv preprint arXiv:2504.19874,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04074","last_updated":"2026-08-04T16:10:59Z","snapshot_observed_at":"2026-08-16T09:44:08.176218Z","submitted_at":"2026-08-04T16:10:59Z","title":"Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms","version":1},"reference_index":1982,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:14.118227Z"},"links":{"cited_paper":"/paper/2504.19874","citing_paper":"/paper/2608.04074"},"observation_digest":"sha256:e1218c0f4e039d02641623668afe41796eaaf75adb21e31741a089772b70da1d","observation_id":"9845232d-b613-4b20-a425-e9ae727f475d","resolution":{"observed_at":"2026-08-15T14:54:14.118227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:14.698501Z","title":"AIME 2025: American invitational mathematics examination.https://maa","venue":null,"work_id":"3fe1f699-cbac-4d20-8a01-8c0623839a1f","year":2025},"citing_paper":{"arxiv_id":"2608.04074","last_updated":"2026-08-04T16:10:59Z","snapshot_observed_at":"2026-08-16T09:44:08.176218Z","submitted_at":"2026-08-04T16:10:59Z","title":"Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms","version":1},"reference_index":1989,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:14.070261Z"},"links":{"citing_paper":"/paper/2608.04074"},"observation_digest":"sha256:2897772e04bb6c83d6666a7cc6c58784a0b77074f006c37094d8a4d10fd70470","observation_id":"1bacb15e-2bbe-45f4-b93c-5198d689821a","resolution":{"observed_at":"2026-08-15T14:54:14.704663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:14.014851Z","title":"doi: 10.1007/978-1-4615-3626-0","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04074","last_updated":"2026-08-04T16:10:59Z","snapshot_observed_at":"2026-08-16T09:44:08.176218Z","submitted_at":"2026-08-04T16:10:59Z","title":"Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms","version":1},"reference_index":1992,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:14.014851Z"},"links":{"citing_paper":"/paper/2608.04074"},"observation_digest":"sha256:65f43b7ebc8696f2e5fb158a8892e150a10fbd287d8498acf2ef8f7fade0c1d3","observation_id":"4e55d921-80a1-4a16-afc3-37cce8ae555b","resolution":{"observed_at":"2026-08-15T14:54:14.014851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-15T14:54:14.097282Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04074","last_updated":"2026-08-04T16:10:59Z","snapshot_observed_at":"2026-08-16T09:44:08.176218Z","submitted_at":"2026-08-04T16:10:59Z","title":"Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms","version":1},"reference_index":1998,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:14.097282Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2608.04074"},"observation_digest":"sha256:70f677f4e1449294de29635aa7ab0d517e08ae4de49eb3ce6f10c1f43925edb8","observation_id":"68dad4eb-3689-4e02-b479-8c4761700957","resolution":{"observed_at":"2026-08-15T14:54:14.097282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-15T14:54:14.060218Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model.arXiv preprint arXiv:2405.04434, 2024a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04074","last_updated":"2026-08-04T16:10:59Z","snapshot_observed_at":"2026-08-16T09:44:08.176218Z","submitted_at":"2026-08-04T16:10:59Z","title":"Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms","version":1},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:14.060218Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2608.04074"},"observation_digest":"sha256:89c49b1683ffa5659f7f805776a14b6a6a86e7bfb89661882722eb26526a4c08","observation_id":"ca02879d-05da-4900-b1e0-7cf66f6e422c","resolution":{"observed_at":"2026-08-15T14:54:14.060218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T14:54:14.019799Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04074","last_updated":"2026-08-04T16:10:59Z","snapshot_observed_at":"2026-08-16T09:44:08.176218Z","submitted_at":"2026-08-04T16:10:59Z","title":"Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms","version":1},"reference_index":2001,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:14.019799Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.04074"},"observation_digest":"sha256:b4993ce81691d5b49dbeda3a29f5bd9bb3c1213d8142f9fc9525b28a9f3d9ba7","observation_id":"008b43d0-b42b-4e71-bc8c-c7cd9ac68b61","resolution":{"observed_at":"2026-08-15T14:54:14.019799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-15T14:54:14.024939Z","title":"Measuring mathematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04074","last_updated":"2026-08-04T16:10:59Z","snapshot_observed_at":"2026-08-16T09:44:08.176218Z","submitted_at":"2026-08-04T16:10:59Z","title":"Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms","version":1},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:14.024939Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2608.04074"},"observation_digest":"sha256:cff58591a66cc0b54c9f8705af1c6b7ea18de7c82ca2a796aa3d3c20bc145119","observation_id":"ff032e55-9615-4709-88a9-71175f57a4f8","resolution":{"observed_at":"2026-08-15T14:54:14.024939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:14.103353Z","title":"Kitty: Accurate and efficient 2-bit kv cache quantization with dynamic channel-wise precision boost.arXiv preprint arXiv:2511.18643,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04074","last_updated":"2026-08-04T16:10:59Z","snapshot_observed_at":"2026-08-16T09:44:08.176218Z","submitted_at":"2026-08-04T16:10:59Z","title":"Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:14.103353Z"},"links":{"citing_paper":"/paper/2608.04074"},"observation_digest":"sha256:e79b14a16676e24b3d65ee7a79fad96fc4d81370d356bab0d07e1905e4056549","observation_id":"08fd2b8d-8ee7-44b9-8920-d8d4c513ef0b","resolution":{"observed_at":"2026-08-15T14:54:14.103353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:14.003797Z","title":"Expected attention: Kv cache compression by estimating attention from future queries distribution.arXiv preprint arXiv:2510.00636,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04074","last_updated":"2026-08-04T16:10:59Z","snapshot_observed_at":"2026-08-16T09:44:08.176218Z","submitted_at":"2026-08-04T16:10:59Z","title":"Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:14.003797Z"},"links":{"citing_paper":"/paper/2608.04074"},"observation_digest":"sha256:3f7699710ccdc96ee4e8dacb0d3cf3bbb27cfe949a8e98b3b8044f9e30e9df0b","observation_id":"f52db0ef-2c90-4882-9b9f-6a74d1d43053","resolution":{"observed_at":"2026-08-15T14:54:14.003797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-15T14:54:13.998330Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04074","last_updated":"2026-08-04T16:10:59Z","snapshot_observed_at":"2026-08-16T09:44:08.176218Z","submitted_at":"2026-08-04T16:10:59Z","title":"Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:13.998330Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.04074"},"observation_digest":"sha256:80633a58d3422047b1070fc859f98b316caca50c5a255d40e08ff52426c7756e","observation_id":"0c25ae6c-ede3-45bb-985f-35df6b90644b","resolution":{"observed_at":"2026-08-15T14:54:13.998330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-15T14:54:13.987272Z","title":"Longbench: A bilingual, multitask benchmark for long context understanding.arXiv preprint arXiv:2308.14508,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04074","last_updated":"2026-08-04T16:10:59Z","snapshot_observed_at":"2026-08-16T09:44:08.176218Z","submitted_at":"2026-08-04T16:10:59Z","title":"Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:13.987272Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2608.04074"},"observation_digest":"sha256:d95fde03d3048f573d34eea5b2610bed6e72fe525ce59b3035fde0f46b9febe5","observation_id":"affaf05b-ca25-4a55-ab28-a150aa3d4916","resolution":{"observed_at":"2026-08-15T14:54:13.987272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T14:54:13.981185Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04074","last_updated":"2026-08-04T16:10:59Z","snapshot_observed_at":"2026-08-16T09:44:08.176218Z","submitted_at":"2026-08-04T16:10:59Z","title":"Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T14:54:13.981185Z"},"links":{"citing_paper":"/paper/2608.04074"},"observation_digest":"sha256:d3f75449db42fd5633e88c84634e7329b825f844639df022dd535cd637825b46","observation_id":"098c89fd-a716-4d80-b679-63aa5339b356","resolution":{"observed_at":"2026-08-15T14:54:13.981185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.04074","last_updated":"2026-08-04T16:10:59Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T09:44:08.176218Z","submitted_at":"2026-08-04T16:10:59Z","title":"Spend Bits Where Queries Look: KV Cache Vector Quantization with Attention-Preserving Transforms"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2608.04074."}