{"as_of":"2026-08-13T10:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:83abb04aed54d1cd05c2d0d175965f2bbb3bcd147b121d3e003b8f884636e1b8","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T01:05:01.516588Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02691/citation-record","integrity":"/paper/2608.02691/integrity","json":"/paper/2608.02691/citation-record.json","paper":"/paper/2608.02691"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:04:59.456663Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T01:04:59.456663Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:984610cab5decedca90432c530f11b892b80af66242f5e3de14cc9dc549aea6e","observation_id":"da5719a5-40e4-46a0-96ac-0575d8ff4b03","resolution":{"observed_at":"2026-08-07T01:04:59.456663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:04:59.537708Z","title":"Softmax is \\ 1/2\\ -Lipschitz: A tight bound across all \\","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T01:04:59.537708Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:4f7262316f9e24c0122a62530e0f5726bebf36821f94874a647b1b32ead27ad5","observation_id":"cdb85734-6114-4207-84dd-cd967e4ffd60","resolution":{"observed_at":"2026-08-07T01:04:59.537708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:04:59.645801Z","title":"2018 , eprint =","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T01:04:59.645801Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:460592f7f05b11b5a664a784bb15267edacbbd8a562ae27d6265c68a0192f568","observation_id":"0db2c245-5924-4803-9dbf-665b64b6018a","resolution":{"observed_at":"2026-08-07T01:04:59.645801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:04:59.704894Z","title":"and Neuhoff, D.L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T01:04:59.704894Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:630df0f71484e7061bc90926062c004d8c8b645709183a498a972e67cc7eac1e","observation_id":"4975a755-dac2-405c-8269-598587cda4eb","resolution":{"observed_at":"2026-08-07T01:04:59.704894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:04:59.774638Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T01:04:59.774638Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:a7d1a4979a781b8906d62fcf6f67b17a64a959eaad4fa388558e359e2f04ce8e","observation_id":"d2b403fa-1f12-46b5-8332-eb6619a6d484","resolution":{"observed_at":"2026-08-07T01:04:59.774638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:04:59.858046Z","title":"Proceedings of the Thirty-Fourth International Joint Conference on Artificial Intelligence , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T01:04:59.858046Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:e6faab98edbec8b051c664890e6366fcbf7b86ad2d7b8849a7b2c5e2cba6e226","observation_id":"24a4c5f1-ca7a-472e-8f32-eee852e5adc3","resolution":{"observed_at":"2026-08-07T01:04:59.858046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:04:59.926017Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T01:04:59.926017Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:164dccfe2331345bedcc98030e082caef1ee9ac48b1476e4162f06e0b8892d75","observation_id":"978f0bcc-7bbc-490b-900c-9d3ae2bc4ab6","resolution":{"observed_at":"2026-08-07T01:04:59.926017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:04:59.980206Z","title":"2025 , booktitle =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T01:04:59.980206Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:f408ff9dbe192f65697ab7dd9d449a1fbf9df560b1e9d778b2d682a1c23f4c60","observation_id":"ca3a6a18-2f14-45ce-b0ff-a33d4f28b447","resolution":{"observed_at":"2026-08-07T01:04:59.980206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:00.087624Z","title":"and Ermon, Stefano and Rudra, Atri and R\\'","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:00.087624Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:b8acb6df40e262389b2623773f8ceb376e41cacfa60a1136e1aa01438f5a3b31","observation_id":"e2785c96-10d1-448c-a734-5c121b27b6ec","resolution":{"observed_at":"2026-08-07T01:05:00.087624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:00.171759Z","title":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing (","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:00.171759Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:c1706e5176fba1fbf877967feb7c7cf74f62517da02076bd81b72a0b753ddd18","observation_id":"bf91dd5f-0097-440f-a9c0-fdbaf823cc04","resolution":{"observed_at":"2026-08-07T01:05:00.171759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:00.231740Z","title":"H2O: heavy-hitter oracle for efficient generative inference of large language models , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:00.231740Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:51c39358efb6def5584fbfb80a8bf41dcbf3aa0fc130a89942282702d9a1cd17","observation_id":"aa8d2866-31a9-4410-8be0-7b11c4908ee2","resolution":{"observed_at":"2026-08-07T01:05:00.231740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:00.312691Z","title":"and Shao, Yakun Sophia and Keutzer, Kurt and Gholami, Amir , title =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:00.312691Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:12f04a41d5dccfe031ee472d79cd9a63d80a50722e65fa277723182f80e76310","observation_id":"4ea4322c-07a5-4150-9d42-0869c20d4249","resolution":{"observed_at":"2026-08-07T01:05:00.312691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:00.370295Z","title":"Efficient Memory Management for Large Language Model Serving with","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:00.370295Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:1abbd3e82eba152d32baa96a5feea3165a5e4a242f73258ab89c36f91435d5d0","observation_id":"17c2f0a5-48d8-42ca-a216-94c64612050a","resolution":{"observed_at":"2026-08-07T01:05:00.370295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:00.454912Z","title":"and Barrett, Clark and Sheng, Ying , title =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:00.454912Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:f9a6326c736c1ecda75c266bc5a11329e7b965728870864a9b9b0548fc3d0034","observation_id":"4d4908a6-812d-4c0d-9b61-4bbe2963fc7f","resolution":{"observed_at":"2026-08-07T01:05:00.454912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:00.521424Z","title":"SpinQuant:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:00.521424Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:83a01d8201dd0faa073d24ddb9bc2703eeae244012bbfbcc658c6216a073bd6e","observation_id":"7f84a126-b943-4055-a285-6941db0bdc70","resolution":{"observed_at":"2026-08-07T01:05:00.521424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:00.568826Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:00.568826Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:69f5a7ba9b9f143e7957db129057e6aed1b4f38bdce35f612140bd760acf48f2","observation_id":"6cad11a8-2a08-4f5f-83cd-15fd946fafaa","resolution":{"observed_at":"2026-08-07T01:05:00.568826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:00.586256Z","title":"Kitty: Accurate and Efficient 2-bit","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:00.586256Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:53a38e92f10814697bd9e9c238ec915afe1aecb1feca078c73e17bd017a802ec","observation_id":"b41b2e0c-ab4b-449c-a452-a2b20cd19109","resolution":{"observed_at":"2026-08-07T01:05:00.586256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:00.699796Z","title":"The Fourteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:00.699796Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:7710d8d8a743d4e92c0cb8c620a55c378cd6953e7e5edc410b4e802c4748b06c","observation_id":"425716d5-d8d1-4799-b807-88f946bda87f","resolution":{"observed_at":"2026-08-07T01:05:00.699796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:00.817951Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:00.817951Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:1dd9989e04477f79a5b79d98636e1e04ecacec29a5fa36b651c9552e332a5de8","observation_id":"c50a76dd-fde7-4ab5-9d20-c89e70ee0137","resolution":{"observed_at":"2026-08-07T01:05:00.817951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:00.974166Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:00.974166Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:523ac0b1f065d99fa44d94c9aed939809150850d2feedf363648a6ac95ca0a4e","observation_id":"9844621f-70cd-4bf1-aafe-f340d4b6092e","resolution":{"observed_at":"2026-08-07T01:05:00.974166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:01.369448Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.369448Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:09f560408a88a9cc87cbffb45473ca51d5fa894dfc15c70e0169ca93e09eb442","observation_id":"b015560b-fe0c-4996-bba5-fb2348134221","resolution":{"observed_at":"2026-08-07T01:05:01.369448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:01.427545Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.427545Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:9e714014acaea96c2dd151338991f20bc885033a4ca24bab84bbb2230c4dded7","observation_id":"30cfdb8f-656b-4ccd-b11d-0b27ef90a41d","resolution":{"observed_at":"2026-08-07T01:05:01.427545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:01.430887Z","title":"Bowman , booktitle=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.430887Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:1ea7dde50fb081c32f87cf0ba6edb31a8bc725f907a576229dc5770e3dc7dbf6","observation_id":"35747d9f-1550-494a-a5d1-332ee0272943","resolution":{"observed_at":"2026-08-07T01:05:01.430887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:01.434317Z","title":"Is Your Code Generated by Chat","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.434317Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:9637944f6d1882ec367e3d52fd9a3fa2c66b0b917efc7e404cce52ecdca29e47","observation_id":"1bc8c3a0-4a09-4c82-8de9-ce4be63f07b8","resolution":{"observed_at":"2026-08-07T01:05:01.434317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:01.437204Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.437204Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:a7145cb0b404837eddf3a512f4d28152b888a481eb9dcb33dccaa29783637dcd","observation_id":"bafe336b-1f54-4e96-9e58-f1ee95ebc031","resolution":{"observed_at":"2026-08-07T01:05:01.437204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:01.439792Z","title":"2024 , url=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.439792Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:0f563afa98f4677bcff02b2d76214edc42fa47fa031d6b975fea7d5ff9fa9217","observation_id":"cb5c74a3-3109-486e-9980-c7b458f68ab6","resolution":{"observed_at":"2026-08-07T01:05:01.439792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:01.445731Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.445731Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:aaa411a61db24c757ea80b4c5efb758fd7a1228cdb5f0e42c6b4909ebd1fe1cf","observation_id":"725db0a1-1ad0-473d-8af4-a049b475e7e2","resolution":{"observed_at":"2026-08-07T01:05:01.445731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.19660","snapshot_observed_at":"2026-08-07T01:05:01.448819Z","title":"arXiv preprint arXiv:2605.19660 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.448819Z"},"links":{"cited_paper":"/paper/2605.19660","citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:51de82434cf5a2e5d37558c634dbe78c5e66a222bedea6e8e3a5b104f6fd993b","observation_id":"fc571167-eef6-403b-bddc-ccf41ff95859","resolution":{"observed_at":"2026-08-07T01:05:01.448819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:01.452285Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher R\\' e","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.452285Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:cd3a25c5d6615e774af968c83372073c576668a148621c5459dbb09fc1a05a7f","observation_id":"9a26e4de-e560-4f9c-94fc-9839967ed314","resolution":{"observed_at":"2026-08-07T01:05:01.452285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:01.455429Z","title":"GQA : Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.455429Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:0c2260256890014f423b7cbb36ceb5d753441ce0baa29f0f835cc845fcf02c1f","observation_id":"827eaa1a-18cd-449c-b8cd-adc2e469d205","resolution":{"observed_at":"2026-08-07T01:05:01.455429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:01.458549Z","title":"H2o: heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.458549Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:c664a05bb92cea82e0fe047f486346b8091ee8c1b1a6d4e994522e966b86d748","observation_id":"5b5afc70-6221-442e-b0fe-1863322e16a5","resolution":{"observed_at":"2026-08-07T01:05:01.458549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:01.461342Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.461342Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:6ab099203b81e5091892757ed5b96d1fbdacfd775b0dc69052900c5c3e8a5b39","observation_id":"c52d8b4c-69e6-4467-bdad-aabfc1179e8f","resolution":{"observed_at":"2026-08-07T01:05:01.461342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.17757","last_updated":"2026-05-18T02:24:29Z","snapshot_observed_at":"2026-07-06T23:28:45.646975Z","submitted_at":"2026-05-18T02:24:29Z","title":"OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.17757","snapshot_observed_at":"2026-08-07T01:05:01.464147Z","title":"Oscar: Offline spectral covariance-aware rotation for 2-bit kv cache quantization","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.464147Z"},"links":{"cited_paper":"/paper/2605.17757","citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:f540c0a4f9681c7c9083b6e589fd22c21388217633a386397346d63fef5827bd","observation_id":"8dd6514a-c4b9-47c8-975c-960d6bea2707","resolution":{"observed_at":"2026-08-07T01:05:01.464147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:01.467302Z","title":"Qu IP : 2-bit quantization of large language models with guarantees","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.467302Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:a7b0d21ea13f4d2b7bac24079d3811f7fe33cdc4d8ba3e95400bc57e758b3111","observation_id":"b169cb03-d398-47bd-a115-f293490576e5","resolution":{"observed_at":"2026-08-07T01:05:01.467302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:01.470439Z","title":"Quarot: Outlier-free 4-bit inference in rotated llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.470439Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:3b549a4d1d7075feeb86334f39494878415bd31a140022484bab32008a3aa428","observation_id":"abed551c-853e-47e8-9218-89c59cc1d225","resolution":{"observed_at":"2026-08-07T01:05:01.470439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:01.473454Z","title":"Efficient memory management for large language model serving with PagedAttention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.473454Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:4153e85e6ae0d292266313643057bc5cc97bb5f732e4a65bd807ecee0cd8b139","observation_id":"978c0b94-72f0-422e-bc08-f9e26e7dc539","resolution":{"observed_at":"2026-08-07T01:05:01.473454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:01.476851Z","title":"Gonzalez, Clark Barrett, and Ying Sheng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.476851Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:e06c7c6e00f854e872d33682eb7a7255e730726362a8ac88fcf657d70e26594f","observation_id":"73792e1b-d7f7-49e4-b0b5-6f2c353d3fe7","resolution":{"observed_at":"2026-08-07T01:05:01.476851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:01.479586Z","title":"Rotatekv: accurate and robust 2-bit kv cache quantization for llms via outlier-aware adaptive rotations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.479586Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:09862b35c3bc47fd1931567918d9071f178f955ef73c83c6d7312196d7d92481","observation_id":"bc3c6dd6-51d5-44da-bd6d-0a7c3539098d","resolution":{"observed_at":"2026-08-07T01:05:01.479586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:01.482291Z","title":"Kivi: A tuning-free asymmetric 2bit quantization for kv cache","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.482291Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:d8e538aa2b73758365a35e1212ab66cf1626264e1410077defdeb15fb23cb60a","observation_id":"39c85fab-7e14-4464-b6c5-09b7efba8c1b","resolution":{"observed_at":"2026-08-07T01:05:01.482291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:01.485917Z","title":"Kitty: Accurate and efficient 2-bit KV cache quantization with dynamic channel-wise precision boost","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.485917Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:f4e55127349f432e39077ec922cb8afab230f4e274b2b2ce66e910dc1e52a937","observation_id":"403c9f4c-4b61-41e2-88fe-af109c421968","resolution":{"observed_at":"2026-08-07T01:05:01.485917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:01.488858Z","title":"Nsnquant: A double normalization approach for calibration-free low-bit vector quantization of kv cache","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.488858Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:8e1329391601b4006cba727281b62e029e53787ca1be03d0d877d4861e0bd9ab","observation_id":"63b84bcb-1b6d-4989-9aab-54c9df003dfc","resolution":{"observed_at":"2026-08-07T01:05:01.488858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:01.491666Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.491666Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:f6e5076e65c0e7c7cae2e07a5dc55d7179d97bdd328dc6876f0eb6bfdbcf005b","observation_id":"509b366e-d499-464a-a6f3-8ebac6e2d2e1","resolution":{"observed_at":"2026-08-07T01:05:01.491666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T01:05:01.494475Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.494475Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:3c460da7f44af704e33d6a43ba6c474fc296beb7191cde264d3ebffe764294c8","observation_id":"e2112e91-9d82-4d57-a99a-616026cc4698","resolution":{"observed_at":"2026-08-07T01:05:01.494475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21318","last_updated":"2025-04-30T05:05:09Z","snapshot_observed_at":"2026-08-12T04:56:27.232647Z","submitted_at":"2025-04-30T05:05:09Z","title":"Phi-4-reasoning Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21318","snapshot_observed_at":"2026-08-07T01:05:01.497024Z","title":"Phi-4-reasoning technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.497024Z"},"links":{"cited_paper":"/paper/2504.21318","citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:370cf4d0a8071a6a707c94b97520c21f8256a142d5586bab55b1356157544b59","observation_id":"476ffdcb-12ff-4ec6-a454-f1873e633d01","resolution":{"observed_at":"2026-08-07T01:05:01.497024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:01.499919Z","title":"Aime 2025: American invitational mathematics examination","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.499919Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:577fb22a6ef87cdce4f5ea89b86b9fb3bf286365cc98f6cb7e1574443b7a8b8c","observation_id":"c06f8f8b-cc51-4149-909b-8f8bd3e63c50","resolution":{"observed_at":"2026-08-07T01:05:01.499919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:01.502476Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.502476Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:da1cc6489c5a1a35c0090738de5854f6ee804ddbff932fab8e1dd6d9350d70db","observation_id":"5fdfb17b-4678-43cd-8d90-0b28b7bf3258","resolution":{"observed_at":"2026-08-07T01:05:01.502476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:01.505234Z","title":"Is your code generated by chat GPT really correct? rigorous evaluation of large language models for code generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.505234Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:8a477be22264a48c80b52939fd577bb1ced90d92cca70fa1ac4f9095df901cfe","observation_id":"fecf9b0a-6f5f-485f-8cd7-ad14864404ab","resolution":{"observed_at":"2026-08-07T01:05:01.505234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:01.507826Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.507826Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:1ef6ac55283889a92aad78c62d90c75a99f447222979a4b3dfc02066799197e2","observation_id":"f8def48e-f4c1-4388-8a71-e0cba08fcb60","resolution":{"observed_at":"2026-08-07T01:05:01.507826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:01.511303Z","title":"RULER : What s the real context size of your long-context language models? In First Conference on Language Modeling, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.511303Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:fadc28de8979a272ac8b9ad3c5d8cf324349e3c2e7582fa988995baf9113f024","observation_id":"7ce65457-3f0e-42f0-8d89-397299e6693d","resolution":{"observed_at":"2026-08-07T01:05:01.511303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T01:05:01.514284Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.514284Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:57a955e7bd774195fe7350a49701913578ccf09b69a5288b6c043a7625673a45","observation_id":"25662e92-a24e-484b-9de0-cbd87d50c79b","resolution":{"observed_at":"2026-08-07T01:05:01.514284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:05:01.516588Z","title":"Turboquant: Online vector quantization with near-optimal distortion rate","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.516588Z"},"links":{"citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:53d397f0cf7ffc2a56546b201906b88905c7754b2fb6fe8cf840e41dc579e3e3","observation_id":"9680ca57-cdff-46a4-a246-f69bd8f35268","resolution":{"observed_at":"2026-08-07T01:05:01.516588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2608.02691."}