{"as_of":"2026-08-13T07:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4db24f6d5cf3f52d52924c67160569ceb5f7946e1ed4416f01cdd7214ab499a6","coverage":[{"denominator":84,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T07:57:51.032025Z","state":"measured"},{"denominator":86,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":86,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T01:05:01.448819Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T00:15:14.285541Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"cited_work":{"arxiv_id":"2605.19660","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.19660","snapshot_observed_at":"2026-08-07T00:15:14.285541Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","venue":"cs.LG","work_id":"712ff666-c1bd-4b9e-b9bb-8db27a9acac1","year":2026},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:14.097278Z"},"links":{"cited_paper":"/paper/2605.19660","citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:776f10499fde71b7943e77a68ec6f125928842170f0e93d5cf8a20e8fd79a779","observation_id":"d8f4efb1-9ade-43f9-aaa0-d19ae8cdd392","resolution":{"observed_at":"2026-08-07T00:15:14.291004Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.19660","snapshot_observed_at":"2026-08-07T01:05:01.448819Z","title":"arXiv preprint arXiv:2605.19660 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02691","last_updated":"2026-08-05T18:00:06Z","snapshot_observed_at":"2026-08-10T14:32:30.082614Z","submitted_at":"2026-08-03T09:24:23Z","title":"Output-Aware Rotation for INT2 KV-Cache Quantization","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T01:05:01.448819Z"},"links":{"cited_paper":"/paper/2605.19660","citing_paper":"/paper/2608.02691"},"observation_digest":"sha256:51de82434cf5a2e5d37558c634dbe78c5e66a222bedea6e8e3a5b104f6fd993b","observation_id":"fc571167-eef6-403b-bddc-ccf41ff95859","resolution":{"observed_at":"2026-08-07T01:05:01.448819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.19660/citation-record","integrity":"/paper/2605.19660/integrity","json":"/paper/2605.19660/citation-record.json","paper":"/paper/2605.19660"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08832","last_updated":"2024-12-12T00:12:43Z","snapshot_observed_at":"2026-08-11T17:27:55.321639Z","submitted_at":"2024-12-12T00:12:43Z","title":"HadaCore: Tensor Core Accelerated Hadamard Transform Kernel","version":1},"cited_work":{"arxiv_id":"2412.08832","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08832","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Agarwal, R","venue":null,"work_id":"9acbc6c1-ce0b-4389-91df-417aca58b652","year":2024},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2412.08832","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:80a265c524cd6e64fd39678bc293744e194b5597e3451b0544a890c49c8f96db","observation_id":"ecd715b1-7218-406c-b391-10ef39050499","resolution":{"observed_at":"2026-05-20T07:58:07.636770Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-01T16:27:35.664983Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":"2508.10925","doi":"10.3115/1073083.1073135","metadata_source":"pith","pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","venue":"cs.CL","work_id":"178c1f7e-4f19-4392-a45d-45a6dfa88ead","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:288cd1ea95a9487159601df459fe27f8ddb91ec585295d9c77a7ae969724f42b","observation_id":"f0ec5982-051f-459b-a0f8-1ecd4a32c86f","resolution":{"observed_at":"2026-05-20T07:58:07.646425Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-11T19:19:47.962081+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T19:19:47.962081+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06415","last_updated":"2025-02-26T01:59:40Z","snapshot_observed_at":"2026-08-13T02:49:13.056289Z","submitted_at":"2025-02-10T12:54:17Z","title":"Systematic Outliers in Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.06415","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.06415","snapshot_observed_at":"2026-07-10T02:26:42.777951Z","title":"Systematic outliers in large language models","venue":"cs.CL","work_id":"5b7b454a-39df-464f-ac5e-d0c154670a7b","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2502.06415","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:dfe8e113ecbf21b0ae9716c4e1585b95c807a8a2ed21d858902717dc948a1e09","observation_id":"dc9d6ca1-9a3a-4a0b-8368-cba5d646fb61","resolution":{"observed_at":"2026-05-20T07:58:07.649938Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Quarot: Outlier-free 4-bit inference in rotated llms.Advances in Neural Information Processing Systems, 37:100213– 100240","venue":null,"work_id":"c7ead886-6b98-4085-a839-493bb5e67d46","year":2024},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:735eb7baa542c8e9294ae4efa4f2e278eae505b3780924b9673046a088ec6d04","observation_id":"e453f698-d8ce-43a5-bc72-6cf5c451dc05","resolution":{"observed_at":"2026-05-20T07:58:07.825069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:c43c28d8834b47a0195e1ce7686239c7472881511d2e1fec08bf554f81271e61","observation_id":"372b029d-5e0d-4ea3-9de4-dea3e5a0e476","resolution":{"observed_at":"2026-05-20T07:58:07.643352Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.251886Z","title":"Longbench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":"217e4962-b6b3-4402-ab00-96bc6344fb75","year":2024},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:dcde18b389d9df8d1356eb135f4380012675ca7dd125a49de70ede38ac3d601e","observation_id":"c4e106a4-4bce-42d6-a1de-70d10ee4f0eb","resolution":{"observed_at":"2026-05-20T07:58:07.828383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bondarenko, M","venue":null,"work_id":"5f2cb1c8-d000-4708-8a81-99dc9fa42db0","year":2023},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:2622cd7f551359afb19ed163a0114fa8d57c1e0e1d3d4d549ebdd941ea5c0df5","observation_id":"4fffa210-298a-4631-936c-69201901db9e","resolution":{"observed_at":"2026-05-20T07:58:07.832499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-08-13T04:39:30.300015Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"cited_work":{"arxiv_id":"2406.02069","doi":"10.48550/arxiv.2406.02069","metadata_source":"pith","pith_arxiv_id":"2406.02069","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","venue":"cs.CL","work_id":"6317700d-f903-4ce1-8f53-b43cb146d48b","year":2024},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2406.02069","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:271c66d9628596389b3bef6a11a18ad0ea7f338c2ea6da0747dbf3b4fddbe834","observation_id":"cb595ec9-f028-46c7-b7b4-e4442ae1acb7","resolution":{"observed_at":"2026-05-20T07:58:07.640084Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-25T13:53:26.042348+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T13:53:26.042348+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.00729","last_updated":"2026-02-28T16:25:04Z","snapshot_observed_at":"2026-08-08T12:09:54.012271Z","submitted_at":"2026-02-28T16:25:04Z","title":"Qwen3-Coder-Next Technical Report","version":1},"cited_work":{"arxiv_id":"2603.00729","doi":"10.48550/arxiv.2603.00729","metadata_source":"pith","pith_arxiv_id":"2603.00729","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-Coder-Next Technical Report","venue":"cs.CL","work_id":"ad966e68-641d-4b33-a9da-57cf741f35a6","year":2026},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2603.00729","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:8f63141750cb874d1ce65ebe9132b56f7422cd907895e992f10d32590f6953f3","observation_id":"06428fef-c58c-42c6-a6b8-fcb1a7fb8627","resolution":{"observed_at":"2026-05-20T07:58:07.499287Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0b2993f2-91fe-42d4-ada4-4e74ef4b71ae","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:c31a7af9f862cc7a70d008d4c208990dbad8cf0c97fe4ef01d3384a7f6cbd1b0","observation_id":"1c6ca095-1675-457f-95ac-493db3a39fb1","resolution":{"observed_at":"2026-05-20T07:58:07.841929Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06219","last_updated":"2024-11-12T08:18:45Z","snapshot_observed_at":"2026-08-13T00:10:32.730191Z","submitted_at":"2024-05-10T03:06:24Z","title":"SKVQ: Sliding-window Key and Value Cache Quantization for Large Language Models","version":3},"cited_work":{"arxiv_id":"2405.06219","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.06219","snapshot_observed_at":"2026-07-04T00:19:13.103948Z","title":"Skvq: Sliding-window key and value cache quantization for large language models","venue":null,"work_id":"a4d09c5c-8903-469c-af40-dfc935e82725","year":2024},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2405.06219","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:789ba861ca57628925ce9fb0c3717da99c26e406473a20015d16b51123ddc59f","observation_id":"8f723870-2de1-4691-9464-f77518348e75","resolution":{"observed_at":"2026-05-20T07:58:07.629942Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-11T21:19:33.078277Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":"2210.17323","doi":"10.48550/arxiv.2210.17323","metadata_source":"pith","pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","venue":"cs.LG","work_id":"19ed8c44-202a-48f6-8169-637d5a5f2408","year":2022},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:64e75e089c929bc4fcc70022e1132d7581ce06b082e1b8cf790c9630f29e4f8e","observation_id":"73d3b5e2-2f43-45ef-9027-377a3abfea1f","resolution":{"observed_at":"2026-05-20T07:58:07.530075Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-17T20:22:03.028003+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-17T20:22:03.028003+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-08-12T07:32:52.500307Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":"2310.01801","doi":"10.48550/arxiv.2310.01801","metadata_source":"pith","pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","venue":"cs.CL","work_id":"91379982-466d-4895-96f5-079b66259a73","year":2023},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:2b2db1c16e1def064735a80997c1104c16c82844bcadc074acb8c834dfccb12e","observation_id":"ef738569-2595-40ac-9497-d8d2453f9d6d","resolution":{"observed_at":"2026-05-20T07:58:07.533040Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13835","last_updated":"2024-11-07T16:57:02Z","snapshot_observed_at":"2026-08-12T22:20:40.144007Z","submitted_at":"2024-10-17T17:54:06Z","title":"Active-Dormant Attention Heads: Mechanistically Demystifying Extreme-Token Phenomena in LLMs","version":2},"cited_work":{"arxiv_id":"2410.13835","doi":"10.48550/arxiv.2410.13835","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13835","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Active-dormant attention heads: Mechanistically demystifying extreme-token phenomena in llms","venue":"arXiv (Cornell University)","work_id":"fa20aee6-a22b-4dcd-b6c0-82be17265052","year":2024},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2410.13835","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:2795b03ed65f29e44bd79b57fcaf0e4d85618613f9c5cc1242dcc30225373976","observation_id":"5bcaaeb4-84f8-49a7-a303-44f426b2c0d2","resolution":{"observed_at":"2026-05-20T07:58:07.507093Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a1294976-9859-41ba-aa8e-09fffed4f89a","year":2024},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:51da4e00223e5996bbc906dd08463a154123fd81d971b86eddb85b9f35f576f5","observation_id":"43ede9d8-fd69-4010-9872-b811597985ab","resolution":{"observed_at":"2026-05-20T07:58:07.856033Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02617","last_updated":"2025-02-04T08:52:13Z","snapshot_observed_at":"2026-08-13T06:32:51.676451Z","submitted_at":"2025-02-04T08:52:13Z","title":"PolarQuant: Quantizing KV Caches with Polar Transformation","version":1},"cited_work":{"arxiv_id":"2502.02617","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02617","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2502.02617","venue":null,"work_id":"0656e7a9-3b29-406d-82cc-a0bb7a7113e4","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2502.02617","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:5e99b4fc2e6f4758bee776d64573658f6f976c1bac27bf6b9a40b4ad504baecd","observation_id":"db8efc28-cf26-440c-ae0f-fac15c49d79e","resolution":{"observed_at":"2026-05-20T07:58:07.520404Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on large language model acceleration based on kv cache management.Transactions on Machine Learning Research","venue":null,"work_id":"01ad300c-4157-4435-9cdb-eaadaf0d6030","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:8d7f77d525df7b2af017cd397120882903f333422062cc326b7f14738d8b9e52","observation_id":"e7dd9bfb-1645-4a45-8391-4e62b0b989f8","resolution":{"observed_at":"2026-05-20T07:58:07.852150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zipcache: Accurate and efficient kv cache quantization with salient token identification.Advances in Neural Information Processing Systems, 37:68287–68307","venue":null,"work_id":"5075da11-dd56-4e49-b980-94ace6d62148","year":2024},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:e21cc0212b8270102b208a565fe0290691f100935639c40c3e7d452743585a13","observation_id":"a0a8bdb8-ffe2-42b5-a22f-bbfd492ab9fd","resolution":{"observed_at":"2026-05-20T07:58:07.836400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04326","last_updated":"2026-03-01T04:35:41Z","snapshot_observed_at":"2026-08-12T16:10:35.170069Z","submitted_at":"2025-02-06T18:59:40Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","version":3},"cited_work":{"arxiv_id":"2502.04326","doi":"10.48550/arxiv.2502.04326","metadata_source":"pith","pith_arxiv_id":"2502.04326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","venue":"cs.CV","work_id":"9fb20f56-0773-406f-93c4-122a3e2ab9e4","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2502.04326","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:0008a9cf7ce8a99fd94c131fca6c07ea019913c414a65f11bef4f5b93d0ae9a6","observation_id":"4daea65d-389a-4ad0-b273-bf6a71929406","resolution":{"observed_at":"2026-05-20T07:58:07.513467Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kvquant: Towards 10 million context length llm inference with kv cache quantization.Advances in Neural Information Processing Systems, 37:1270–1303","venue":null,"work_id":"5091dc6d-2942-4017-82f7-ae6ce722fbe6","year":2024},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:049a50c77e622441121d5d17c6e052c8a231a812185640633c17813bae1b6efd","observation_id":"be774772-dbd5-4fb3-9085-aabc51df1645","resolution":{"observed_at":"2026-05-20T07:58:07.903582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The llama 3 herd of models.preprint","venue":null,"work_id":"2d64d93e-7da9-4cae-b7f9-90fc2c03ff26","year":2024},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:6c2183a0926d467948299b2ed6c6a7b3c7ed715e191d7297fcf8f75c8d0b99fc","observation_id":"cb9e9641-d8ca-4f91-8a30-39d0f78b9340","resolution":{"observed_at":"2026-05-20T07:58:07.863091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.28430","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Isoquant: Hardware-aligned so (4) isoclinic rotations for llm kv cache compres- sion","venue":null,"work_id":"59be31f1-4acc-4a6f-85b3-106c571ab334","year":2026},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:18710633388bee23c99ef2a5d22364cc582fc875d293d802d82b5bd99fa9f1b8","observation_id":"30cd14bb-fe5f-4d76-b91f-8a1eacb2baae","resolution":{"observed_at":"2026-05-20T07:58:07.523391Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01563","last_updated":"2025-05-20T18:08:40Z","snapshot_observed_at":"2026-08-09T14:54:41.744159Z","submitted_at":"2025-02-03T17:47:03Z","title":"Massive Values in Self-Attention Modules are the Key to Contextual Knowledge Understanding","version":4},"cited_work":{"arxiv_id":"2502.01563","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01563","snapshot_observed_at":"2026-07-04T09:09:43.221590Z","title":"Massive values in self-attention modules are the key to contextual knowledge understanding","venue":null,"work_id":"bcbf2451-3e8b-4662-80d9-4dc6f6a5cb75","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2502.01563","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:0993801cd82178980ae52d7ca8db6aca4ec927497d96f00b377ca080519d2fda","observation_id":"40471e3a-fd86-4eab-96cd-5acd8235482b","resolution":{"observed_at":"2026-05-20T07:58:07.496041Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llmtest_needleinahaystack","venue":null,"work_id":"6b529407-d40a-4fd9-96ea-a8e905bb59e1","year":2023},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:8e9cf4ccd2d88c55594e81adaaa4324ba26996e11a86bd30d0ec641b9d6b1cc6","observation_id":"ae4bd46a-6c61-4509-a8f0-db1293093714","resolution":{"observed_at":"2026-05-20T07:58:07.920696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T12:53:51.708124Z","title":"See what you are told: Visual attention sink in large multimodal models","venue":null,"work_id":"b074b72c-756a-47ab-b799-0e1fad4073aa","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:0f8ca4565b022b469a3cef8a1b39f6bdb10e4ed8e392b7e49b584d9f617faa8d","observation_id":"3a4d22bc-069a-4117-8628-a0acf34ca726","resolution":{"observed_at":"2026-05-20T07:58:07.923036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kumar, Š","venue":null,"work_id":"fbec4726-c11d-4652-a88f-5abcddb31cc3","year":2026},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:19af6714f7a29aaf1524e89a3dde951e1f7024ceff3863aefd37c4dc90449528","observation_id":"7245277d-0ffc-4d4e-93d7-97cd83fdbd29","resolution":{"observed_at":"2026-05-20T07:58:07.924971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:3e7e5c86c7c589844f8079616e6969e489996c3bb1bad02a455f77587c08585c","observation_id":"74527fd8-9233-4f79-bd50-8345ac59ce47","resolution":{"observed_at":"2026-05-20T07:58:07.619781Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19442","last_updated":"2025-07-30T05:24:46Z","snapshot_observed_at":"2026-08-11T00:33:34.388194Z","submitted_at":"2024-12-27T04:17:57Z","title":"A Survey on Large Language Model Acceleration based on KV Cache Management","version":3},"cited_work":{"arxiv_id":"2412.19442","doi":"10.48550/arxiv.2412.19442","metadata_source":"pith","pith_arxiv_id":"2412.19442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A survey on large lan- guage model acceleration based on kv cache management","venue":"cs.AI","work_id":"5ad86189-256c-4911-bb00-fbfc90ae9a4e","year":2024},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2412.19442","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:a5a5fcb3f69e3cdbb5bf49639a982cf90825d1810bba1c8ee50b1cdeef6826bf","observation_id":"35a2ed9b-acca-44d0-8f7b-cb2d4e5a932e","resolution":{"observed_at":"2026-05-20T07:58:07.590441Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:20:05.433835+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:20:05.433835+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19602","last_updated":"2025-05-26T07:11:42Z","snapshot_observed_at":"2026-08-13T07:02:58.828486Z","submitted_at":"2025-05-26T07:11:42Z","title":"Memory-Efficient Visual Autoregressive Modeling with Scale-Aware KV Cache Compression","version":1},"cited_work":{"arxiv_id":"2505.19602","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19602","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Memory-efficient visual au- toregressive modeling with scale-aware kv cache compression","venue":null,"work_id":"749ed683-89fb-49a6-b565-8f46daab3fe4","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2505.19602","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:e3a837eec106459bfdd4f02adf0fcb2c4ccd15819344d4eba1448c1faeac7a33","observation_id":"348b6ba1-7a44-4b8c-91ef-076c5be59bb4","resolution":{"observed_at":"2026-05-20T07:58:07.596260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.23225","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tweo: Transformers without extreme outliers enables fp8 training and quantization for dummies","venue":null,"work_id":"a81bf3d3-8479-4122-a6e2-82440ee3f8ad","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:79c64be9c9a245de27c66da15c5bd6e95152e2dc7abf11f1f063d236fb8c57f1","observation_id":"0e9b1aea-0cfa-418b-9d84-1a22915e00ad","resolution":{"observed_at":"2026-05-20T07:58:07.587263Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T17:05:09.008702Z","title":"Awq: Activation-aware weight quantization for on-device llm compression and acceleration.Proceedings of machine learning and systems, 6:87–100","venue":null,"work_id":"2446ee30-3b81-412e-826d-a75cd7821fdc","year":2024},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:b53f51157f08b14da6da8efbb713edd57ee6a828b8c866aca88b0054f68810d7","observation_id":"8c20e483-49f1-455d-82de-47881dc9ae30","resolution":{"observed_at":"2026-05-20T07:58:07.906007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8ac72f7a-2e86-4e15-85bc-b8eaf944a56c","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:6b1d3b5a560a2cba52dd3618f67841dc47c7c64bfd981c8b2f5b8b45f3552359","observation_id":"ba2c2f48-799b-41f3-ba21-f4716cc82faa","resolution":{"observed_at":"2026-05-20T07:58:07.909825Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minicache: Kv cache compression in depth dimension for large language models.Advances in Neural Information Processing Systems, 37:139997–140031","venue":null,"work_id":"6b8b1a0f-d6dd-4d21-8a9c-c2ed55c82b89","year":2024},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:c98a8a1d606a724402390f7417b152d086fd32d17ec482b0f5f95ec95c0d798f","observation_id":"617d7a4b-47d0-4881-95e5-b1d67744347b","resolution":{"observed_at":"2026-05-20T07:58:07.901311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a0469712-c7ec-4616-b44c-1a43072c36c4","year":2024},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:58156bd0fac03430883427f17a60110b84656b0e8581c58035f72b524a40f47c","observation_id":"03ce1c3d-475b-4de0-8d96-1f1fe8906514","resolution":{"observed_at":"2026-05-20T07:58:07.908020Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"500eeee5-e503-4b6f-bdf2-ae8cb934dbb1","year":2023},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:5edd8e3ce690626594b902ea72684f87bf87df97a399e6bb70a982d3a31ec946","observation_id":"c818df99-2831-417f-8934-ab7d1403d2a2","resolution":{"observed_at":"2026-05-20T07:58:07.918678Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kv cache compression for inference efficiency in llms: A review","venue":null,"work_id":"f310a31d-0613-4587-a450-a255bb12e788","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:7e8acbb0d2cbd1d57fee01219c67df9aa752b3249b91a18d976fd2dc59bf68e7","observation_id":"31e624b1-d012-4bf7-8b9e-146df961e10e","resolution":{"observed_at":"2026-05-20T07:58:07.891294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ocrbench: on the hidden mystery of ocr in large multimodal models.Science China Information Sciences, 67(12):220102","venue":null,"work_id":"9887a09f-72c9-4de3-b543-9b46f47ded98","year":2024},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:48be38c112653978aa5afb7958fa15585cb1764f2a0294f413fb6d1f9b8ee728","observation_id":"b91442be-f4f7-4525-84c3-a320476ca5cf","resolution":{"observed_at":"2026-05-20T07:58:07.897321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-08-12T17:03:50.984887Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":"2402.02750","doi":"10.48550/arxiv.2402.02750","metadata_source":"pith","pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","venue":"cs.CL","work_id":"735737c3-24e5-41c3-ab4f-04edcb36731c","year":2024},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:1d8b16c94432bb98362a113c285080c0b77ee5c5d1dc7a4830a48b3322af4427","observation_id":"6cd8ccc9-250e-469a-8368-1e925f9d6fa6","resolution":{"observed_at":"2026-05-20T07:58:07.560931Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:24:54.995865Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"43d0f508-20bf-454b-8142-c42f29cca1a4","year":2021},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:04ce6188b59d84c391cc796ab461cd15ca1c46d5400e0eaaeaea9bfd626ac551","observation_id":"8ca60cd6-996b-4faa-a111-123943c07090","resolution":{"observed_at":"2026-05-20T07:58:07.927325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08295","last_updated":"2021-06-15T17:12:42Z","snapshot_observed_at":"2026-08-02T11:19:40.664702Z","submitted_at":"2021-06-15T17:12:42Z","title":"A White Paper on Neural Network Quantization","version":1},"cited_work":{"arxiv_id":"2106.08295","doi":"10.48550/arxiv.2106.08295","metadata_source":"pith","pith_arxiv_id":"2106.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A White Paper on Neural Network Quantization","venue":"cs.LG","work_id":"7560ab05-45c2-4a5f-8b54-693bdf37c816","year":2021},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2106.08295","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:0ac0d0cf3fc236877a434e9d4603c38ce212696318889a4dafa45daa488d4acf","observation_id":"91dc4cb1-e57f-4aa3-afc3-70b4f16c5811","resolution":{"observed_at":"2026-05-20T07:58:07.516687Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rotorquant: Clifford algebra vector quantization for llm kv cache compression","venue":null,"work_id":"d28d3fc5-b64f-4fe5-92e4-615775cc8cbe","year":2026},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:bef8e27c9adedb533b8fa99269230398c5758613e570f332b6371c6a1fe7b204","observation_id":"79a29c3a-2d08-4297-a222-ae5f83f0d284","resolution":{"observed_at":"2026-05-20T07:58:07.882780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Head-aware kv cache compression for efficient visual autoregressive modeling","venue":null,"work_id":"56635087-f453-48d1-9de5-ecddfad5860a","year":2026},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:64c8d89c0a2e6c48e9d996270f11ba8ff80b27729e9c0c4ee698257375ebbdd6","observation_id":"fe7a6def-692f-4b84-9627-e2d5cf0b8371","resolution":{"observed_at":"2026-05-20T07:58:07.880169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gated attention for large language models: Non-linearity, sparsity, and attention-sink-free","venue":null,"work_id":"2abb7cbc-9318-44b7-a000-f01ede421000","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:26cb1bf4bffe69e6cb55e96aa4bad8323f12fcf9d559230a8e06813baf0ef0ff","observation_id":"0e824b0b-5c16-4fd6-95cc-d135cbd340d2","resolution":{"observed_at":"2026-05-20T07:58:07.885000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Accurate kv cache quantization with outlier tokens tracing","venue":null,"work_id":"3c30416b-32a0-4320-bf42-813cbcd5e5af","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:dba69a29538bb7d3359f6ae5d802cf520732cdb41b45efa01c5d2e0635ad251e","observation_id":"f4e45f87-398a-4fd3-9441-4ad2b3c5a16a","resolution":{"observed_at":"2026-05-20T07:58:07.887063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16383","last_updated":"2025-02-02T03:04:54Z","snapshot_observed_at":"2026-08-12T06:09:48.327480Z","submitted_at":"2025-01-25T01:45:29Z","title":"RotateKV: Accurate and Robust 2-Bit KV Cache Quantization for LLMs via Outlier-Aware Adaptive Rotations","version":2},"cited_work":{"arxiv_id":"2501.16383","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.16383","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RotateKV: Accurate and robust 2-bit KV cache quantization for LLMs via outlier-aware adaptive rotations","venue":null,"work_id":"22cf4f09-6722-4326-9f8f-94715e45d56c","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2501.16383","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:f949bf006e776bce66e2463b3afa99d15fed363d288d0430c7929d8b6a604515","observation_id":"41d962c0-fc9c-4511-8c8c-77d62cc30e1e","resolution":{"observed_at":"2026-05-20T07:58:07.552003Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.23279","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:00:09.050200Z","title":"Unveiling super experts in mixture-of-experts large language models","venue":null,"work_id":"d563d0e0-da96-4b3f-bed9-67c8e41f048a","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:fcb934d275c8816d53ec0adc48fd794320afb38240e15b5bcde356edc59d1d45","observation_id":"b6528dfe-9198-4bf9-9b15-d9d4aedac85d","resolution":{"observed_at":"2026-05-20T07:58:07.566981Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Akvq-vl: Attention-aware kv cache adaptive 2-bit quantization for vision-language models","venue":null,"work_id":"5f0af061-886b-4427-9d6e-f45c812ebaa2","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:41b4a00de9558eae0c662d5336a82f8bf227dba435506b160d53c5a23f6ed1b2","observation_id":"d689c19e-40d5-4345-90c1-b317885daa5a","resolution":{"observed_at":"2026-05-20T07:58:07.889109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xstreamvggt: Extremely memory-efficient streaming vision geometry grounded transformer with kv cache compression.Journal of the Society for Information Display","venue":null,"work_id":"9a4fc994-a231-43fa-b5e3-90ea30096793","year":2026},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:ee8d70bb529f0566d2a0c3384788330a18f20cfd8fbe35513d2a669d5a2990bc","observation_id":"12675734-b3e5-423b-9e90-db51772bc204","resolution":{"observed_at":"2026-05-20T07:58:07.877496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04257","last_updated":"2025-08-06T09:40:09Z","snapshot_observed_at":"2026-08-12T12:22:45.193172Z","submitted_at":"2025-08-06T09:40:09Z","title":"KVSink: Understanding and Enhancing the Preservation of Attention Sinks in KV Cache Quantization for LLMs","version":1},"cited_work":{"arxiv_id":"2508.04257","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.04257","snapshot_observed_at":"2026-06-30T11:14:37.612699Z","title":"Kvsink: Understanding and enhancing the preservation of attention sinks in kv cache quantization for llms","venue":null,"work_id":"74eea277-92cf-4c33-974f-fce6f0e92678","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2508.04257","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:969f5686b7ea494443f8889508276812cc0494b1f11e2875838d6731ebaaafa5","observation_id":"ade11d7c-0e74-4014-a1cb-322d12922c7a","resolution":{"observed_at":"2026-05-20T07:58:07.564169Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-08-11T07:40:34.488378Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"cited_work":{"arxiv_id":"2604.10098","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.10098","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","venue":"cs.LG","work_id":"13fd00a7-48b0-40e3-82a7-8502aef0377c","year":2026},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2604.10098","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:e5a6deebbc12a799cfb22c9d8d8ba91477b219a625817dfd1a4c3d27efec8827","observation_id":"4c0a1a53-3f16-4983-80fb-9df02a31f889","resolution":{"observed_at":"2026-05-20T07:58:07.543129Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.17762","doi":"10.48550/arxiv.2402.17762","metadata_source":"pith","pith_arxiv_id":"2402.17762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Massive Activations in Large Language Models","venue":"cs.CL","work_id":"a8da768a-7f38-4db5-912b-4d5b7581c8dd","year":2024},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2402.17762","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:514df7a00511e722d8d76c7b9b274eb63b6689f154c446441cf2780d00195552","observation_id":"394692bc-6410-4042-a7aa-acc161029fe6","resolution":{"observed_at":"2026-05-20T07:58:07.583961Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:24.227166+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.16257","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T19:16:00.869883Z","title":"Plug-and-play 1","venue":null,"work_id":"221397bf-8472-4e1c-90df-396708d814b6","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:4ca63b6676b9d0da69986b5d130ddecf07dd261df7ce04f8bf2e3ffa23df6de6","observation_id":"0f4301aa-4fea-4566-b488-53b207df054c","resolution":{"observed_at":"2026-05-20T07:58:07.632939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-08-07T19:30:34.681869Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":"2510.26692","doi":"10.48550/arxiv.2510.26692","metadata_source":"pith","pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","venue":"cs.CL","work_id":"b2f9f1cd-c39c-4dbc-8637-f575681cdc01","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:a6222f58207a8fea60eb106efd5a4bf35d5ebc541ce0497dc98471f971187731","observation_id":"9fe4a42a-9aa2-448a-a3e9-2f9a8264f3c0","resolution":{"observed_at":"2026-05-20T07:58:07.546337Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.00279","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T11:59:50.609970Z","title":"Longcat-flash-omni technical report","venue":null,"work_id":"1dbab870-b4d6-467a-8178-d537289d5aa4","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:34463a7bf44e2b3d21ab69787e06ab53a4716e75dea542150d2654e6f1f74a7e","observation_id":"a5cdca0f-404a-464f-bb97-e58c1b8d5b5c","resolution":{"observed_at":"2026-05-20T07:58:07.610161Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.27538","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:59:52.882376Z","title":"Longcat-next: Lexicalizing modalities as discrete tokens","venue":null,"work_id":"b02143c1-c2e9-4a92-ad39-93f93fd2eba7","year":2026},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:df3972a52cb67b62a29c015328a6a4cb0f0ea597d76bf8ffa07e3dbe7ecd4938","observation_id":"eabeff5c-908d-4f95-b590-969378227d5e","resolution":{"observed_at":"2026-05-20T07:58:07.613463Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.22200","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:41.030379Z","title":"Longcat-video technical report.arXiv preprint arXiv:2510.22200","venue":null,"work_id":"b1a745e0-8d8e-4399-8d09-047d761f349d","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:10f56960a6561475faa99555a2291349f43d40f0452c5ac47ec810a613a828a6","observation_id":"1ec59c8a-f67d-4f39-a356-4538c960826b","resolution":{"observed_at":"2026-05-20T07:58:07.569855Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.16725","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:50:10.434955Z","title":"Longcat-flash-thinking-2601 technical report","venue":null,"work_id":"1375347d-bbc3-47bf-a423-d4e39ac50144","year":2026},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:2872e8ec692d4178428f7876510f742da1a2b533228226a6040a73c9ef483c60","observation_id":"e3459f03-ba0e-41c6-acde-a10435ae50ae","resolution":{"observed_at":"2026-05-20T07:58:07.555273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.18883","doi":"10.48550/arxiv.2509.18883","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Introducing LongCat-flash-thinking: A technical report","venue":"arXiv (Cornell University)","work_id":"d83b56e1-68ce-4e32-b9c0-fc080b79c8fd","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:e637f93b3bce687261cc06c0c0dd51f982defa2ca39d5647298f006d2f0ebfb3","observation_id":"42b774b1-87ae-462e-a334-67bfa78d7e3f","resolution":{"observed_at":"2026-05-20T07:58:07.510629Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.01322","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T09:37:49.308056Z","title":"Longcat-flash technical report","venue":null,"work_id":"112bbed5-cf36-4773-82b3-0229bfea4626","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:56e331d163606aef4728f059362eb2506a9da0d8ad75a6e15f64d692c4871bf7","observation_id":"ff86933c-1abb-4b62-a5b1-d8bcdb3aaad9","resolution":{"observed_at":"2026-05-20T07:58:07.623225Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:d9e741458e34d8787f7cc6c46f19d02d6d86bf3c6bcc23b863734005bf35ee30","observation_id":"4aadfc4a-679b-46cc-80cd-91613848ca31","resolution":{"observed_at":"2026-05-20T07:58:07.616421Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention reallocation: Towards zero-cost and controllable hallucination mitigation of mllms","venue":null,"work_id":"a6a9641b-5be7-4c38-a3cb-5a357947a595","year":2026},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:a765a0ecfd25e4a94f217427d2b2277a36099ad0bc593231cc43c074bfcd94fd","observation_id":"832b6e7a-707f-43ee-8f83-3d2df668885f","resolution":{"observed_at":"2026-05-20T07:58:07.867383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Turboquant+","venue":null,"work_id":"03b1a5f0-f5fd-4c43-b2b1-64750fc31e20","year":2026},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:af3ba7a6ebcdabe0ab0ed2f5a32e97a7d688e0b45622b38dbee1378016fb8597","observation_id":"688d1003-c064-4455-821b-1566d3f28439","resolution":{"observed_at":"2026-05-20T07:58:07.874404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vaswani, N","venue":null,"work_id":"51341a62-fa03-4657-b033-ba71eab9ff22","year":2017},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:556f8e2def72cf2a787ff24be62a2418f5ac6cd11d64bb98db7bff6e504d8bf5","observation_id":"4b8ad9c6-85ff-4bbd-826f-55ae12a1ff6e","resolution":{"observed_at":"2026-05-20T07:58:07.872294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Look-m: Look-once optimization in kv cache for efficient multimodal long-context inference","venue":null,"work_id":"65812470-0ba7-4afd-9feb-1ee4aa1a41bd","year":2024},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:dfe64ca39c033aa4849b170a2f4723bf586f541defb68279faa50c2832e4be50","observation_id":"582d8f86-0f0a-450d-bd0b-cd617692a39d","resolution":{"observed_at":"2026-05-20T07:58:07.839421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.21065","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T13:46:59.595617Z","title":"arXiv preprint arXiv:2603.21065 , year=","venue":null,"work_id":"cf8163a7-6d8b-4656-a3ea-30c1abbc76ae","year":2026},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:1a8c110ff0a28cc89ceae5e477a0b7f3f2f218f65b399e2593b95470f14a90eb","observation_id":"4c45a02f-890f-42af-86ff-9d77e382ba3b","resolution":{"observed_at":"2026-05-20T07:58:07.573075Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Outlier suppression+: Accurate quantization of large language models by equivalent and effective shifting and scaling","venue":null,"work_id":"aab50e39-9f2b-4a87-9cd8-dba5fd682c58","year":2023},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:5b2ace4cdcc92ca8cf0ae809dcbcdd965983e90bea432c9f5eacb14ac5dddcb8","observation_id":"33612b44-44b1-474a-a5fb-8b01832ffd3f","resolution":{"observed_at":"2026-05-20T07:58:07.849032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22618","last_updated":"2025-07-03T04:51:05Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:39:15Z","title":"Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding","version":3},"cited_work":{"arxiv_id":"2505.22618","doi":"10.48550/arxiv.2505.22618","metadata_source":"pith","pith_arxiv_id":"2505.22618","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fast-dLLM: Training-free Acceleration of Diffusion LLM by Enabling KV Cache and Parallel Decoding","venue":"cs.CL","work_id":"9f6c2a70-9830-48ae-b181-6b5b1cbfae97","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2505.22618","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:3c97ae8e611bd151db52b74108d3a309dc5f0cdab839f12f681753b6f6f0964b","observation_id":"ee050c57-a5f3-4bd4-b748-f7a2d3473e1e","resolution":{"observed_at":"2026-05-20T07:58:07.626143Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-05-25T17:53:19.96554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T17:53:19.96554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":"2309.17453","doi":"10.48550/arxiv.2309.17453","metadata_source":"pith","pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Streaming Language Models with Attention Sinks","venue":"cs.CL","work_id":"a8d25452-c237-48c9-88a4-682717c3979a","year":2023},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:3b739d0fd2a5f9a14214d76328823972e33ce54b00d538e1cd374313aadb9ac5","observation_id":"5388d479-76ff-47b1-9524-51736dd6518a","resolution":{"observed_at":"2026-05-20T07:58:07.540158Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smoothquant: Accurate and efficient post-training quantization for large language models","venue":null,"work_id":"77fc2260-e069-4a67-902b-18c51bfc7a29","year":2023},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:c95491ba751726b54ac7453d184ffc432c4b5ed4875eb0dc1e4c9a937ae184de","observation_id":"3caf9b96-20eb-41e8-a37d-e11192a8847d","resolution":{"observed_at":"2026-05-20T07:58:07.914330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.03332","doi":"10.48550/arxiv.2508.03332","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exploring layer-wise information effectiveness for post-training quantization in small language models","venue":"arXiv (Cornell University)","work_id":"1674648d-bdff-4075-ab26-e3f9db8393ec","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:3b51f5e43415c72b9e1af6e860992d71f1f4ea5bc930e95c5621e5b6b6e0aaba","observation_id":"f647178f-60cc-4b65-8008-7726a2f16f14","resolution":{"observed_at":"2026-05-20T07:58:07.558157Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.09146","doi":"10.48550/arxiv.2511.09146","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dope: Denoising rotary position embedding","venue":"ArXiv.org","work_id":"f2c450f3-6d65-4abd-85f6-2288d55b379a","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:2ebea58c7f7614135778f7b8e02dd9773ff7f92f055415c8574dad2930188d37","observation_id":"e514ea86-2909-4e40-b8ea-cbf5bb78be7e","resolution":{"observed_at":"2026-05-20T07:58:07.606398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-08-11T00:14:34.061687Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2509.17765","doi":"10.48550/arxiv.2509.17765","metadata_source":"pith","pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-Omni Technical Report","venue":"cs.CL","work_id":"ae43e594-8bab-4471-b6af-92a300f6a048","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:673e5801e9524f981094b82b9460de773bac2b0a1518f5c690ad165e788bca89","observation_id":"420a5449-9e48-40a2-a9e9-93f82d155e9a","resolution":{"observed_at":"2026-05-20T07:58:07.549036Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:8cf9467acb1f4ab93a63508f4ae93da20da4967250b3ca046d904781ec726154","observation_id":"ca4f729e-d93f-480f-a792-9f706fa4e5c6","resolution":{"observed_at":"2026-05-20T07:58:07.526422Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19874","last_updated":"2025-04-28T15:05:35Z","snapshot_observed_at":"2026-08-12T14:56:34.943373Z","submitted_at":"2025-04-28T15:05:35Z","title":"TurboQuant: Online Vector Quantization with Near-optimal Distortion Rate","version":1},"cited_work":{"arxiv_id":"2504.19874","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.19874","snapshot_observed_at":"2026-07-09T17:46:25.912940Z","title":"TurboQuant: Online Vector Quantization with Near-optimal Distortion Rate","venue":"cs.LG","work_id":"1356ba41-d62f-4cb4-9bed-c69836b5968a","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2504.19874","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:f81f0cb6fcd0dcfd879be2b01545afbaea9b688399b302cb3c3d58ef1215aea1","observation_id":"348bb6e0-25a0-40e5-aa8b-cca2c47d56e6","resolution":{"observed_at":"2026-05-20T08:09:22.519591Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qjl: 1-bit quantized jl transform for kv cache quan- tization with zero overhead","venue":null,"work_id":"6572033a-4b90-45db-8b25-15ce274fadee","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:f8bc23449b9dc26ca4548381dff838b14d6f3d93c6165973808d0bc78a323f43","observation_id":"57f43763-10b1-4b62-b726-af0825c80b33","resolution":{"observed_at":"2026-05-20T07:58:07.845275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.17354","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond outliers: A data-free layer-wise mixed- precision quantization approach driven by numerical and structural dual-sensitivity","venue":null,"work_id":"bfd7c10c-8659-4f64-8dc4-b2b78bc3ab23","year":2026},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:c31e157a9745979a0a43dfd898019ef6241fac56f6a56df0422e0a3ead8c29b9","observation_id":"b43ac74d-020a-4f09-9408-5d9282b6ecbb","resolution":{"observed_at":"2026-05-20T07:58:07.593304Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-08-11T17:12:54.016914Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"cited_work":{"arxiv_id":"2601.14004","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.14004","snapshot_observed_at":"2026-07-03T05:27:39.623381Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","venue":"cs.CL","work_id":"4dc137c8-5a45-4f05-af90-21a590fb3d7b","year":2026},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2601.14004","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:05032d07712f4c9b9625821cdac769f1800fa05d6927d77a049420b3357ab76f","observation_id":"7d4959ab-dc1e-4bff-b233-1d56600a080d","resolution":{"observed_at":"2026-05-20T07:58:07.575931Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.11539","last_updated":"2026-03-31T10:04:45Z","snapshot_observed_at":"2026-08-13T06:20:07.628557Z","submitted_at":"2025-07-15T17:59:57Z","title":"Streaming 4D Visual Geometry Transformer","version":2},"cited_work":{"arxiv_id":"2507.11539","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.11539","snapshot_observed_at":"2026-07-08T23:55:43.019798Z","title":"Streaming 4D Visual Geometry Transformer","venue":"cs.CV","work_id":"76f59477-f3aa-4b45-98cb-ef9f45fab0c5","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2507.11539","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:e2e48ba4182fbef4dfea225b13312d5e9e693c0fb35177b4c8baf996c78e9360","observation_id":"8a1e7efe-6c2c-4ea8-a541-4d9f132d3480","resolution":{"observed_at":"2026-05-20T07:58:07.599763Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20966","last_updated":"2026-04-17T09:56:07Z","snapshot_observed_at":"2026-07-06T21:16:36.894196Z","submitted_at":"2025-04-29T17:36:18Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax","version":4},"cited_work":{"arxiv_id":"2504.20966","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.20966","snapshot_observed_at":"2026-06-29T08:23:15.622080Z","title":"Softpick: No Attention Sink, No Massive Activations with Rectified Softmax","venue":"cs.LG","work_id":"94b1ae96-600a-44e3-9fb8-c3ac26d1ca0e","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2504.20966","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:e344c7252219ae2918bd4afd924e8d1124f303333017c39726033aae40f1690e","observation_id":"6cb40198-ed7b-470f-adce-4f181def8767","resolution":{"observed_at":"2026-05-20T07:58:07.603107Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e3716ba0-1a91-4916-a453-cf805a5b9104","year":null},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:697077a12f4ce71257b051bc6e8c60992aa0af6336f4d58e1b492ecff367a1fc","observation_id":"de7fd090-7471-49a4-b117-d6aa9124400a","resolution":{"observed_at":"2026-05-20T07:58:07.911799Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8d7b710d-60a5-4f88-b22a-1628b93dc586","year":null},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:83fcaf9075d0f65da3a5ff09deb56828973319a76b9de8de06edc3ac819241be","observation_id":"74a1fb18-76d9-4dfb-88a5-fa41b456d603","resolution":{"observed_at":"2026-05-20T07:58:07.899153Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"478d5cd8-e12c-4210-9f46-fccd0fa8fd32","year":null},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:4d5c166334def8a42c3c59b3f2ca9b820ec39f671639e62ff408298d2d565807","observation_id":"5e618dff-44b0-4622-888b-b8051cc05af4","resolution":{"observed_at":"2026-05-20T07:58:07.893374Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0902c315-dac7-4f55-b1a6-b9876b05f818","year":null},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:6b34e53f615f46c13824915f609eae23394134800d4658693d7bc3bc98b84dc6","observation_id":"0136603d-faf1-4b64-91f2-f0f40dccad9f","resolution":{"observed_at":"2026-05-20T07:58:07.916455Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"from the wild","venue":null,"work_id":"6081f09a-39fc-49b0-9698-36983f861451","year":null},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:1711c15267ece7614299c1d47807e51cd707a188c3852fd6011da62837cb859d","observation_id":"ae80a254-32b3-4b48-bd17-8d3e5e7698c8","resolution":{"observed_at":"2026-05-20T07:58:07.895396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T19:33:45.599129Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond"},"reference_resolution":{"displayed":84,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":46,"verified_fuzzy":29},"total_outbound_references":84},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 2 inbound Pith citation observations for arXiv:2605.19660."}