{"as_of":"2026-08-12T17:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8fc41b616f93d8b54af338ea02849011d9859fcf3903f81e1dd4816989f553f4","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:34:27.538376Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:51:05.406333Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-05T05:50:43.580203Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18610","snapshot_observed_at":"2026-08-06T23:51:05.406333Z","title":"Pm-kvq: Progressive mixed-precision kv cache quantization for long-cot llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16054","last_updated":"2025-06-19T06:25:02Z","snapshot_observed_at":"2026-08-07T13:41:59.610268Z","submitted_at":"2025-06-19T06:25:02Z","title":"PAROAttention: Pattern-Aware ReOrdering for Efficient Sparse and Quantized Attention in Visual Generation Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:51:05.406333Z"},"links":{"cited_paper":"/paper/2505.18610","citing_paper":"/paper/2506.16054"},"observation_digest":"sha256:46db0c4893bede1dfdce2b0f2737ef399005b7d88390072c6e97cc404c8a0d2a","observation_id":"df4693bc-bdfd-4a6e-9a8a-910229384ab7","resolution":{"observed_at":"2026-08-06T23:51:05.406333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"cited_work":{"arxiv_id":"2505.18610","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18610","snapshot_observed_at":"2026-07-14T01:19:53.637977Z","title":"PM-KVQ: Progressive mixed-precision KV cache quantization for long-CoT LLMs","venue":null,"work_id":"4a734fa1-3c92-409a-97be-9fd00f8048cb","year":2025},"citing_paper":{"arxiv_id":"2605.06675","last_updated":"2026-06-26T01:41:50Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T02:31:58Z","title":"RateQuant: Optimal Mixed-Precision KV Cache Quantization via Rate-Distortion Theory","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-11T01:09:21.811344Z"},"links":{"cited_paper":"/paper/2505.18610","citing_paper":"/paper/2605.06675"},"observation_digest":"sha256:3e23e873e9113745937df29da585ceb6173bf2b947b7a96191638b547e3cfc34","observation_id":"ddf4ad6e-87ee-4209-91f6-3b3c441c7aa6","resolution":{"observed_at":"2026-07-14T01:19:53.637977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"cited_work":{"arxiv_id":"2505.18610","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18610","snapshot_observed_at":"2026-07-14T01:19:53.637977Z","title":"PM-KVQ: Progressive mixed-precision KV cache quantization for long-CoT LLMs","venue":null,"work_id":"4a734fa1-3c92-409a-97be-9fd00f8048cb","year":2025},"citing_paper":{"arxiv_id":"2605.06675","last_updated":"2026-06-26T01:41:50Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T02:31:58Z","title":"RateQuant: Optimal Mixed-Precision KV Cache Quantization via Rate-Distortion Theory","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-05T05:41:13.869451Z"},"links":{"cited_paper":"/paper/2505.18610","citing_paper":"/paper/2605.06675"},"observation_digest":"sha256:b2ea8e691375329affec24788c1d248645c2e51fa2fddddfa536f8f591d47be2","observation_id":"194f9ca4-905b-4a57-a95f-2123d5b4d514","resolution":{"observed_at":"2026-07-14T01:19:53.637977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"cited_work":{"arxiv_id":"2505.18610","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18610","snapshot_observed_at":"2026-07-14T01:19:53.637977Z","title":"PM-KVQ: Progressive mixed-precision KV cache quantization for long-CoT LLMs","venue":null,"work_id":"4a734fa1-3c92-409a-97be-9fd00f8048cb","year":2025},"citing_paper":{"arxiv_id":"2605.13734","last_updated":"2026-05-13T16:12:33Z","snapshot_observed_at":"2026-08-09T15:04:19.889122Z","submitted_at":"2026-05-13T16:12:33Z","title":"KVServe: Service-Aware KV Cache Compression for Communication-Efficient Disaggregated LLM Serving","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-14T17:42:06.870534Z"},"links":{"cited_paper":"/paper/2505.18610","citing_paper":"/paper/2605.13734"},"observation_digest":"sha256:8814a02e16a75c3660289e7eb73cc59e375b7467604e4f49bc77c5d60a0c85d6","observation_id":"2c0a9ec0-70f8-4829-95a0-c4ed6d93817e","resolution":{"observed_at":"2026-07-14T01:19:53.637977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"cited_work":{"arxiv_id":"2505.18610","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18610","snapshot_observed_at":"2026-07-14T01:19:53.637977Z","title":"PM-KVQ: Progressive mixed-precision KV cache quantization for long-CoT LLMs","venue":null,"work_id":"4a734fa1-3c92-409a-97be-9fd00f8048cb","year":2025},"citing_paper":{"arxiv_id":"2605.17757","last_updated":"2026-05-18T02:24:29Z","snapshot_observed_at":"2026-07-06T23:28:45.646975Z","submitted_at":"2026-05-18T02:24:29Z","title":"OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T12:16:07.797702Z"},"links":{"cited_paper":"/paper/2505.18610","citing_paper":"/paper/2605.17757"},"observation_digest":"sha256:dcdd0be7a687420ac41ca5e579766002049dd16686861144aef0126dadcb7f80","observation_id":"201f393f-7216-4db9-8702-940eaa3cca96","resolution":{"observed_at":"2026-07-14T01:19:53.637977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"cited_work":{"arxiv_id":"2505.18610","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18610","snapshot_observed_at":"2026-07-14T01:19:53.637977Z","title":"PM-KVQ: Progressive mixed-precision KV cache quantization for long-CoT LLMs","venue":null,"work_id":"4a734fa1-3c92-409a-97be-9fd00f8048cb","year":2025},"citing_paper":{"arxiv_id":"2606.24033","last_updated":"2026-06-23T00:17:48Z","snapshot_observed_at":"2026-08-05T22:30:32.069600Z","submitted_at":"2026-06-23T00:17:48Z","title":"RoPE-Aware Bit Allocation for KV-Cache Quantization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T01:05:13.790381Z"},"links":{"cited_paper":"/paper/2505.18610","citing_paper":"/paper/2606.24033"},"observation_digest":"sha256:cfbf9b7669fe3fc7d4bf17fc0678310888639c8c490b1ea756054d0aa41aa9e7","observation_id":"a57804d3-3d5f-4d26-9817-433780185387","resolution":{"observed_at":"2026-07-14T01:19:53.637977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18610","snapshot_observed_at":"2026-08-02T09:50:32.732340Z","title":"arXiv:2505.18610","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16248","last_updated":"2026-06-27T01:22:47Z","snapshot_observed_at":"2026-08-05T04:21:35.447834Z","submitted_at":"2026-06-27T01:22:47Z","title":"High-accuracy Low-Bit KV-Cache Quantization via Local Distribution Restoration","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T09:50:32.732340Z"},"links":{"cited_paper":"/paper/2505.18610","citing_paper":"/paper/2607.16248"},"observation_digest":"sha256:7a1097ad0588793b05660875014fa1345c8277b97a7a5663de809d03375c846c","observation_id":"2f48ec61-67e9-4b2a-8aa7-4acaa3ffe79d","resolution":{"observed_at":"2026-08-02T09:50:32.732340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18610/citation-record","integrity":"/paper/2505.18610/integrity","json":"/paper/2505.18610/citation-record.json","paper":"/paper/2505.18610"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:28.806633Z","title":"American invitational mathematics examination, 2025","venue":null,"work_id":"55e819b1-a568-44b7-bf7b-d062432606cf","year":2025},"citing_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:25.149159Z"},"links":{"citing_paper":"/paper/2505.18610"},"observation_digest":"sha256:afbaf713dee9c63d86b373c04a117567b407a75f5acde342fee443db1a061877","observation_id":"2b20b506-b216-4e0d-b3f6-033e12c8755b","resolution":{"observed_at":"2026-08-07T14:34:28.842501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-07T14:34:25.275482Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints.arXiv preprint arXiv:2305.13245, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:25.275482Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2505.18610"},"observation_digest":"sha256:21b2b90afb664c6574a7224b153d8572fb1a40882d706867bfe0325663a56a30","observation_id":"7675a78b-e5df-4b7b-9435-23cd6dc9daf0","resolution":{"observed_at":"2026-08-07T14:34:25.275482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15595","last_updated":"2023-06-28T04:26:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-27T16:26:26Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15595","snapshot_observed_at":"2026-08-07T14:34:25.333985Z","title":"Extending context window of large language models via positional interpolation.arXiv preprint arXiv:2306.15595, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:25.333985Z"},"links":{"cited_paper":"/paper/2306.15595","citing_paper":"/paper/2505.18610"},"observation_digest":"sha256:b582cca1f52ad88fad1558b6252580f1dae6762b35a1318f81b4cabec792486c","observation_id":"4984c2db-1f4b-4200-ab32-71651135d69a","resolution":{"observed_at":"2026-08-07T14:34:25.333985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:28.666799Z","title":"Carnegie mellon informatics and mathematics competition, 2025","venue":null,"work_id":"ca8ebb84-3e34-46bb-8dcd-a0558a09b61e","year":2025},"citing_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:25.377424Z"},"links":{"citing_paper":"/paper/2505.18610"},"observation_digest":"sha256:c0834e4d4abca0aea65e38ca9da64ece2f3a2bece35ebb19a58dd05a5f999563","observation_id":"8a6a85a1-b026-4b4d-8961-f89d3ad5f6f7","resolution":{"observed_at":"2026-08-07T14:34:28.723653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:25.407380Z","title":"CVXPY: A Python-embedded modeling language for convex optimization.Journal of Machine Learning Research, 17(83):1–5, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:25.407380Z"},"links":{"citing_paper":"/paper/2505.18610"},"observation_digest":"sha256:0fd043a7174169b3ad07fe4e99d30fff335ba130604ce58b4e3594ff08d9e9ba","observation_id":"d4cf4010-ac3c-41ca-b7c0-385bba73c91c","resolution":{"observed_at":"2026-08-07T14:34:25.407380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06219","last_updated":"2024-11-12T08:18:45Z","snapshot_observed_at":"2026-08-10T23:43:21.502060Z","submitted_at":"2024-05-10T03:06:24Z","title":"SKVQ: Sliding-window Key and Value Cache Quantization for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06219","snapshot_observed_at":"2026-08-07T14:34:25.438387Z","title":"Skvq: Sliding-window key and value cache quantization for large language models.arXiv preprint arXiv:2405.06219, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:25.438387Z"},"links":{"cited_paper":"/paper/2405.06219","citing_paper":"/paper/2505.18610"},"observation_digest":"sha256:f73665b945fef5c502d4671122f3c1c737a538337e0dbe64a7b5b59d3fa52b0e","observation_id":"0bb28117-42f1-45b9-97d9-8d2d9dc4e9b6","resolution":{"observed_at":"2026-08-07T14:34:25.438387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:25.524088Z","title":"Moa: Mixture of sparse attention for automatic large language model compression.arXiv preprint arXiv:2406.14909, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:25.524088Z"},"links":{"citing_paper":"/paper/2505.18610"},"observation_digest":"sha256:4e0b842395f18900cbc0f714b1681f4815a76b221655187e57f7a8a1d8d460e3","observation_id":"b3f6d26e-29d0-45cf-959b-9bb1f42cc5f3","resolution":{"observed_at":"2026-08-07T14:34:25.524088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:34:25.573877Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:25.573877Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.18610"},"observation_digest":"sha256:3a12246fecdf09daad8359212e427d380ebefe9ff6f419caabee9b71b91825b5","observation_id":"9e8454ea-7e57-4706-a720-2c881b122819","resolution":{"observed_at":"2026-08-07T14:34:25.573877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15075","last_updated":"2025-10-15T16:03:13Z","snapshot_observed_at":"2026-07-06T20:40:10.731339Z","submitted_at":"2025-02-20T22:24:27Z","title":"Quantize What Counts: More for Keys, Less for Values","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15075","snapshot_observed_at":"2026-08-07T14:34:25.594534Z","title":"More for keys, less for values: Adaptive kv cache quantization.arXiv preprint arXiv:2502.15075, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:25.594534Z"},"links":{"cited_paper":"/paper/2502.15075","citing_paper":"/paper/2505.18610"},"observation_digest":"sha256:781a20b387a50c112e31cbeebbf849abfd990b60cfc996ec854ee1bc9f99876f","observation_id":"6bfc87e1-e9ec-4e0e-a3d0-15c80281a929","resolution":{"observed_at":"2026-08-07T14:34:25.594534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-10T03:07:35.408836Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-07T14:34:25.647588Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code.arXiv preprint arXiv:2403.07974, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:25.647588Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2505.18610"},"observation_digest":"sha256:a988a0c57faa5e1ad6eb99c0d77ee600f538e45b143563bf83962d080f1a90e2","observation_id":"9240860a-f53e-4064-ac51-83e9689daa9e","resolution":{"observed_at":"2026-08-07T14:34:25.647588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:28.502801Z","title":"Llm-mq: Mixed-precision quantization for efficient llm deployment","venue":null,"work_id":"212d490c-1107-462b-a1af-0aeb70ce2537","year":2023},"citing_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:25.718605Z"},"links":{"citing_paper":"/paper/2505.18610"},"observation_digest":"sha256:b33d526ebfc301481352e61a10bc9fb4f78ed2e94a32f11e7378092bdae4b21b","observation_id":"db4b4924-5a15-422f-b1e1-81dadb0a2338","resolution":{"observed_at":"2026-08-07T14:34:28.607938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:25.833313Z","title":"Awq: Activation-aware weight quantization for on-device llm compression and acceleration.Proceedings of Machine Learning and Systems, 6:87–100, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:25.833313Z"},"links":{"citing_paper":"/paper/2505.18610"},"observation_digest":"sha256:78da391e4ad22b8148fbe5dba5799bd95c048e2418c24927094304dd4700bed6","observation_id":"d2857518-6375-4364-a8f9-6808db1e86c6","resolution":{"observed_at":"2026-08-07T14:34:25.833313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04532","last_updated":"2025-05-01T02:14:05Z","snapshot_observed_at":"2026-08-11T03:12:32.404394Z","submitted_at":"2024-05-07T17:59:30Z","title":"QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04532","snapshot_observed_at":"2026-08-07T14:34:25.898209Z","title":"Qserve: W4a8kv4 quantization and system co-design for efficient llm serving.arXiv preprint arXiv:2405.04532, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:25.898209Z"},"links":{"cited_paper":"/paper/2405.04532","citing_paper":"/paper/2505.18610"},"observation_digest":"sha256:5d8fe4b368b440d0d2b54fa92ca8d5b30577f7f85cab089d902fa3cfe8753856","observation_id":"2c239ce3-f9a5-45f6-832d-c4cbfe5c4158","resolution":{"observed_at":"2026-08-07T14:34:25.898209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-07T14:34:25.951695Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model.arXiv preprint arXiv:2405.04434, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:25.951695Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2505.18610"},"observation_digest":"sha256:3a2e37a66682e856ffa759d32ae6daf7a0483199b247a4e187fe6882e5a146a2","observation_id":"3701df9d-5b34-4c88-bae0-f5f8e4659a31","resolution":{"observed_at":"2026-08-07T14:34:25.951695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:28.252894Z","title":"Intactkv: Improving large language model quantization by keeping pivot tokens intact","venue":null,"work_id":"423c090c-8e17-43b6-86d5-58fd6a2346c9","year":2024},"citing_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:26.021077Z"},"links":{"citing_paper":"/paper/2505.18610"},"observation_digest":"sha256:87a8befb7b8882f2a4aba78dd312d2de331d26c8b1d3702705562c22ec763a94","observation_id":"05a9d736-233f-40be-a294-c05402c37922","resolution":{"observed_at":"2026-08-07T14:34:28.356439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-08-12T17:03:50.984887Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-07T14:34:26.080933Z","title":"Kivi: A tuning-free asymmetric 2bit quantization for kv cache.arXiv preprint arXiv:2402.02750, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:26.080933Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2505.18610"},"observation_digest":"sha256:1542484be4d781961bb56beba7dfae2c1d5ce9bac76d8fb8a7bb0e62a4a964a4","observation_id":"621798a3-de2e-4b6f-a659-4116715d871a","resolution":{"observed_at":"2026-08-07T14:34:26.080933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:28.088084Z","title":"Introducing openai o1, September 2024","venue":null,"work_id":"555b4993-6cf5-40fd-ba40-e599b34f3879","year":2024},"citing_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:26.156677Z"},"links":{"citing_paper":"/paper/2505.18610"},"observation_digest":"sha256:0a9df5c857361bc8d885527c517c0bf5fc8ef232f4ff46d33c4795d6abf670bd","observation_id":"a24314fe-0752-48a6-84ec-aac281827bef","resolution":{"observed_at":"2026-08-07T14:34:28.139404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-07T14:34:26.276661Z","title":"Fast transformer decoding: One write-head is all you need.arXiv preprint arXiv:1911.02150, 2019","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:26.276661Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2505.18610"},"observation_digest":"sha256:9754e18459782b93c4a58405ae8e669752a1953c5b1749a4533c36bfb9504d45","observation_id":"1cdbaf85-b8b8-4cf4-a88c-d75c9c3d53f0","resolution":{"observed_at":"2026-08-07T14:34:26.276661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:26.328850Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:26.328850Z"},"links":{"citing_paper":"/paper/2505.18610"},"observation_digest":"sha256:85db39399fb4829f71b6d3e03ddb20bfd4196f1a26fa6a792984b70b484ae105","observation_id":"a617a6db-d533-463d-ab27-f19a9c9e765f","resolution":{"observed_at":"2026-08-07T14:34:26.328850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16383","last_updated":"2025-02-02T03:04:54Z","snapshot_observed_at":"2026-08-12T06:09:48.327480Z","submitted_at":"2025-01-25T01:45:29Z","title":"RotateKV: Accurate and Robust 2-Bit KV Cache Quantization for LLMs via Outlier-Aware Adaptive Rotations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16383","snapshot_observed_at":"2026-08-07T14:34:26.485614Z","title":"Rotatekv: Accurate and robust 2-bit kv cache quantization for llms via outlier-aware adaptive rotations.arXiv preprint arXiv:2501.16383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:26.485614Z"},"links":{"cited_paper":"/paper/2501.16383","citing_paper":"/paper/2505.18610"},"observation_digest":"sha256:6a0f996472322d870fa196b96d74ca75d58977a570e17d695f3c1fcd8b0037ae","observation_id":"c805816e-3b54-44e3-9dca-12eead72654f","resolution":{"observed_at":"2026-08-07T14:34:26.485614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:26.603479Z","title":"Qwq-32b: Embracing the power of reinforcement learning, March 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:26.603479Z"},"links":{"citing_paper":"/paper/2505.18610"},"observation_digest":"sha256:808522ecdeb83634539df501d90529e9247aacd4838e43991b5af98831229136","observation_id":"3bb5bc09-014c-4013-9ef9-91deb9bddd52","resolution":{"observed_at":"2026-08-07T14:34:26.603479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:26.757650Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:26.757650Z"},"links":{"citing_paper":"/paper/2505.18610"},"observation_digest":"sha256:19b48554b4b0a8d859907779819d6495a01f9ca9caaa7ac9a38082f79150e427","observation_id":"4f59fc53-bcd7-4d96-9798-ce6da8931fcc","resolution":{"observed_at":"2026-08-07T14:34:26.757650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-07T14:34:26.912924Z","title":"Efficient streaming language models with attention sinks.arXiv preprint arXiv:2309.17453, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:26.912924Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2505.18610"},"observation_digest":"sha256:8cf8e768047ea9656d4ff105e88122c1dbc792aa2f7cfa6c6250d544ae7b8b4a","observation_id":"3d5a41f4-3681-400c-9ac5-2705c36c194d","resolution":{"observed_at":"2026-08-07T14:34:26.912924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18096","last_updated":"2024-02-28T06:34:54Z","snapshot_observed_at":"2026-08-10T23:43:32.310282Z","submitted_at":"2024-02-28T06:34:54Z","title":"No Token Left Behind: Reliable KV Cache Compression via Importance-Aware Mixed Precision Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18096","snapshot_observed_at":"2026-08-07T14:34:27.041485Z","title":"No token left behind: Reliable kv cache compression via importance-aware mixed precision quantization.arXiv preprint arXiv:2402.18096, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:27.041485Z"},"links":{"cited_paper":"/paper/2402.18096","citing_paper":"/paper/2505.18610"},"observation_digest":"sha256:7f15538ffb12a140392e6cfb99178d713cdbe3b084f1b21dab0261f285fb9804","observation_id":"9f56688f-352e-42ab-9a88-3b54731b5200","resolution":{"observed_at":"2026-08-07T14:34:27.041485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12065","last_updated":"2024-02-20T08:48:24Z","snapshot_observed_at":"2026-08-10T18:28:48.948771Z","submitted_at":"2024-02-19T11:33:21Z","title":"WKVQuant: Quantizing Weight and Key/Value Cache for Large Language Models Gains More","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12065","snapshot_observed_at":"2026-08-07T14:34:27.199163Z","title":"Wkvquant: Quantizing weight and key/value cache for large language models gains more.arXiv preprint arXiv:2402.12065, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:27.199163Z"},"links":{"cited_paper":"/paper/2402.12065","citing_paper":"/paper/2505.18610"},"observation_digest":"sha256:a9911cf5337f6afd13c21721140ee12281ff4a4529fa9907e096407ba43ae12c","observation_id":"c81bd392-b7a7-49c4-974a-27b5949d74d5","resolution":{"observed_at":"2026-08-07T14:34:27.199163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:27.373613Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models.Advances in Neural Information Processing Systems, 36:34661–34710, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:27.373613Z"},"links":{"citing_paper":"/paper/2505.18610"},"observation_digest":"sha256:1765b946454ecde8857e0bf2505de3eaef14bc1cb1c768f495961cedcc9471f9","observation_id":"fc0885bd-c87e-4f3f-a23e-4ebf8585fb8b","resolution":{"observed_at":"2026-08-07T14:34:27.373613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:34:27.898902Z","title":"Mixdq: Memory-efficient few-step text-to-image diffusion models with metric-decoupled mixed precision quantization","venue":null,"work_id":"fb6386b6-056d-4cf9-9a99-e0eda3f4812d","year":2024},"citing_paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:27.538376Z"},"links":{"citing_paper":"/paper/2505.18610"},"observation_digest":"sha256:8734b70082ab6fa0e397ceb81e33dd387bf03c1efc017d07a8d441fb1fdc8339","observation_id":"8f54927b-1e40-4966-847c-e6c7f192e5b0","resolution":{"observed_at":"2026-08-07T14:34:27.967366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18610","last_updated":"2026-07-11T08:07:07Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T05:25:08.061289Z","submitted_at":"2025-05-24T09:18:11Z","title":"PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 7 inbound Pith citation observations for arXiv:2505.18610."}