{"as_of":"2026-08-03T05:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c0bb565beb82d6b70caa199188a430022348a8643e54bf9f2c423d9f064163d5","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-09T16:06:26.450483Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-02T06:30:47.504484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T02:23:36.996872Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.02262","snapshot_observed_at":"2026-08-01T02:23:36.996872Z","title":"arXiv preprint arXiv:2605.02262 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25467","last_updated":"2026-07-28T08:59:57Z","snapshot_observed_at":"2026-08-01T02:23:34.364343Z","submitted_at":"2026-07-28T08:59:57Z","title":"Seen, Said, or Forgotten? A Causal Audit of Visual KV Memory Across Dialog Turns","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T02:23:36.996872Z"},"links":{"cited_paper":"/paper/2605.02262","citing_paper":"/paper/2607.25467"},"observation_digest":"sha256:8d8ec7017dde648c108a11a59ff66f20070ff2f0e034e1ce78c4b64035372513","observation_id":"3fc3fefc-78ac-46d8-9d2e-299633755a4d","resolution":{"observed_at":"2026-08-01T02:23:36.996872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.02262/citation-record","integrity":"/paper/2605.02262/integrity","json":"/paper/2605.02262/citation-record.json","paper":"/paper/2605.02262"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":"2305.13245","doi":"10.48550/arxiv.2305.13245","metadata_source":"pith","pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","venue":"cs.CL","work_id":"b73ad5b2-e553-4c71-b0c9-67e67ba7b158","year":2023},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:90d2edde99f89251229998632bb9c0275fca2ee0dbe6cee8db2ff14fb8ffa8fa","observation_id":"3cc82a3f-a3c7-4333-9d93-0fbbc2db7041","resolution":{"observed_at":"2026-05-11T16:36:08.068151Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17430","last_updated":"2024-07-29T17:59:28Z","snapshot_observed_at":"2026-07-06T18:20:44.070255Z","submitted_at":"2024-05-27T17:59:56Z","title":"Matryoshka Multimodal Models","version":2},"cited_work":{"arxiv_id":"2405.17430","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.17430","snapshot_observed_at":"2026-07-03T11:28:04.133973Z","title":"arXiv preprint arXiv:2405.17430 , year =","venue":null,"work_id":"2e0214e8-4ae5-4a7f-a1ea-6f42bb9e4a32","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2405.17430","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:4d6d5090b15e0efc920019b69ed3f2f7a84d3291c6615478bb8cf52f166324ca","observation_id":"37e8af78-8e33-4093-8fc4-bf7954f83427","resolution":{"observed_at":"2026-05-11T16:36:08.098510Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":"2401.10774","doi":"10.48550/arxiv.2401.10774","metadata_source":"pith","pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-07-10T21:57:38.315668Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","venue":"cs.LG","work_id":"f6202cd1-1a78-4c19-8242-688acf4952b6","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:fabefc08657bcf5d10839e01d852ce752834c33904ecd275c457b62897b11ac1","observation_id":"2801f0d3-c11c-4d8f-a085-9b0edaafa0f5","resolution":{"observed_at":"2026-05-13T10:36:18.892007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"62c1c08d-1f62-41cd-80fb-31bd72324677","year":null},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:7f2fc9467790ffaa9026ff2f1538cbce8b403af1942b5268bd09077f415c8613","observation_id":"bf729992-932b-477a-8aa5-4dd3338c15b9","resolution":{"observed_at":"2026-05-26T00:56:26.096289Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In13th USENIX symposium on operating systems design and implementation (OSDI 18)","venue":null,"work_id":"90511820-db1a-44c3-92fd-d94fec6cab76","year":null},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:95986cc2732a94aae3ef611598cf20aba54e3e699b2f71717644d8ad72ea9350","observation_id":"9469f6a4-1c2f-4707-b12c-1283696cb9e4","resolution":{"observed_at":"2026-05-26T00:56:26.147564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"56861bc4-300a-4efa-97bf-0cbd4995a804","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:58b63d17f68fee76683f245f4f99374972ccd8889d970cf16f7445f394194f0c","observation_id":"79873381-857b-461f-b6fb-ce368b428d54","resolution":{"observed_at":"2026-05-26T00:56:26.138422Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":"2406.07476","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-07-04T16:49:57.279303Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","venue":"cs.CV","work_id":"ccfc3f89-c510-45f1-8a35-ed1a56c0ae5c","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:6f1bd1d92bdffd4ed084add452a5f9c3dc20121b21a6546573c5ae7e7b35e939","observation_id":"c7d240ed-94b7-4519-8a6b-4982a3372d46","resolution":{"observed_at":"2026-05-11T16:36:08.060568Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":"2307.08691","doi":"10.48550/arxiv.2307.08691","metadata_source":"pith","pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-07-10T20:07:33.508131Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","venue":"cs.LG","work_id":"fff3953b-5efb-4753-bee4-002f59995810","year":2023},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:633dbd0b1a2991e95c75b2273c554afd037441820001b843762b4ea3bbccb8b6","observation_id":"246cf9c0-71fb-481a-92aa-aa04dfc68079","resolution":{"observed_at":"2026-05-11T16:36:08.013589Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:18.243793+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:18.243793+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a4e7d00b-b242-4635-8ea1-5db8c40f20e2","year":2022},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:944fc910b771ed58f9440343e70fec16dba4313c7928238bce51b63a5c67bc4e","observation_id":"6c7117ef-d262-4868-a47d-549f34a798ce","resolution":{"observed_at":"2026-05-26T00:56:26.091991Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"986c6034-6afb-43ae-afd7-d08b4b55935e","year":2022},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:b8f44d6606db6d5b54fbb1bca86888181f06ebc87a6eee1c5f46a25cde4486e1","observation_id":"b8c02504-2085-4f61-9442-fac2ff25199f","resolution":{"observed_at":"2026-05-26T00:56:26.179452Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-07-06T15:38:46.970127Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":"2306.03078","doi":"10.48550/arxiv.2306.03078","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078","venue":null,"work_id":"9f122cd0-f5dd-4105-8cf5-cc97759850e8","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:3b2ab5b43a1d8f15aa8d1154a5445667a658b1ec14e3da5822dd2a48f9f93016","observation_id":"a31d2bd8-75ae-4446-84fa-f321c3bdd100","resolution":{"observed_at":"2026-05-11T16:36:08.092490Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04643","last_updated":"2024-04-12T13:00:25Z","snapshot_observed_at":"2026-07-06T17:41:06.530605Z","submitted_at":"2024-03-07T16:42:37Z","title":"QAQ: Quality Adaptive Quantization for LLM KV Cache","version":2},"cited_work":{"arxiv_id":"2403.04643","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.04643","snapshot_observed_at":"2026-07-10T00:56:40.966385Z","title":"Shichen Dong, Wen Cheng, Jiayu Qin, and Wei Wang","venue":"cs.CL","work_id":"d70bef43-c14b-4123-9165-73982b68b6e2","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2403.04643","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:c9e4b94bde06cadbdf031d2cd221053a23ddd66457290a1b2455730caee5c475","observation_id":"0ced4198-9eb5-40f7-b567-d41f36521502","resolution":{"observed_at":"2026-05-11T16:36:07.921645Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06219","last_updated":"2024-11-12T08:18:45Z","snapshot_observed_at":"2026-07-06T18:12:26.233112Z","submitted_at":"2024-05-10T03:06:24Z","title":"SKVQ: Sliding-window Key and Value Cache Quantization for Large Language Models","version":3},"cited_work":{"arxiv_id":"2405.06219","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.06219","snapshot_observed_at":"2026-07-04T00:19:13.103948Z","title":"Skvq: Sliding-window key and value cache quantization for large language models","venue":null,"work_id":"a4d09c5c-8903-469c-af40-dfc935e82725","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2405.06219","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:c42f0dd06783dbf8b57e9b8c2c8b3703b35cf825c8a2fd499cef9c56a2568d16","observation_id":"f0a8787f-f301-4d6d-ad0b-aba83ec3c8d5","resolution":{"observed_at":"2026-05-11T16:36:07.942065Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-07-31T03:44:36.976336Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":"2210.17323","doi":"10.48550/arxiv.2210.17323","metadata_source":"pith","pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-07-10T14:47:14.534663Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","venue":"cs.LG","work_id":"19ed8c44-202a-48f6-8169-637d5a5f2408","year":2022},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:a35b8911c9cbf2c30707759c8b20798d7b430ff7de268859ed35454e545e1681","observation_id":"e468c763-14bb-44d2-81c5-a68e541c5363","resolution":{"observed_at":"2026-05-11T16:36:07.981486Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-17T20:22:03.028003+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-17T20:22:03.028003+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"cited_work":{"arxiv_id":"2310.01801","doi":"10.48550/arxiv.2310.01801","metadata_source":"pith","pith_arxiv_id":"2310.01801","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","venue":"cs.CL","work_id":"91379982-466d-4895-96f5-079b66259a73","year":2023},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2310.01801","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:97bda5fc81d42ab1a0df7d1dea07ece02bee8907f3d48267cace5d223cc6f33f","observation_id":"877ab0cb-2e9c-4fd1-b649-cb6c0967a29c","resolution":{"observed_at":"2026-05-17T11:11:21.895994Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16137","last_updated":"2024-06-24T21:22:00Z","snapshot_observed_at":"2026-07-31T23:13:29.378237Z","submitted_at":"2023-08-30T16:47:51Z","title":"LM-Infinite: Zero-Shot Extreme Length Generalization for Large Language Models","version":7},"cited_work":{"arxiv_id":"2308.16137","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.16137","snapshot_observed_at":"2026-07-04T16:59:58.965650Z","title":"Lm- infinite: Simple on-the-fly length generalization for large language models","venue":null,"work_id":"62f73354-8046-4134-b4e3-1bfab8df2d99","year":2023},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2308.16137","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:2aead640e5f91ef4308aa83a34dbc090ae9870e13649937c9ec83b920430f0d9","observation_id":"8d3568d7-5429-4c68-8b5c-e778931cea00","resolution":{"observed_at":"2026-05-11T16:36:08.008421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-02T19:22:14.932134Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":"2401.18079","doi":"10.48550/arxiv.2401.18079","metadata_source":"pith","pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":"cs.LG","work_id":"f8884df2-70de-43af-832d-ca9ba2eab327","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:8aeaf06d16b4653d60509be5980dd6390c07edf32f305bf95acbf52b69286642","observation_id":"c7fc36aa-0ad4-44f9-93ab-ccb34322ac62","resolution":{"observed_at":"2026-05-11T16:36:08.002040Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07629","last_updated":"2024-06-05T03:57:41Z","snapshot_observed_at":"2026-07-06T15:41:54.957543Z","submitted_at":"2023-06-13T08:57:54Z","title":"SqueezeLLM: Dense-and-Sparse Quantization","version":4},"cited_work":{"arxiv_id":"2306.07629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07629","snapshot_observed_at":"2026-07-03T16:18:37.340082Z","title":"W., and Keutzer, K","venue":null,"work_id":"aebf1644-0d5e-418f-a910-1b207d30e16d","year":2023},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2306.07629","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:074ffe97557f6a8a5dd940b8e608daa8f7e7f391f0f9a25b6124fd32556b5ef3","observation_id":"99e832e7-3ec7-4588-b1ac-415de378cc29","resolution":{"observed_at":"2026-05-11T16:36:08.029916Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"daa6a544-8597-45e0-a803-770809324a68","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:710e068c8d1009d033c6796582ca63079f3af400f36bdf71295f4af9a5c1a827","observation_id":"86068542-c261-46a4-991c-eef1232bbb50","resolution":{"observed_at":"2026-05-26T00:56:26.171537Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d949b5b6-eb64-48d2-a28d-1e058568b3e9","year":2023},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:846cd64d89d7f87abf352e2c42ac649f9c3d3f51b0ab14076a146d54ea20022a","observation_id":"bc9b8e46-5a4b-4734-9921-5862e941df57","resolution":{"observed_at":"2026-05-26T00:56:26.167827Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-07-10T13:27:05.574543Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:625e6641910d7c9e68b0b3d529dc64c29ff884dc4baac1265145ad8aeecc9896","observation_id":"533e1580-9583-4ec7-adbc-a54c3be68e07","resolution":{"observed_at":"2026-05-11T16:36:08.109613Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b452336f-42ea-410c-83e4-985b55977a6c","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:32e4fc41f6c24c3d5cc32ccf103467b4630190a1f3720bbfb849612b480d0946","observation_id":"084dd3fc-267a-4959-be44-6851cc5c383e","resolution":{"observed_at":"2026-05-26T00:56:26.104973Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":"2311.10122","doi":"10.48550/arxiv.2311.10122","metadata_source":"pith","pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","venue":"cs.CV","work_id":"e2121c51-a55e-476a-af81-7ba6970fe6cf","year":2023},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:b68827714494df666e161d5a527a77c3a42f8a651f79c09eba826df6456f0bc0","observation_id":"a4207f54-b322-420e-a23d-f718b8e77c58","resolution":{"observed_at":"2026-05-14T18:08:01.613687Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"100841cc-bb65-4e62-b2a6-ca79ca54e401","year":null},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:08b89113522e16718c78024ba3d50b01b22d3db4ca39e102dcfdd731fc1a1efd","observation_id":"599a310e-c1e9-4c0f-91c8-c3f1491d1c66","resolution":{"observed_at":"2026-05-26T00:56:26.187156Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Manuscript submitted to ACM WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization 25","venue":null,"work_id":"abfaf51f-5af7-46a2-a88b-1c712c23a0c0","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:b4fc9779e122dbe84df23c1946cc989f05d78383287f1c97b43873008e2bf9a3","observation_id":"d5e85bf2-2d21-4c4f-bb89-79d5993cbf97","resolution":{"observed_at":"2026-05-26T00:56:26.109518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04532","last_updated":"2025-05-01T02:14:05Z","snapshot_observed_at":"2026-07-06T18:11:09.767624Z","submitted_at":"2024-05-07T17:59:30Z","title":"QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving","version":3},"cited_work":{"arxiv_id":"2405.04532","doi":"10.48550/arxiv.2405.04532","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04532","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Qserve: W4A8KV4 quantization and system co-design for efficient LLM serving.CoRR, abs/2405.04532","venue":null,"work_id":"c210d46c-8391-4e16-ac58-5568cd278fc1","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2405.04532","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:dbfb0007230755882ce733c2a3a1175629b4a5124adc5b7b801e98a9a824b773","observation_id":"4b62f573-e195-4e30-b612-c1e729d42fee","resolution":{"observed_at":"2026-05-11T16:36:07.899306Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:49:58.779354+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:49:58.779354+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cc4d693f-0c73-4b72-8061-a60ee51e26f1","year":2023},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:2fefce9e444cca7393c8f8b0804e87b1e9a638d8a2e4b1e56749a916540fda4d","observation_id":"acde94bc-2b0a-4488-9bb1-c541197753db","resolution":{"observed_at":"2026-05-26T00:56:26.116348Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f114f3d6-a8ab-4e13-97fd-a468206a7f10","year":2023},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:1142fe5ab4b9c2af9486303714c98d0ff0dd04313c40108cc6813660ae9db62b","observation_id":"d167c778-4b1e-48bd-a622-532b92867be4","resolution":{"observed_at":"2026-05-26T00:56:26.080552Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d654e03a-acf3-4d8c-b1fa-820416526638","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:ccc67f3bb7e956de3d65b2a4de982daff7ceb1fa3ad92133edead9327173e534","observation_id":"bbbf16e3-2b8e-420a-9988-0793452777e2","resolution":{"observed_at":"2026-05-26T00:56:26.159840Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-07-06T17:25:18.238343Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":"2402.02750","doi":"10.48550/arxiv.2402.02750","metadata_source":"pith","pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","venue":"cs.CL","work_id":"735737c3-24e5-41c3-ab4f-04edcb36731c","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:fc95a8396118422ba96f4e06867934dbd6c1b82cfe7fcd39f0c67b994d836c0b","observation_id":"7498c618-cab7-4469-9ea9-993aed986837","resolution":{"observed_at":"2026-05-12T08:53:12.376678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"578dfe15-058c-4558-90de-f799c678521f","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:4f05f4cbba458eb7c71a51463c929cf1faf5659abdd01aa1daa5ec3f25285d28","observation_id":"f5b11e22-c0c1-4e0a-a04b-3ff371b580f7","resolution":{"observed_at":"2026-05-26T00:56:26.076700Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":"2306.05424","doi":"10.48550/arxiv.2306.05424","metadata_source":"pith","pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","venue":"cs.CV","work_id":"51f627f4-8fae-4882-a3e9-abdf932ef27b","year":2023},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:7b6b85ee66fca54284d78051b66d9bad42b07aa37675973f4080fc90d2765efe","observation_id":"cf004705-ee7c-4880-a1fd-06a3ee56daed","resolution":{"observed_at":"2026-05-15T03:36:18.685087Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"eca48b7e-fdb4-4cd6-b4c9-191eb80489c7","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:c01a5832ec31557223d1e0f79f6de585b04f03e324cb3ef197c9d35f57c6d0fe","observation_id":"25f471b0-a9c3-4e60-9159-9bc9c90cebd4","resolution":{"observed_at":"2026-05-26T00:56:26.100009Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dacde601-85a4-4a58-8b2f-a89ad5afb2c5","year":2023},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:fd2196cff845c8355277ae49034da3778c19905cfc5528c3c8f11a97e316091d","observation_id":"7ab13a72-035b-4937-a7a4-e94e0ac48e64","resolution":{"observed_at":"2026-05-26T00:56:26.088052Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11066","last_updated":"2024-11-17T13:08:29Z","snapshot_observed_at":"2026-07-06T19:51:37.262377Z","submitted_at":"2024-11-17T13:08:29Z","title":"TS-LLaVA: Constructing Visual Tokens through Thumbnail-and-Sampling for Training-Free Video Large Language Models","version":1},"cited_work":{"arxiv_id":"2411.11066","doi":"10.4014/jmb.2411.11066","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.11066","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Ts-llava: Constructing vi- sual tokens through thumbnail-and-sampling for training-free video large language models.arXiv preprint arXiv:2411.11066","venue":null,"work_id":"e809db2b-6a64-4cec-9368-b18ecee8008a","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2411.11066","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:5781b22d6a620c8374e1b68e4ebc702583cbd1064fe7e1739233e8f1670d6ec5","observation_id":"bbac7741-6968-45af-9c5e-35fc5092ab46","resolution":{"observed_at":"2026-05-11T16:36:07.914366Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":"1911.02150","doi":"10.48550/arxiv.1911.02150","metadata_source":"pith","pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-07-11T03:27:46.785958Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","venue":"cs.NE","work_id":"160ea164-b1d4-4adb-8ccb-a4655d8a0bb4","year":2019},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:05d2541ce7b2349c38d744c770ec804f2cae1c279ea9a842a089b29bb6ca481c","observation_id":"2e46c165-d1ad-417a-bbfa-54f63fba6662","resolution":{"observed_at":"2026-05-11T16:36:08.114392Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T09:14:47.289411Z","title":null,"venue":null,"work_id":"2aef6992-6ca2-4c7d-8e53-36fe2f05c2bc","year":2023},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:ee64c0d3f5e8387a0e3d40eb302bb64c11d194787ee96fe88787d445b577d886","observation_id":"0942019a-774f-4b29-9e98-9f853ee815a7","resolution":{"observed_at":"2026-05-26T00:56:26.152173Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18532","last_updated":"2024-05-15T05:43:30Z","snapshot_observed_at":"2026-07-06T18:06:58.030720Z","submitted_at":"2024-04-29T09:19:05Z","title":"MileBench: Benchmarking MLLMs in Long Context","version":2},"cited_work":{"arxiv_id":"2404.18532","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18532","snapshot_observed_at":"2026-07-04T13:19:50.957441Z","title":"Milebench: Benchmarking mllms in long context","venue":null,"work_id":"2bf00545-5a48-438f-9805-41788308bea9","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2404.18532","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:78364f6ed32de51eb0eae328ec2b72459303179688db5e2befb2476e13535dd9","observation_id":"3bf906e0-6e71-48f3-98aa-5f0ec809dcd8","resolution":{"observed_at":"2026-05-11T16:36:07.948947Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"19b2c74c-65bc-4a26-9e2f-105506c3e539","year":2025},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:40b38bfb62eadad5145f0267a4e95caeb90da3674bde29be21f9c94b26418fcb","observation_id":"201d4e8a-699f-44c6-9876-8e55a9219ca0","resolution":{"observed_at":"2026-05-26T00:56:26.156078Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15021","last_updated":"2025-01-25T02:01:56Z","snapshot_observed_at":"2026-07-06T20:25:58.814961Z","submitted_at":"2025-01-25T02:01:56Z","title":"AKVQ-VL: Attention-Aware KV Cache Adaptive 2-Bit Quantization for Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2501.15021","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.15021","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Akvq-vl: Attention-aware kv cache adaptive 2-bit quantization for vision-language models","venue":null,"work_id":"88c5cc73-d4c3-44d9-ab0e-365b4d2ac76d","year":2025},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2501.15021","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:cf4cdaecea82aa153189e47a08a5546a676f9a548f0c0b6c7fc5087a0941f886","observation_id":"66c56521-712f-4369-a62d-1b327c02f325","resolution":{"observed_at":"2026-05-11T16:36:08.018815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T09:26:09.599187Z","title":null,"venue":null,"work_id":"cc7706e1-24dd-411e-b9a3-4ca23c1fe501","year":2017},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:e89a634f7cfae9df680a05628d45a596b1db0a10c2317c511ce8a3298a6a1f31","observation_id":"df4a4cbd-303b-41ce-92c1-e4d7b4827f3d","resolution":{"observed_at":"2026-05-26T00:56:26.143184Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-07-11T01:17:42.597062Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:8ff033ae7d55ff0793394e958079115c3883f7f43455fa5a6c5066212f8117bc","observation_id":"12b07bf8-6a60-43c0-8d95-f0aefed8219f","resolution":{"observed_at":"2026-05-11T16:36:07.972702Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04793","last_updated":"2024-10-10T05:11:52Z","snapshot_observed_at":"2026-07-06T17:56:40.208379Z","submitted_at":"2024-04-07T03:08:14Z","title":"SqueezeAttention: 2D Management of KV-Cache in LLM Inference via Layer-wise Optimal Budget","version":2},"cited_work":{"arxiv_id":"2404.04793","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.04793","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"41e93b6e-13de-490e-8b69-903bbe7af86f","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2404.04793","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:408982eb057936a8e4f25ee02d6b5a63921519218d80c9711365a612194f065f","observation_id":"18fd78d6-b215-4251-97e1-d6af1a971905","resolution":{"observed_at":"2026-05-11T16:36:08.082176Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5c9a444b-9e9c-4deb-a4a8-c3c4c3f12a66","year":2023},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:57bfb8448922d4c12a4660432be451085245d8246ee93dcbe8c778fcc6aad915","observation_id":"c50bfd0d-a49f-4899-80ec-f2b49a547df6","resolution":{"observed_at":"2026-05-26T00:56:26.084273Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":"2309.17453","doi":"10.48550/arxiv.2309.17453","metadata_source":"pith","pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Efficient Streaming Language Models with Attention Sinks","venue":"cs.CL","work_id":"a8d25452-c237-48c9-88a4-682717c3979a","year":2023},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:ab4ed0974f2d7b63c28dcebc4a5f7c16cfb234a0cf1a29d40459813ef040139e","observation_id":"ddf73fab-8b44-4c70-a080-0e82e1c731ad","resolution":{"observed_at":"2026-05-11T16:36:08.073518Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":"2404.16994","doi":"10.48550/arxiv.2404.16994","metadata_source":"pith","pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","venue":"cs.CV","work_id":"8949d4db-20f2-47c1-83a6-fcbe041b62ef","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:10c0f5df6233ebc0d529c344a2808825b491a64da5daecf98dc2f6c535ef5871","observation_id":"a37c20aa-2276-4491-ba22-a13e2062233a","resolution":{"observed_at":"2026-05-15T20:21:58.165262Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-07-06T18:50:13.559866Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":"2407.15841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-07-04T03:19:29.898625Z","title":"SlowFast-LLaVA: A Strong Training- Free Baseline for Video Large Language Models","venue":null,"work_id":"c3c95d7a-9001-4490-b2f7-bec17cdcdf83","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:d5dc3e1bfe44bafce9b6c8424b07616c1fb92ca930d30e341ec4b179e48b22d8","observation_id":"8ed0375a-ec45-4b75-ba15-d609e1622694","resolution":{"observed_at":"2026-05-11T16:36:07.887239Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18096","last_updated":"2024-02-28T06:34:54Z","snapshot_observed_at":"2026-07-06T17:36:40.933805Z","submitted_at":"2024-02-28T06:34:54Z","title":"No Token Left Behind: Reliable KV Cache Compression via Importance-Aware Mixed Precision Quantization","version":1},"cited_work":{"arxiv_id":"2402.18096","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.18096","snapshot_observed_at":"2026-07-04T15:59:57.351345Z","title":"No token left be- hind: Reliable kv cache compression via importance- aware mixed precision quantization.arXiv preprint arXiv:2402.18096","venue":null,"work_id":"0764b60f-7e4a-4c61-b4ec-d80189be3637","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2402.18096","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:e3e5f99160234ebe1916ce225f6433e122b28d800fef5c70438ca10d1201de86","observation_id":"eb21f3d7-a08a-4c22-b42f-56b6c23b5bcc","resolution":{"observed_at":"2026-05-11T16:36:07.930541Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":"2306.02858","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-07-04T16:29:57.761121Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","venue":"cs.CL","work_id":"555cf04a-49a7-44b8-9019-a83ce85ace95","year":2023},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:8559c40810a50c40aa5898dfabfc4508c02e9ead858b5c1f2f6f1cbb99e62642","observation_id":"4a33b995-8f1c-4cea-bc60-22d1de9a323d","resolution":{"observed_at":"2026-05-13T15:02:01.218694Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b3dccec3-13b0-486b-87be-06d05b982dc4","year":null},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:0eb8221f367552d05f9f34e1f34ce1629615cab608696320a791cc7bbf205462","observation_id":"266804d5-3649-44ae-90de-c440a4082888","resolution":{"observed_at":"2026-05-26T00:56:26.163569Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"88ef0d4f-b1da-4988-a4bb-3093a183b1a4","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:74f550bcf47f524445a36685263963d97a6d45a022019bd9b5e7185231cebb03","observation_id":"2cd59fa8-809a-4504-bb82-7deb96693212","resolution":{"observed_at":"2026-05-26T00:56:26.175485Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"05c4b42e-5e96-47c9-9552-c1792d464ecc","year":2024},"citing_paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-09T16:06:26.450483Z"},"links":{"citing_paper":"/paper/2605.02262"},"observation_digest":"sha256:be31b1645089c64e799891165c5e1d0394496cc0272fc614213eae61f9db18eb","observation_id":"dd333923-b297-4ee8-9113-4b6a73a2c09a","resolution":{"observed_at":"2026-05-26T00:56:26.183259Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.02262","last_updated":"2026-05-04T06:17:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:15:23.301944Z","submitted_at":"2026-05-04T06:17:13Z","title":"WindowQuant: Mixed-Precision KV Cache Quantization based on Window-Level Similarity for VLMs Inference Optimization"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":29,"verified_fuzzy":2},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"thesis":"As of 3 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 1 inbound Pith citation observation for arXiv:2605.02262."}