{"as_of":"2026-08-16T08:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:99d76bd50e0fca0097b9a57b2b66fd65f660d7788647e426c72950e825a3d877","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T17:32:39.990624Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T13:26:55.395701Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T18:40:03.257305Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08890","snapshot_observed_at":"2026-08-09T13:26:55.395701Z","title":"Lexico: Extreme kv cache compression via sparse coding over universal dictionaries","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02617","last_updated":"2025-02-04T08:52:13Z","snapshot_observed_at":"2026-08-15T21:58:34.589761Z","submitted_at":"2025-02-04T08:52:13Z","title":"PolarQuant: Quantizing KV Caches with Polar Transformation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T13:26:55.395701Z"},"links":{"cited_paper":"/paper/2412.08890","citing_paper":"/paper/2502.02617"},"observation_digest":"sha256:f99834d7ef05791662227182e2aaecfffa7c67d7aa0843bdccda20ac5a1c3251","observation_id":"e0d28393-71b5-46a6-a19d-bb518fb9b178","resolution":{"observed_at":"2026-08-09T13:26:55.395701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"cited_work":{"arxiv_id":"2412.08890","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08890","snapshot_observed_at":"2026-07-04T18:40:03.257305Z","title":"Lexico: Extreme kv cache compression via sparse coding over universal dictionaries","venue":null,"work_id":"c52a030e-6a60-45de-a455-e80e59fd07ed","year":2024},"citing_paper":{"arxiv_id":"2504.19874","last_updated":"2025-04-28T15:05:35Z","snapshot_observed_at":"2026-08-14T14:45:14.744168Z","submitted_at":"2025-04-28T15:05:35Z","title":"TurboQuant: Online Vector Quantization with Near-optimal Distortion Rate","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T08:09:22.226608Z"},"links":{"cited_paper":"/paper/2412.08890","citing_paper":"/paper/2504.19874"},"observation_digest":"sha256:79067b81da0d9fc61de1567ed8edb33624b1d541af86b49f8bbeaca9afbf5b37","observation_id":"624879cc-1d29-4d46-85a0-ca699718236c","resolution":{"observed_at":"2026-05-20T08:09:22.270351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08890","snapshot_observed_at":"2026-08-07T06:04:31.436604Z","title":"Lexico: Extreme kv cache compression via sparse coding over universal dictionaries.arXiv preprint arXiv:2412.08890, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06266","last_updated":"2025-06-13T17:58:55Z","snapshot_observed_at":"2026-08-16T06:23:05.141323Z","submitted_at":"2025-06-06T17:48:23Z","title":"Cartridges: Lightweight and general-purpose long context representations via self-study","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T06:04:31.436604Z"},"links":{"cited_paper":"/paper/2412.08890","citing_paper":"/paper/2506.06266"},"observation_digest":"sha256:16972589229eca94ba2e658e66ea492fc40961327ab0ce3092c25019d39ae9f2","observation_id":"1916c9f4-cb6c-49b4-b9f7-9d002151684e","resolution":{"observed_at":"2026-08-07T06:04:31.436604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"cited_work":{"arxiv_id":"2412.08890","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08890","snapshot_observed_at":"2026-07-04T18:40:03.257305Z","title":"Lexico: Extreme kv cache compression via sparse coding over universal dictionaries","venue":null,"work_id":"c52a030e-6a60-45de-a455-e80e59fd07ed","year":2024},"citing_paper":{"arxiv_id":"2605.05365","last_updated":"2026-05-06T18:44:08Z","snapshot_observed_at":"2026-08-09T11:43:52.076241Z","submitted_at":"2026-05-06T18:44:08Z","title":"ZAYA1-8B Technical Report","version":1},"reference_index":142,"source":"arxiv_source","source_observed_at":"2026-05-08T17:36:37.182196Z"},"links":{"cited_paper":"/paper/2412.08890","citing_paper":"/paper/2605.05365"},"observation_digest":"sha256:462a5d7256453eb7af9cf13db76e25ce0733f9416ffd6fccc69253ecb8dcd6ff","observation_id":"d94ec039-2f70-4e0b-ae55-9c8fedb922fe","resolution":{"observed_at":"2026-05-11T17:26:05.138038Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"cited_work":{"arxiv_id":"2412.08890","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08890","snapshot_observed_at":"2026-07-04T18:40:03.257305Z","title":"Lexico: Extreme kv cache compression via sparse coding over universal dictionaries","venue":null,"work_id":"c52a030e-6a60-45de-a455-e80e59fd07ed","year":2024},"citing_paper":{"arxiv_id":"2606.24320","last_updated":"2026-06-25T20:48:22Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T08:57:34Z","title":"ZONOS2 Technical Report","version":1},"reference_index":167,"source":"arxiv_source","source_observed_at":"2026-06-25T22:37:15.072758Z"},"links":{"cited_paper":"/paper/2412.08890","citing_paper":"/paper/2606.24320"},"observation_digest":"sha256:63770399f1d2929eb183224c279f85126b88a103852ac2e5c7edb7a065873828","observation_id":"28d8da42-9c4a-465a-9895-a050ec8cdefa","resolution":{"observed_at":"2026-07-04T18:40:03.258656Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"cited_work":{"arxiv_id":"2412.08890","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08890","snapshot_observed_at":"2026-07-04T18:40:03.257305Z","title":"Lexico: Extreme kv cache compression via sparse coding over universal dictionaries","venue":null,"work_id":"c52a030e-6a60-45de-a455-e80e59fd07ed","year":2024},"citing_paper":{"arxiv_id":"2606.24320","last_updated":"2026-06-25T20:48:22Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T08:57:34Z","title":"ZONOS2 Technical Report","version":2},"reference_index":167,"source":"arxiv_source","source_observed_at":"2026-06-29T02:07:31.791835Z"},"links":{"cited_paper":"/paper/2412.08890","citing_paper":"/paper/2606.24320"},"observation_digest":"sha256:4c78b6cf0dd85b0f50f4c0139088025898379a53d24bfbcad8f1f3dbd9c805a2","observation_id":"81229a86-7276-4c50-9de8-532cb996de2a","resolution":{"observed_at":"2026-07-01T18:15:59.119424Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08890","snapshot_observed_at":"2026-08-01T09:52:04.379792Z","title":"arXiv preprint arXiv:2412.08890 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27308","last_updated":"2026-07-29T17:49:04Z","snapshot_observed_at":"2026-08-05T10:53:49.344314Z","submitted_at":"2026-07-29T17:49:04Z","title":"ZUNA1.1: A more flexible EEG foundation model for Denoising and Super-resolution","version":1},"reference_index":152,"source":"arxiv_source","source_observed_at":"2026-08-01T09:52:04.379792Z"},"links":{"cited_paper":"/paper/2412.08890","citing_paper":"/paper/2607.27308"},"observation_digest":"sha256:0fbf212c6387d0511cb8ef8c7c7cb8afd0101acbac6ab21725f705c9843fc0ca","observation_id":"b3d8b8f7-8db9-4516-91fe-ce7f84b53e57","resolution":{"observed_at":"2026-08-01T09:52:04.379792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.08890/citation-record","integrity":"/paper/2412.08890/integrity","json":"/paper/2412.08890/citation-record.json","paper":"/paper/2412.08890"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:32:39.921656Z","title":"Gqa: Training generalized multi-query transformer models from multi-head check- points","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T17:32:39.921656Z"},"links":{"citing_paper":"/paper/2412.08890"},"observation_digest":"sha256:40748e92713c60bde9181fe451a06d61bf04be0045eb1695080adc92e5afddba","observation_id":"6996c122-ee75-4e9d-a5c2-89085e9018f3","resolution":{"observed_at":"2026-08-11T17:32:39.921656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-11T17:32:39.928529Z","title":"Longformer: The long-document transformer","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T17:32:39.928529Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2412.08890"},"observation_digest":"sha256:514012c0002017757025a6dffc5157f5ac54c835f27604a3251adeb8e78e05b7","observation_id":"7304570a-1d63-4f0b-a935-fde0456f0668","resolution":{"observed_at":"2026-08-11T17:32:39.928529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02069","last_updated":"2025-05-15T17:18:12Z","snapshot_observed_at":"2026-08-13T04:39:30.300015Z","submitted_at":"2024-06-04T07:51:30Z","title":"PyramidKV: Dynamic KV Cache Compression based on Pyramidal Information Funneling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02069","snapshot_observed_at":"2026-08-11T17:32:39.931782Z","title":"Pyramidkv: Dynamic kv cache compression based on pyramidal information funneling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T17:32:39.931782Z"},"links":{"cited_paper":"/paper/2406.02069","citing_paper":"/paper/2412.08890"},"observation_digest":"sha256:6f143dd1ee608b934a2f86689ede228cbbc2cc01d7a776507a1ab358e52a4f70","observation_id":"16760b27-39cb-4865-a6f4-e8cb8057b340","resolution":{"observed_at":"2026-08-11T17:32:39.931782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14256","last_updated":"2024-05-23T07:37:16Z","snapshot_observed_at":"2026-08-15T17:39:06.353320Z","submitted_at":"2024-05-23T07:37:16Z","title":"ZipCache: Accurate and Efficient KV Cache Quantization with Salient Token Identification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14256","snapshot_observed_at":"2026-08-11T17:32:39.944609Z","title":"Zipcache: Accurate and efficient kv cache quantization with salient token identification","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T17:32:39.944609Z"},"links":{"cited_paper":"/paper/2405.14256","citing_paper":"/paper/2412.08890"},"observation_digest":"sha256:2c8a7ba44bd2e2b6869e2b6dc2b4f820e3ef2d1048898e69a0591643cecdc01b","observation_id":"2a14adf7-5e1a-4605-a1b1-e1e792b0d052","resolution":{"observed_at":"2026-08-11T17:32:39.944609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-13T04:29:50.330115Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-11T17:32:39.947554Z","title":"Coleman Hooper, Sehoon Kim, Hiva Mohammadzadeh, Michael W Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T17:32:39.947554Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2412.08890"},"observation_digest":"sha256:269bcd2581b367477aa6cfa321812b82de2f57ba4e00f08fcd0286a2b598b8cf","observation_id":"ad012494-5137-4507-bdda-9643a54b41c4","resolution":{"observed_at":"2026-08-11T17:32:39.947554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05527","last_updated":"2024-09-30T22:44:58Z","snapshot_observed_at":"2026-08-13T07:43:17.158479Z","submitted_at":"2024-03-08T18:48:30Z","title":"GEAR: An Efficient KV Cache Compression Recipe for Near-Lossless Generative Inference of LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05527","snapshot_observed_at":"2026-08-11T17:32:39.949962Z","title":"Gear: An efficient kv cache compression recipefor near-lossless generative inference of llm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T17:32:39.949962Z"},"links":{"cited_paper":"/paper/2403.05527","citing_paper":"/paper/2412.08890"},"observation_digest":"sha256:9b1e4fb184859de9566dc1ceac8dd871516aa816ae04cc0b570537d4bd5b4f70","observation_id":"44398d71-fd32-41e3-987c-c6fb764c9fef","resolution":{"observed_at":"2026-08-11T17:32:39.949962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-11T17:32:39.952337Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T17:32:39.952337Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2412.08890"},"observation_digest":"sha256:b34aaf1641b6114f97142c13efaa3d164764fe0bc110b741ef3240ae45b28aee","observation_id":"a6e0556e-6d30-467b-90d9-eb08435f1879","resolution":{"observed_at":"2026-08-11T17:32:39.952337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-14T12:21:04.886717Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-08-11T17:32:39.954480Z","title":"Snapkv: Llm knows what you are looking for before generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T17:32:39.954480Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2412.08890"},"observation_digest":"sha256:bbfbc59df3135bd31c53e6ac226134697d8449b6754ff6c73e0b4b23d9e96d83","observation_id":"9a573994-344b-4f0a-9c48-6cd4df391568","resolution":{"observed_at":"2026-08-11T17:32:39.954480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-13T04:48:37.453735Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-11T17:32:39.956930Z","title":"Infinite-llm: Efficient llm service for long context with distattention and distributed kvcache","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T17:32:39.956930Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2412.08890"},"observation_digest":"sha256:468d21b35cb2ad9474e367a2f570f7ccc5a40982caccd833e72aa141d83d0296","observation_id":"3ff7a8d3-7e33-4302-a0d9-1ceac9c3347d","resolution":{"observed_at":"2026-08-11T17:32:39.956930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02750","last_updated":"2024-07-25T09:16:05Z","snapshot_observed_at":"2026-08-12T17:03:50.984887Z","submitted_at":"2024-02-05T06:06:47Z","title":"KIVI: A Tuning-Free Asymmetric 2bit Quantization for KV Cache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02750","snapshot_observed_at":"2026-08-11T17:32:39.959695Z","title":"Scissorhands: Exploiting the persistence of importance hypothesis for llm kv cache compression at test time.Advances in Neural Information Processing Systems, 36, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T17:32:39.959695Z"},"links":{"cited_paper":"/paper/2402.02750","citing_paper":"/paper/2412.08890"},"observation_digest":"sha256:3ea627a1963c359b1677a7ed9b4b37871cb03e83721aa32f835a3e9ad73c3115","observation_id":"940f14fa-18b7-4b36-ba3f-0d9e6e88aca2","resolution":{"observed_at":"2026-08-11T17:32:39.959695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5663","last_updated":"2014-03-22T17:12:07Z","snapshot_observed_at":"2026-08-15T22:21:57.868869Z","submitted_at":"2013-12-19T17:46:46Z","title":"k-Sparse Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5663","snapshot_observed_at":"2026-08-11T17:32:39.962371Z","title":"K-sparse autoencoders.arXiv preprint arXiv:1312.5663,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T17:32:39.962371Z"},"links":{"cited_paper":"/paper/1312.5663","citing_paper":"/paper/2412.08890"},"observation_digest":"sha256:fb380e0432fb00161ae488b8958908ad0f949e90f051c6fac69206bd73fd02a9","observation_id":"0325c185-17c6-478f-8446-98063aa181c8","resolution":{"observed_at":"2026-08-11T17:32:39.962371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00079","last_updated":"2025-09-03T14:56:29Z","snapshot_observed_at":"2026-08-12T23:36:32.131457Z","submitted_at":"2024-06-24T02:05:32Z","title":"Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00079","snapshot_observed_at":"2026-08-11T17:32:39.965032Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T17:32:39.965032Z"},"links":{"cited_paper":"/paper/2407.00079","citing_paper":"/paper/2412.08890"},"observation_digest":"sha256:3f76540f65c556982944d6f1cf71f8ec81de9d6d59fe835ec0474b29e4c8c335","observation_id":"04eba951-ee5d-4c55-9cf5-612fecbf5103","resolution":{"observed_at":"2026-08-11T17:32:39.965032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-11T17:32:39.967735Z","title":"Fast transformer decoding: One write-head is all you need","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T17:32:39.967735Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2412.08890"},"observation_digest":"sha256:c334e7f9d5aad7217efd000f70e9f5bea0810398430662052b8e58b6a96ce9cf","observation_id":"de5dc1e6-9709-4b4c-aa49-54da6f37c8c2","resolution":{"observed_at":"2026-08-11T17:32:39.967735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05254","last_updated":"2024-05-09T14:12:45Z","snapshot_observed_at":"2026-08-14T00:44:29.108997Z","submitted_at":"2024-05-08T17:57:39Z","title":"You Only Cache Once: Decoder-Decoder Architectures for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05254","snapshot_observed_at":"2026-08-11T17:32:39.973242Z","title":"You only cache once: Decoder-decoder architectures for language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T17:32:39.973242Z"},"links":{"cited_paper":"/paper/2405.05254","citing_paper":"/paper/2412.08890"},"observation_digest":"sha256:dcca7d7cf08c2f277c14ec2d0b3d27df5e3c07e2340403ac92fd323dafaceb7e","observation_id":"9c290bd5-84e9-4430-ac12-2e7c84472eb9","resolution":{"observed_at":"2026-08-11T17:32:39.973242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:32:40.148789Z","title":"Attention is all you need","venue":null,"work_id":"2b670781-8967-44fa-b843-550dd6584644","year":2017},"citing_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T17:32:39.976451Z"},"links":{"citing_paper":"/paper/2412.08890"},"observation_digest":"sha256:090cf7bb862717d355da145e5ff0da8649e8df5a3d0c9880d19709a2820ecab2","observation_id":"565271d7-35bb-44d4-841d-f0e363bb956c","resolution":{"observed_at":"2026-08-11T17:32:40.151637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15220","last_updated":"2024-08-01T07:51:25Z","snapshot_observed_at":"2026-08-14T22:26:18.192640Z","submitted_at":"2024-02-23T09:29:19Z","title":"ChunkAttention: Efficient Self-Attention with Prefix-Aware KV Cache and Two-Phase Partition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15220","snapshot_observed_at":"2026-08-11T17:32:39.982079Z","title":"Chunkattention: Efficient self-attention with prefix-aware kv cache and two-phase partition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T17:32:39.982079Z"},"links":{"cited_paper":"/paper/2402.15220","citing_paper":"/paper/2412.08890"},"observation_digest":"sha256:8a18badc2875bc7a85be58fbac189b0f3896ea7302d4391a60bf155c70ad6335","observation_id":"7704faf6-a812-4e49-99c2-178b456a92d9","resolution":{"observed_at":"2026-08-11T17:32:39.982079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12065","last_updated":"2024-02-20T08:48:24Z","snapshot_observed_at":"2026-08-13T04:15:31.066686Z","submitted_at":"2024-02-19T11:33:21Z","title":"WKVQuant: Quantizing Weight and Key/Value Cache for Large Language Models Gains More","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12065","snapshot_observed_at":"2026-08-11T17:32:39.987580Z","title":"Wkvquant: Quantizing weight and key/value cache for large language models gains more","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T17:32:39.987580Z"},"links":{"cited_paper":"/paper/2402.12065","citing_paper":"/paper/2412.08890"},"observation_digest":"sha256:98cf7ddc33b569e0a4bb4fd8a61f8115eaf086f682f88b020fe660575f310a2c","observation_id":"f8b489a9-e388-4c65-9016-444ae4d34c70","resolution":{"observed_at":"2026-08-11T17:32:39.987580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-11T17:32:39.935049Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-11T17:32:39.935049Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2412.08890"},"observation_digest":"sha256:e65364a8436e7442624965277df8d6ee6c934796e7ed910cd6f3a18f058af553","observation_id":"b7a2ab87-7f4b-483f-8907-2113a51c0c9b","resolution":{"observed_at":"2026-08-11T17:32:39.935049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-11T17:32:39.979186Z","title":"Yubo Wang, Xueguang Ma, Ge Zhang, Yuansheng Ni, Abhranil Chandra, Shiguang Guo, Weiming Ren, Aaran Arulraj, Xuan He, Ziyan Jiang, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T17:32:39.979186Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2412.08890"},"observation_digest":"sha256:6a15e55acd145afe8d6b52e4de0e1f7a5ded35a0e36b15c0ff413d8490bb4efa","observation_id":"cebab9c8-3e35-4a9e-8c79-c79e017138a2","resolution":{"observed_at":"2026-08-11T17:32:39.979186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02542","last_updated":"2024-11-07T18:58:50Z","snapshot_observed_at":"2026-08-14T23:45:08.084246Z","submitted_at":"2024-06-04T17:58:03Z","title":"Loki: Low-rank Keys for Efficient Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02542","snapshot_observed_at":"2026-08-11T17:32:39.970666Z","title":"Loki: Low-rank keys for efficient sparse attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T17:32:39.970666Z"},"links":{"cited_paper":"/paper/2406.02542","citing_paper":"/paper/2412.08890"},"observation_digest":"sha256:649ae4ae21b5ed43eb8bfb05caefdb65c40709842fdb6f63215ea84b485b6c17","observation_id":"2fe16acb-c6c4-42fa-9764-69071f0ef38a","resolution":{"observed_at":"2026-08-11T17:32:39.970666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:32:40.138532Z","title":"APPENDIX A I MPLEMENTATION DETAILS Algorithm 1 illustrates a naive implementation of OMP for understanding","venue":null,"work_id":"020bb96c-df26-4e85-853b-994ece250c94","year":2020},"citing_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T17:32:39.990624Z"},"links":{"citing_paper":"/paper/2412.08890"},"observation_digest":"sha256:7435646abe8a46244ef7914248af3129209caf756101e0967eda477cefcbd93b","observation_id":"adb11b81-00c7-4e26-8c6f-2ee114404806","resolution":{"observed_at":"2026-08-11T17:32:40.143729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-08-13T15:18:04.411100Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-11T17:32:39.938181Z","title":"Deepseekmoe: Towards ultimate expert specialization in mixture- of-experts language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T17:32:39.938181Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2412.08890"},"observation_digest":"sha256:7aa71aedaa9029ca117aee36a43432a866e3234ad0fb0b88bec33a9f33b9dc3f","observation_id":"7ca79eb1-e2b5-4e91-8f93-196b6704489d","resolution":{"observed_at":"2026-08-11T17:32:39.938181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07056","last_updated":"2024-06-11T08:37:33Z","snapshot_observed_at":"2026-08-14T22:21:13.910104Z","submitted_at":"2024-06-11T08:37:33Z","title":"Effectively Compress KV Heads for LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07056","snapshot_observed_at":"2026-08-11T17:32:39.984824Z","title":"Effectively compress kv heads for llm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T17:32:39.984824Z"},"links":{"cited_paper":"/paper/2406.07056","citing_paper":"/paper/2412.08890"},"observation_digest":"sha256:40608f25549e834ae2be470893a0e0416f56b4fb6004998e34fe34af8905f0c4","observation_id":"79b0f42e-f2ec-4eca-8a4e-b02232bc8564","resolution":{"observed_at":"2026-08-11T17:32:39.984824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-11T17:32:39.924932Z","title":"Longbench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T17:32:39.924932Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2412.08890"},"observation_digest":"sha256:8ce60fafa80fdd80b09301e1a942957f6e16b1e3441e752fdb8200bfb539b220","observation_id":"633141e6-7103-42f7-8519-27a5ba51c752","resolution":{"observed_at":"2026-08-11T17:32:39.924932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11430","last_updated":"2024-11-03T09:42:35Z","snapshot_observed_at":"2026-08-15T06:43:46.557876Z","submitted_at":"2024-06-17T11:35:16Z","title":"A Simple and Effective $L_2$ Norm-Based Strategy for KV Cache Compression","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11430","snapshot_observed_at":"2026-08-11T17:32:39.941220Z","title":"A simple and effective l 2 norm-based strategy for kv cache compression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T17:32:39.941220Z"},"links":{"cited_paper":"/paper/2406.11430","citing_paper":"/paper/2412.08890"},"observation_digest":"sha256:d95b9bb80632792118ddd6cf7ad35b17e8ccc18bbe354f6f658b7b23ff89cb47","observation_id":"dcea4b12-2e86-4870-a977-e26441bb3c7c","resolution":{"observed_at":"2026-08-11T17:32:39.941220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.08890","last_updated":"2024-12-12T03:00:29Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T16:44:06.126162Z","submitted_at":"2024-12-12T03:00:29Z","title":"Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 7 inbound Pith citation observations for arXiv:2412.08890."}