{"as_of":"2026-08-18T14:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4540f5f0e0c82f76471039645d6e19d618c09b1a0e6493d34e8c35b43660bc25","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T11:49:11.813142Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.24555/citation-record","integrity":"/paper/2607.24555/integrity","json":"/paper/2607.24555/citation-record.json","paper":"/paper/2607.24555"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.599287Z","title":"LongBench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.599287Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:a2e2cc7e8c5090cb7838cae511d449752a8b652b13950b35ef184dec6a900627","observation_id":"959d079c-d81d-457b-b730-c0597f54713c","resolution":{"observed_at":"2026-07-31T11:49:11.599287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14051","last_updated":"2025-08-13T17:55:58Z","snapshot_observed_at":"2026-08-16T12:56:53.220469Z","submitted_at":"2025-02-19T19:12:46Z","title":"RocketKV: Accelerating Long-Context LLM Inference via Two-Stage KV Cache Compression","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14051","snapshot_observed_at":"2026-07-31T11:49:11.602883Z","title":"RocketKV: Accelerating long-context LLM inference via two-stage KV cache compression","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.602883Z"},"links":{"cited_paper":"/paper/2502.14051","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:d109969481d8c7cb5d4e8948909afadae5d6bf4b1586edbfe4aac8c630662888","observation_id":"6bfc83ab-cfa0-4dc1-b86d-6a03fe53ac7c","resolution":{"observed_at":"2026-07-31T11:49:11.602883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-07-31T11:49:11.605941Z","title":"Longformer: The long-document transformer.arXiv preprint arXiv:2004.05150, 2020","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.605941Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:931223a73f69812ff673302bb2bb2e0a0cb018fa3c440a3e2738c77340c8409d","observation_id":"88edf86c-4b9d-40e6-bfd6-61030eb40ecf","resolution":{"observed_at":"2026-07-31T11:49:11.605941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.609016Z","title":"R-KV: Redundancy-aware KV cache compression for reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.609016Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:cb861e4b20463737dbf37342bf97225b314326808851b26422f1731dd4595418","observation_id":"fd2a06c7-b6e3-4a44-bf38-7a295f928a31","resolution":{"observed_at":"2026-07-31T11:49:11.609016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.20868","last_updated":"2026-05-20T08:04:40Z","snapshot_observed_at":"2026-08-12T22:16:32.837291Z","submitted_at":"2026-05-20T08:04:40Z","title":"Runtime-Certified Bounded-Error Quantized Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.20868","snapshot_observed_at":"2026-07-31T11:49:11.611913Z","title":"Runtime-certified bounded-error quantized attention, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.611913Z"},"links":{"cited_paper":"/paper/2605.20868","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:776502620ab503a2c3a3f1cab800783558080ecdc83f86c8f07d07bc3d7d8801","observation_id":"24c27a4f-b41a-4cb0-9434-542160ff4baf","resolution":{"observed_at":"2026-07-31T11:49:11.611913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21118","last_updated":"2024-11-04T02:08:55Z","snapshot_observed_at":"2026-08-16T13:29:46.132956Z","submitted_at":"2024-07-30T18:19:38Z","title":"Palu: Compressing KV-Cache with Low-Rank Projection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21118","snapshot_observed_at":"2026-07-31T11:49:11.614843Z","title":"Palu: Compressing KV-cache with low-rank projection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.614843Z"},"links":{"cited_paper":"/paper/2407.21118","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:f3a4401483486ab989c2265ebf1e2d7bee424ca03222de0d5b6eace85f174a0b","observation_id":"9efb6cf7-0d03-46c7-bd1f-c19c47410427","resolution":{"observed_at":"2026-07-31T11:49:11.614843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.03928","last_updated":"2026-06-02T17:16:33Z","snapshot_observed_at":"2026-08-06T06:58:50.530659Z","submitted_at":"2026-06-02T17:16:33Z","title":"Value-Aware Stochastic KV Cache Eviction for Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.03928","snapshot_observed_at":"2026-07-31T11:49:11.619336Z","title":"Value-aware stochastic KV cache eviction for reasoning models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.619336Z"},"links":{"cited_paper":"/paper/2606.03928","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:828e16bb06651191016c31fb47ef2c413b2d70b31b1e60bb5ea15ee3b14e751a","observation_id":"6c8c0567-ff9a-46fc-b902-333781a667e8","resolution":{"observed_at":"2026-07-31T11:49:11.619336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.622393Z","title":"MagicPIG: LSH sampling for efficient LLM generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.622393Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:d9ea1508aa686979b4010bdbfe2d03511f9d2440231496b4ebd083c7df367fc0","observation_id":"105a00ad-7f73-4dd8-960c-490ae7a98afb","resolution":{"observed_at":"2026-07-31T11:49:11.622393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.22312","last_updated":"2026-04-24T07:46:25Z","snapshot_observed_at":"2026-08-13T04:18:22.449716Z","submitted_at":"2026-04-24T07:46:25Z","title":"Guess-Verify-Refine: Data-Aware Top-K for Sparse-Attention Decoding on Blackwell via Temporal Correlation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.22312","snapshot_observed_at":"2026-07-31T11:49:11.624951Z","title":"Guess-verify-refine: Data-aware top-K for sparse-attention decoding on Blackwell via temporal correlation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.624951Z"},"links":{"cited_paper":"/paper/2604.22312","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:ca3ea536d43084d183d4c45e55114079a01381f54feac5d0b081872655901094","observation_id":"787f2b05-3c08-4b5c-83b6-d1a1e38031e1","resolution":{"observed_at":"2026-07-31T11:49:11.624951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-16T10:03:03.268538Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-07-31T11:49:11.628245Z","title":"Generating long sequences with sparse transformers","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.628245Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:9bc65d80c71a9d0fb56df62a7647dd5f701ee3904f60d1fb5e0c893c06daf9eb","observation_id":"bf45fbee-d439-4b21-8200-1a204d6aed2e","resolution":{"observed_at":"2026-07-31T11:49:11.628245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.631097Z","title":"DeepSeek-V4: Towards highly efficient million-token context intelligence.arXiv preprint arXiv:2606.19348, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.631097Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:e372a97a967c0e84b27fcc114d3a47dabdf998d6fe9cdead7d6de021c3fe6545","observation_id":"4bd23b9f-fc37-48dc-8cc2-2631cb030d7a","resolution":{"observed_at":"2026-07-31T11:49:11.631097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.05688","last_updated":"2026-05-25T12:53:13Z","snapshot_observed_at":"2026-08-18T07:56:14.860405Z","submitted_at":"2025-10-07T08:46:08Z","title":"vAttention: Verified Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.05688","snapshot_observed_at":"2026-07-31T11:49:11.633572Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.633572Z"},"links":{"cited_paper":"/paper/2510.05688","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:c08bd026a13c27eb1e1484c33722a8e006377325331c6edfc9d15f343201d90e","observation_id":"f14d6af5-3a8f-4761-ad5d-786073bccf16","resolution":{"observed_at":"2026-07-31T11:49:11.633572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.636314Z","title":"Kascade: A practical sparse attention method for long-context LLM inference, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.636314Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:c171109e7f2d0c8597239f736702ea2c6656cc90e5afcde3a33d9bc7d4c7cd6c","observation_id":"a7af074a-ce98-491a-ad7b-294fc8fb8aef","resolution":{"observed_at":"2026-07-31T11:49:11.636314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.638817Z","title":"Expected attention: KV cache compression by estimating attention from future queries distribution, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.638817Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:584d8040445acef755498eff3b963c35fbc8f06a9f853ed0276cdaa249e3ad23","observation_id":"5a79ae37-134a-419b-9838-285db21d3a9e","resolution":{"observed_at":"2026-07-31T11:49:11.638817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.641335Z","title":"The approximation of one matrix by another of lower rank.Psychometrika, 1(3): 211–218, 1936","venue":null,"work_id":null,"year":1936},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.641335Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:f76fd3e7f3759e891e79bca1a062c6736e8a17af9c0f6e9779be22b580a581c5","observation_id":"576f0597-61dd-4d3d-bb0f-3d1c41622851","resolution":{"observed_at":"2026-07-31T11:49:11.641335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11550","last_updated":"2025-10-16T13:25:38Z","snapshot_observed_at":"2026-08-12T20:32:53.188699Z","submitted_at":"2024-07-16T09:53:32Z","title":"Ada-KV: Optimizing KV Cache Eviction by Adaptive Budget Allocation for Efficient LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11550","snapshot_observed_at":"2026-07-31T11:49:11.643900Z","title":"Kevin Zhou","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.643900Z"},"links":{"cited_paper":"/paper/2407.11550","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:8324be16e744a055f14e03fbc349b8ea52648724b9eb9d3707b5145203002aab","observation_id":"4301edce-d036-4326-a5ac-7512a5da7da9","resolution":{"observed_at":"2026-07-31T11:49:11.643900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13276","last_updated":"2025-02-17T02:24:47Z","snapshot_observed_at":"2026-08-16T14:39:45.917951Z","submitted_at":"2024-10-17T07:07:09Z","title":"SeerAttention: Learning Intrinsic Sparse Attention in Your LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13276","snapshot_observed_at":"2026-07-31T11:49:11.646757Z","title":"SeerAttention: Learning intrinsic sparse attention in your LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.646757Z"},"links":{"cited_paper":"/paper/2410.13276","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:abd5a0bbccc489f2d3f3da8e6d28239d3b32f78bca477da27fe5cfd8f53f01d3","observation_id":"5f24662f-4ecb-4e8a-8539-5011aac93f39","resolution":{"observed_at":"2026-07-31T11:49:11.646757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-31T11:49:11.649772Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.649772Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:a8d7b43a4d3c4c1feec8dd6332907bf9d1d00e42d0b38a3a6785b42b965de047","observation_id":"aaab944d-c458-444a-a56e-f7e5f59bbc3a","resolution":{"observed_at":"2026-07-31T11:49:11.649772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12335","last_updated":"2024-10-02T00:19:13Z","snapshot_observed_at":"2026-08-16T13:41:57.339939Z","submitted_at":"2024-06-18T07:01:11Z","title":"Attention Score is not All You Need for Token Importance Indicator in KV Cache Reduction: Value Also Matters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12335","snapshot_observed_at":"2026-07-31T11:49:11.652489Z","title":"Attention score is not all you need for token importance indicator in KV cache reduction: Value also matters, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.652489Z"},"links":{"cited_paper":"/paper/2406.12335","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:b6da5a59339604fa1f0002d373c6aafdbfd1e73a4af8060b9af03a294682c562","observation_id":"d64abe1e-c04d-4ccd-b828-ada98883c038","resolution":{"observed_at":"2026-07-31T11:49:11.652489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14256","last_updated":"2024-05-23T07:37:16Z","snapshot_observed_at":"2026-08-16T13:50:20.836322Z","submitted_at":"2024-05-23T07:37:16Z","title":"ZipCache: Accurate and Efficient KV Cache Quantization with Salient Token Identification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14256","snapshot_observed_at":"2026-07-31T11:49:11.655479Z","title":"ZipCache: Accurate and efficient KV cache quantization with salient token identification","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.655479Z"},"links":{"cited_paper":"/paper/2405.14256","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:7cfd5dfe935b29806be3c3ff0153429196df9b489aab35efcc604400f5b8a99b","observation_id":"ddb8a54c-fef2-44d7-bffc-93230c7d777b","resolution":{"observed_at":"2026-07-31T11:49:11.655479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.658299Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.658299Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:380c717c59ec4a52aef57015bc6af4d3cbf37628bd571a2bdf3dd0e8e638e67f","observation_id":"774ad2d5-f9fb-48ef-8bbf-3ca35b8fef0f","resolution":{"observed_at":"2026-07-31T11:49:11.658299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15304","last_updated":"2025-02-21T08:55:21Z","snapshot_observed_at":"2026-08-16T12:56:25.219709Z","submitted_at":"2025-02-21T08:55:21Z","title":"SVDq: 1.25-bit and 410x Key Cache Compression for LLM Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15304","snapshot_observed_at":"2026-07-31T11:49:11.660856Z","title":"SVDq: 1.25-bit and 410x key cache compression for LLM attention.arXiv preprint arXiv:2502.15304, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.660856Z"},"links":{"cited_paper":"/paper/2502.15304","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:30e32a0062db4baeeee8886c12201a1039c1977d2aac0ce99c4f5143aa2d6eb6","observation_id":"8018d232-67d2-497e-93f9-0e6a4ca29532","resolution":{"observed_at":"2026-07-31T11:49:11.660856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.663751Z","title":"KVQuant: Towards 10 million context length LLM inference with KV cache quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.663751Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:b2a0965cd512d75d71ca3189b1d69d2e902ac69ff3d313c5091325a670609cfa","observation_id":"b5e1e7c3-cf4f-4b72-9352-3f3c2b20fe4e","resolution":{"observed_at":"2026-07-31T11:49:11.663751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.666428Z","title":"Multipole attention for efficient long context reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.666428Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:53cdb9b5bf269b670d7b75a8d3213c527910cdd27fd39bb7d6094c313960df6f","observation_id":"34800a76-c8d5-494c-93f1-e544608b5d5d","resolution":{"observed_at":"2026-07-31T11:49:11.666428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-08-15T18:01:46.669862Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-07-31T11:49:11.668924Z","title":"Ruler: What’s the real context size of your long-context language models?arXiv preprint arXiv:2404.06654, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.668924Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:aad0dea9121a714185d48fea5c631a3057701bb050309a31f041a93c3923bb2c","observation_id":"65566cb2-fd52-4269-92f0-99ac7392a2ec","resolution":{"observed_at":"2026-07-31T11:49:11.668924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.02980","last_updated":"2026-07-03T05:39:00Z","snapshot_observed_at":"2026-08-13T13:15:47.894654Z","submitted_at":"2026-07-03T05:39:00Z","title":"Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.02980","snapshot_observed_at":"2026-07-31T11:49:11.671759Z","title":"Hierarchical sparse attention done right: Toward infinite context modeling","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.671759Z"},"links":{"cited_paper":"/paper/2607.02980","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:fd5ce203ab73b1fdef318a1ee944d7cdbdbcbbfb4ff21ff7616b873dcd8edcc7","observation_id":"14757c3e-1a75-4357-91d4-012f5450664d","resolution":{"observed_at":"2026-07-31T11:49:11.671759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.674420Z","title":"MInference 1.0: Accelerating pre-filling for long-context LLMs via dynamic sparse attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.674420Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:5fdb82b7e1c84c1bea965e831f239f9a218386d414bb5aa0aa998ab4f126c888","observation_id":"2eb3acca-ace5-466f-a1ee-345b70edc513","resolution":{"observed_at":"2026-07-31T11:49:11.674420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.676916Z","title":"Lee, Sangdoo Yun, and Hyun Oh Song","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.676916Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:2a7ba9031a375430885cdc4c001baee840c889851cc9bde6e3ad848878933a1f","observation_id":"516b3f31-b1e3-4d4f-a77e-dd5e6e19b868","resolution":{"observed_at":"2026-07-31T11:49:11.676916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.679444Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.679444Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:679836ce6ba345114a9d12b86e2c0dbc0f26e1f9b0886d8070936d4d681997b5","observation_id":"7a346038-c55e-4124-bf64-fa3a8adbaf57","resolution":{"observed_at":"2026-07-31T11:49:11.679444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.681959Z","title":"InfiniGen: Efficient generative inference of large language models with dynamic KV cache management","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.681959Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:ef7287be73c1bf769ef343decb874e4a8d2c5bcf282ffd33ffc75604c28c65e6","observation_id":"04a72802-65a1-421c-ac88-b62ee91cb951","resolution":{"observed_at":"2026-07-31T11:49:11.681959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.684394Z","title":"Rakhshan, and Guillaume Rabusseau","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.684394Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:39fcc595b1572cf5f4e209f33955fd961732ea3400d780fd0c9af84488ce6de3","observation_id":"1ffff939-3524-4b72-b215-9f3326ba376a","resolution":{"observed_at":"2026-07-31T11:49:11.684394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.686847Z","title":"Efficient low rank attention for long-context inference in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.686847Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:cbefd4b01c004ea66f8dc6e8308cd806086d8630fb975cca5f26f7517fce4066","observation_id":"bae6cc65-27c4-4f78-b7bb-8094a25943fe","resolution":{"observed_at":"2026-07-31T11:49:11.686847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.689334Z","title":"Snapkv: LLM knows what you are looking for before generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.689334Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:b59e0948cbe4f8e630004b74fb8a787fc8b989663583e8e787a2a481a266a194","observation_id":"806acae9-9c8d-4f33-881f-b309b9aff0f1","resolution":{"observed_at":"2026-07-31T11:49:11.689334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.691973Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.691973Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:1a9452113ed6b5f202d6b7bb924b4f6eef10da968a46b42649962bec097bf47b","observation_id":"542fa98f-0031-4df5-8222-cfe9b0fafef2","resolution":{"observed_at":"2026-07-31T11:49:11.691973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.694489Z","title":"Twilight: Adaptive attention sparsity with hierarchical top-p pruning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.694489Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:538c64b7dd67860a1858e558781bc8d6afb024dc7392fb5b38a1fcc252738bb2","observation_id":"cc221710-858e-4c41-88a6-e2e7264ce6fe","resolution":{"observed_at":"2026-07-31T11:49:11.694489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.696980Z","title":"RetrievalAttention: Accelerating long-context LLM inference via vector retrieval","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.696980Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:e208d88629e541917dea5beb145c6a3b4d7665bc45f60e8c1669c5d94b0619df","observation_id":"7f953dad-68ab-447c-8805-5da810eadb73","resolution":{"observed_at":"2026-07-31T11:49:11.696980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03213","last_updated":"2025-06-14T06:17:33Z","snapshot_observed_at":"2026-08-14T21:26:50.903212Z","submitted_at":"2024-12-04T10:58:27Z","title":"ClusterKV: Manipulating LLM KV Cache in Semantic Space for Recallable Compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03213","snapshot_observed_at":"2026-07-31T11:49:11.699513Z","title":"ClusterKV: Manipulating LLM KV cache in semantic space for recallable compression, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.699513Z"},"links":{"cited_paper":"/paper/2412.03213","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:56e91237a6e13330986cc9307dbf944173e4409048348c8dcf8d7a786f1bc846","observation_id":"2e0d35b9-7965-439c-b3f0-21a020d041ed","resolution":{"observed_at":"2026-07-31T11:49:11.699513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11164","last_updated":"2026-06-09T17:44:23Z","snapshot_observed_at":"2026-08-14T09:16:22.038523Z","submitted_at":"2026-06-09T17:44:23Z","title":"ReasonAlloc: Hierarchical Decoding-Time KV Cache Budget Allocation for Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.11164","snapshot_observed_at":"2026-07-31T11:49:11.702163Z","title":"ReasonAlloc: Hierarchical decoding-time KV cache budget allocation for reasoning models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.702163Z"},"links":{"cited_paper":"/paper/2606.11164","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:8aa616b925c7a6fe0bf2046743d3462eee5553b721550a7e988803c6ca004a1a","observation_id":"48f52fbd-9abb-48af-8f7f-82002a348382","resolution":{"observed_at":"2026-07-31T11:49:11.702163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.704874Z","title":"KIVI: A tuning-free asymmetric 2bit quantization for KV cache","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.704874Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:beea7b4da0de8ecfe7d8f1079925bcf3dd497b1cd4bf396df2312d56e6f3cead","observation_id":"ff8b9d3c-845f-47c7-9d77-745d50a3c062","resolution":{"observed_at":"2026-07-31T11:49:11.704874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-08-12T19:30:23.025771Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-07-31T11:49:11.707395Z","title":"Zhang, Zhilin Yang, Xinyu Zhou, Mingxing Zhang, and Jiezhong Qiu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.707395Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:5839ebde472172a4ff6f30d7fd9ad6e50d4c63f98898a5d4ed356471117399e9","observation_id":"78245182-d1d3-4e19-9e05-613aed85bdd3","resolution":{"observed_at":"2026-07-31T11:49:11.707395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.04921","last_updated":"2026-04-06T17:58:42Z","snapshot_observed_at":"2026-08-12T23:14:44.419087Z","submitted_at":"2026-04-06T17:58:42Z","title":"TriAttention: Efficient Long Reasoning with Trigonometric KV Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.04921","snapshot_observed_at":"2026-07-31T11:49:11.710201Z","title":"TriAttention: Efficient long reasoning with trigonometric KV compression.arXiv preprint arXiv:2604.04921, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.710201Z"},"links":{"cited_paper":"/paper/2604.04921","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:cf586e34ee0f8e3f75c8780d976d73d9da61d78b122a9a1b728e3b1e0faec8ca","observation_id":"deb03427-f860-4341-bbe7-00aa29be4af6","resolution":{"observed_at":"2026-07-31T11:49:11.710201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16300","last_updated":"2023-11-20T01:16:17Z","snapshot_observed_at":"2026-08-17T21:55:20.885060Z","submitted_at":"2023-05-25T17:53:42Z","title":"Landmark Attention: Random-Access Infinite Context Length for Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16300","snapshot_observed_at":"2026-07-31T11:49:11.713173Z","title":"Random-access infinite context length for transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.713173Z"},"links":{"cited_paper":"/paper/2305.16300","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:7e665b2a19a521c306de9e00abf7da95aa3acdea6ffa91c2ceb37347d9ab0c48","observation_id":"46f7380e-cb26-4594-8697-62cd46e165ea","resolution":{"observed_at":"2026-07-31T11:49:11.713173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.715929Z","title":"SALS: Sparse attention in latent space for KV cache compression","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.715929Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:f8e5416e466043c70333bae0e89dd4ed7ac626180a00d1a18adfca47a2fc3278","observation_id":"8ac1f2ad-c643-4606-8f66-82abbc90c30e","resolution":{"observed_at":"2026-07-31T11:49:11.715929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17768","last_updated":"2026-06-22T18:38:34Z","snapshot_observed_at":"2026-08-16T23:56:57.327783Z","submitted_at":"2025-04-24T17:39:25Z","title":"The Sparse Frontier: Sparse Attention Trade-offs in Transformer LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17768","snapshot_observed_at":"2026-07-31T11:49:11.718361Z","title":"The sparse frontier: Sparse attention trade-offs in transformer LLMs.arXiv preprint arXiv:2504.17768, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.718361Z"},"links":{"cited_paper":"/paper/2504.17768","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:8145fae021e8896405e566b99394d4ec382caef0a82a7c8dff0e0d4947d0d8ed","observation_id":"18f71b2b-c7d9-42c9-b8ee-0e1a11a0fbc7","resolution":{"observed_at":"2026-07-31T11:49:11.718361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.720982Z","title":"Qwen3.5: Towards native multimodal agents.https://qwen.ai/blog?id=qwen3.5, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.720982Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:67cdd6fac7fe365a0563edcb5901a400fd77571cfb881fbb14fc0030c3d5eb49","observation_id":"2774982c-d33a-435e-a1c2-e43837eae884","resolution":{"observed_at":"2026-07-31T11:49:11.720982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.723462Z","title":"SparQ attention: Bandwidth-efficient LLM inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.723462Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:f30a25de8ae62a04301d2ae2a57ba11ab495cb2041ce1646e060577d571d4edc","observation_id":"34034361-9ed1-4385-9431-18af41f3191b","resolution":{"observed_at":"2026-07-31T11:49:11.723462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.726565Z","title":"Eigen attention: Attention in low-rank space for KV cache compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.726565Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:18ac8f494fc2e0ea92fba12cfb238e8c149e0cc39ff65958fb8872b421a309a6","observation_id":"6288f059-36a3-481d-a87d-9ad3c4cd5bdd","resolution":{"observed_at":"2026-07-31T11:49:11.726565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-07-31T11:49:11.729328Z","title":"Fast transformer decoding: One write-head is all you need.arXiv preprint arXiv:1911.02150, 2019","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.729328Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:f2c47f7e5cb5200b8b437cbcc968aa0fa38e8ff74fac37eaa0a7f3b0a36ba3de","observation_id":"09739156-8774-4047-9d85-b6e8cb20a7b8","resolution":{"observed_at":"2026-07-31T11:49:11.729328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02542","last_updated":"2024-11-07T18:58:50Z","snapshot_observed_at":"2026-08-17T23:57:41.888384Z","submitted_at":"2024-06-04T17:58:03Z","title":"Loki: Low-rank Keys for Efficient Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02542","snapshot_observed_at":"2026-07-31T11:49:11.732389Z","title":"Loki: Low-rank keys for effi- cient sparse attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.732389Z"},"links":{"cited_paper":"/paper/2406.02542","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:787d4f29d1d59cdced716909d8203e47b5421443c495919498624d66ad91e815","observation_id":"5393c3b5-e078-4c43-8730-3640dc0c7287","resolution":{"observed_at":"2026-07-31T11:49:11.732389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.11504","last_updated":"2026-04-25T08:28:07Z","snapshot_observed_at":"2026-08-18T07:49:09.368602Z","submitted_at":"2026-03-12T03:46:35Z","title":"LongFlow: Efficient KV Cache Compression for Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.11504","snapshot_observed_at":"2026-07-31T11:49:11.735297Z","title":"LongFlow: Efficient KV cache compression for reasoning models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.735297Z"},"links":{"cited_paper":"/paper/2603.11504","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:d305b595448ca01afee9b10a9762e16327de1063a34975f21993e0e8f0acaec4","observation_id":"ea58ec9e-d60a-44c2-8139-1c3909ba88a2","resolution":{"observed_at":"2026-07-31T11:49:11.735297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.738457Z","title":"ShadowKV: KV cache in shadows for high-throughput long-context LLM inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.738457Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:f049f07991089dff2b62e2e9a757999f8c31f42ff7cda6238bf2d74d95f1ceed","observation_id":"2eb77442-e559-441b-916b-5bdf1a8bbaa1","resolution":{"observed_at":"2026-07-31T11:49:11.738457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.741061Z","title":"Quest: Query-aware sparsity for efficient long-context LLM inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.741061Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:c6135b2451c1275a331b4991a2b4489c8483c36a8ac415a1dc8ef25cbeac8324","observation_id":"c6baaa99-e09f-489d-b42e-91aa819d0403","resolution":{"observed_at":"2026-07-31T11:49:11.741061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-14T09:56:00.692687Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-07-31T11:49:11.743571Z","title":"ChatGLM: A family of large language models from GLM-130B to GLM-4 all tools.arXiv preprint arXiv:2406.12793, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.743571Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:407b6e3125a0465ccd1212206329d2a686897b388fed901e3a2d4ab4cc9d0c07","observation_id":"02fc6b07-76db-4b02-96cc-313ceb3ed263","resolution":{"observed_at":"2026-07-31T11:49:11.743571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.09052","last_updated":"2026-07-10T02:48:43Z","snapshot_observed_at":"2026-08-16T12:47:27.810931Z","submitted_at":"2026-07-10T02:48:43Z","title":"COBS: Cumulant Order Block Sparse Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.09052","snapshot_observed_at":"2026-07-31T11:49:11.746726Z","title":"COBS: Cumulant order block sparse attention.arXiv preprint arXiv:2607.09052, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.746726Z"},"links":{"cited_paper":"/paper/2607.09052","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:34870924da29a7ab4fd18cf806dfd13c84a3638a439878d2df06f10c2760b01d","observation_id":"1366120e-6eef-44b1-808d-fdc969bc4e17","resolution":{"observed_at":"2026-07-31T11:49:11.746726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.749782Z","title":"A mathematical theory of top-ksparse attention via total variation distance, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.749782Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:9f106e8bad473c03f953f822aa30c68836aad5a0f60e10e123a87ce0ce74deb2","observation_id":"3e65cea9-3327-4e76-b100-6617e0255937","resolution":{"observed_at":"2026-07-31T11:49:11.749782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.752410Z","title":"SPLA: Block sparse plus linear attention for long context modeling.arXiv preprint arXiv:2601.22379, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.752410Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:fb7ecb51e895cee005989921ce26bd1e3cfe6fcd3893eec86f0605fd6bea44f8","observation_id":"bbd7d912-9cc9-43cf-afa1-5c54d7176c1d","resolution":{"observed_at":"2026-07-31T11:49:11.752410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.08426","last_updated":"2026-05-25T11:18:29Z","snapshot_observed_at":"2026-08-15T01:29:46.563110Z","submitted_at":"2026-02-09T09:31:06Z","title":"Prism: Spectral-Aware Block-Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.08426","snapshot_observed_at":"2026-07-31T11:49:11.755340Z","title":"Prism: Spectral- aware block-sparse attention, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.755340Z"},"links":{"cited_paper":"/paper/2602.08426","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:7ce41b9a3b0b92b37c4a87c8641e0295b9ad990e863a6ba6f59c60eabb098318","observation_id":"a7b3e8db-b6d5-4784-8d5b-44d9dc530c8c","resolution":{"observed_at":"2026-07-31T11:49:11.755340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.758862Z","title":"TokenSelect: Efficient long-context inference and length extrapolation for LLMs via dynamic token-level KV cache selection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.758862Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:58444d8c03887efecb0afbbb2846f1314b94990d3df44da2a2b8755bea51ac2b","observation_id":"21c42903-c6bb-47aa-b73f-20a3c4c0d651","resolution":{"observed_at":"2026-07-31T11:49:11.758862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04617","last_updated":"2024-05-28T12:05:12Z","snapshot_observed_at":"2026-08-16T14:20:44.078187Z","submitted_at":"2024-02-07T06:50:42Z","title":"InfLLM: Training-Free Long-Context Extrapolation for LLMs with an Efficient Context Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04617","snapshot_observed_at":"2026-07-31T11:49:11.761477Z","title":"InfLLM: Training-free long-context extrapolation for LLMs with an efficient context memory","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.761477Z"},"links":{"cited_paper":"/paper/2402.04617","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:b9d52f4f3cfff635f137ed963c635d18a44a31b1f1944a3a0385ec5d90aee05a","observation_id":"6ed4e946-e7ea-498f-8aee-42a4d25a38dd","resolution":{"observed_at":"2026-07-31T11:49:11.761477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.764973Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.764973Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:606128e1efac8a3b0448dbbc0fd648a498a1db5e48dbd2d000d9a535f791c564","observation_id":"f01c3bbd-793b-43ec-a26d-5f1b1da8b0f5","resolution":{"observed_at":"2026-07-31T11:49:11.764973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10819","last_updated":"2024-10-14T17:59:58Z","snapshot_observed_at":"2026-08-16T03:51:26.346422Z","submitted_at":"2024-10-14T17:59:58Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10819","snapshot_observed_at":"2026-07-31T11:49:11.767862Z","title":"DuoAttention: Efficient long-context LLM inference with retrieval and streaming heads","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.767862Z"},"links":{"cited_paper":"/paper/2410.10819","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:c27cbd19a8d32680e965ed8f312e1557813e965789002d577c73150ba74551e8","observation_id":"b90b59e2-f2af-4706-9a62-2710cc046603","resolution":{"observed_at":"2026-07-31T11:49:11.767862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-31T11:49:11.771041Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.771041Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:b2a950f2956634fa29997b4a6f1fa26327efd8717b3f547cb954bc0806d395fa","observation_id":"60e153d1-c2fd-462a-8230-af37e924c857","resolution":{"observed_at":"2026-07-31T11:49:11.771041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18096","last_updated":"2024-02-28T06:34:54Z","snapshot_observed_at":"2026-08-16T14:14:39.490675Z","submitted_at":"2024-02-28T06:34:54Z","title":"No Token Left Behind: Reliable KV Cache Compression via Importance-Aware Mixed Precision Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18096","snapshot_observed_at":"2026-07-31T11:49:11.774088Z","title":"No token left behind: Reliable KV cache compression via importance-aware mixed precision quantization.arXiv preprint arXiv:2402.18096, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.774088Z"},"links":{"cited_paper":"/paper/2402.18096","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:f892637e99efaca9c35757626e6e785a26edf33432bfb0225c69524bfd7bd028","observation_id":"bf064771-150e-419f-8c46-194fb053990b","resolution":{"observed_at":"2026-07-31T11:49:11.774088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.23200","last_updated":"2026-05-22T03:32:52Z","snapshot_observed_at":"2026-08-17T12:58:20.920773Z","submitted_at":"2026-05-22T03:32:52Z","title":"Adaptive Mass-Segmented KV Compression for Long-Context Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.23200","snapshot_observed_at":"2026-07-31T11:49:11.776915Z","title":"Adaptive mass-segmented KV compression for long-context reasoning.arXiv preprint arXiv:2605.23200, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.776915Z"},"links":{"cited_paper":"/paper/2605.23200","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:844b19856dbad82817716ad48f13e169d58e2292942c93f2187c79b17ddddd66","observation_id":"fb304ee9-3e1a-4e57-9269-b67b116de627","resolution":{"observed_at":"2026-07-31T11:49:11.776915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.779925Z","title":"TidalDecode: Fast and accurate LLM decoding with position persistent sparse attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.779925Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:2d53c2149e95efd071b6dd4385d6a25d05d9183235b2978323a678389e3f24ad","observation_id":"4dc332e9-ffdb-43bb-90e4-b8a915f52fd7","resolution":{"observed_at":"2026-07-31T11:49:11.779925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.782655Z","title":"Self-indexing KVCache: Predicting sparse attention from compressed keys, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.782655Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:58920d43d6ef222348219299c5f2f5db126cecec679d1b950b01ca2c8d3c4338","observation_id":"deca8bf0-5b1a-485b-b49e-cecbdb30daac","resolution":{"observed_at":"2026-07-31T11:49:11.782655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.28831","last_updated":"2026-06-27T09:36:37Z","snapshot_observed_at":"2026-08-14T21:17:26.179992Z","submitted_at":"2026-06-27T09:36:37Z","title":"HARD-KV: Head-Adaptive Regularization for Decoding-time KV Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.28831","snapshot_observed_at":"2026-07-31T11:49:11.785240Z","title":"HARD-KV: Head-adaptive regularization for decoding-time KV compression.arXiv preprint arXiv:2606.28831, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.785240Z"},"links":{"cited_paper":"/paper/2606.28831","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:fc2ceeeab8d7c83c1e017f7a0af73d3e15cc57992b891cdfddca0cf1c7080744","observation_id":"12701088-aa65-445c-b456-6b4edbff2b8d","resolution":{"observed_at":"2026-07-31T11:49:11.785240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.12087","last_updated":"2026-04-28T06:58:25Z","snapshot_observed_at":"2026-08-16T23:11:09.362556Z","submitted_at":"2025-12-12T23:30:43Z","title":"BLASST: Dynamic BLocked Attention Sparsity via Softmax Thresholding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.12087","snapshot_observed_at":"2026-07-31T11:49:11.788006Z","title":"BLASST: Dynamic BLocked attention sparsity via softmax thresholding","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.788006Z"},"links":{"cited_paper":"/paper/2512.12087","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:962d707e3062640683104db29c2aada5e6a3b7a2e95de291fa6741f508078a15","observation_id":"d35f19ad-4206-4fb0-bf15-52471124beb1","resolution":{"observed_at":"2026-07-31T11:49:11.788006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11089","last_updated":"2025-02-27T09:01:21Z","snapshot_observed_at":"2026-08-16T16:29:35.500686Z","submitted_at":"2025-02-16T11:53:44Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11089","snapshot_observed_at":"2026-07-31T11:49:11.790902Z","title":"Native sparse attention: Hardware-aligned and natively trainable sparse attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.790902Z"},"links":{"cited_paper":"/paper/2502.11089","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:0eb5c7288204260d59361a7818f6d49672d72cc08bfb550dacd5c420a48718b8","observation_id":"22443527-7156-4090-adfe-56a04d49be16","resolution":{"observed_at":"2026-07-31T11:49:11.790902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.793719Z","title":"Big bird: Transformers for longer sequences","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.793719Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:e2752425879d34ac51c8b40a5b40d9e6584a86fbff1a665211dc6e82eb5762c0","observation_id":"134df698-5dae-4c79-8d7b-b21fcd450986","resolution":{"observed_at":"2026-07-31T11:49:11.793719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-07-31T11:49:11.796378Z","title":"GLM-5.2: Built for long-horizon tasks","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.796378Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:861b9f69ac7d7ccf90e20eedf7ad4dca5577d8fcf840830d3f930eb9e475883e","observation_id":"28ebee9f-58ba-4a69-b2f6-6cc784a6b235","resolution":{"observed_at":"2026-07-31T11:49:11.796378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12820","last_updated":"2025-03-30T08:13:50Z","snapshot_observed_at":"2026-08-17T00:49:15.253403Z","submitted_at":"2024-07-01T13:05:42Z","title":"PQCache: Product Quantization-based KVCache for Long Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12820","snapshot_observed_at":"2026-07-31T11:49:11.799232Z","title":"PQCache: Product quantization-based KVCache for long context LLM inference.Proceedings of the ACM on Management of Data, 3(3):201:1–201:30, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.799232Z"},"links":{"cited_paper":"/paper/2407.12820","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:a1dc89ed459458f545c5f13d83b443395fada68d17eb1a6490d44faa8b86df96","observation_id":"e1473abf-d04b-484b-a419-926e0cb80548","resolution":{"observed_at":"2026-07-31T11:49:11.799232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.802040Z","title":"LazyEviction: Lagged KV eviction with attention pattern observation for efficient long reasoning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.802040Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:038131625cd2da362de2b8afc0642a8ee045b18565a271947823ec6107f7e504","observation_id":"3b8fbe2d-954a-4314-b91a-3424b16c5da2","resolution":{"observed_at":"2026-07-31T11:49:11.802040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T11:49:11.804916Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.804916Z"},"links":{"citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:654bd71445935916cb685da3542ffc517da716c2cf8762245ea18108da23784e","observation_id":"26379618-dee9-499f-bbb5-d9352f94721a","resolution":{"observed_at":"2026-07-31T11:49:11.804916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12216","last_updated":"2025-02-17T08:39:43Z","snapshot_observed_at":"2026-08-16T12:57:49.952304Z","submitted_at":"2025-02-17T08:39:43Z","title":"Tactic: Adaptive Sparse Attention with Clustering and Distribution Fitting for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12216","snapshot_observed_at":"2026-07-31T11:49:11.807382Z","title":"Tactic: Adaptive sparse attention with clustering and distribution fitting for long-context LLMs.arXiv preprint arXiv:2502.12216, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.807382Z"},"links":{"cited_paper":"/paper/2502.12216","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:8bb24ff945ee0f55d8a491ba8767e96aefdb13cf7dc9c6ecedffbeec42275a54","observation_id":"9bfb584b-155d-41ad-8434-49a2871f16f4","resolution":{"observed_at":"2026-07-31T11:49:11.807382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.21623","last_updated":"2026-04-16T21:29:54Z","snapshot_observed_at":"2026-08-14T12:21:00.182138Z","submitted_at":"2025-09-25T21:42:27Z","title":"OjaKV: Context-Aware Online Low-Rank KV Cache Compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.21623","snapshot_observed_at":"2026-07-31T11:49:11.810189Z","title":"Yang, Mohammad Mohammadi Amiri, Keerthiram Murugesan, Tejaswini Pedapati, and Pin-Yu Chen","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.810189Z"},"links":{"cited_paper":"/paper/2509.21623","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:5400ac4837334a9aeddc2b4dcbc6e689613e9098046f15a3dfddab91caccf273","observation_id":"aabcb895-f888-4f90-877b-1a621e302597","resolution":{"observed_at":"2026-07-31T11:49:11.810189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16284","last_updated":"2026-05-26T20:24:41Z","snapshot_observed_at":"2026-08-04T23:57:41.065078Z","submitted_at":"2026-02-18T09:06:53Z","title":"Fast KV Compaction via Attention Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.16284","snapshot_observed_at":"2026-07-31T11:49:11.813142Z","title":"Fast KV compaction via attention matching.arXiv preprint arXiv:2602.16284, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-31T11:49:11.813142Z"},"links":{"cited_paper":"/paper/2602.16284","citing_paper":"/paper/2607.24555"},"observation_digest":"sha256:554e9e1a081067ae9fd5fa60006f402ff951519330d8f5a6593746938320419a","observation_id":"8c14fd66-b31c-4811-b6f9-ee63def766db","resolution":{"observed_at":"2026-07-31T11:49:11.813142Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.24555","last_updated":"2026-07-27T15:28:52Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T06:50:39.173138Z","submitted_at":"2026-07-27T15:28:52Z","title":"LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":76,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 0 inbound Pith citation observations for arXiv:2607.24555."}