{"as_of":"2026-08-08T05:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e1567bf13916b09c60f125592c37a53636d61faf7df72b7de10804341ff4594b","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:38:41.059939Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T07:03:08.617257Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T07:04:20.888331Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"cited_work":{"arxiv_id":"2506.15704","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15704","snapshot_observed_at":"2026-06-30T07:04:20.888331Z","title":"Learn from the past: Fast sparse indexing for large language model decoding","venue":null,"work_id":"6ab074c0-906d-42d7-80ee-a137f5533fec","year":2025},"citing_paper":{"arxiv_id":"2604.10098","last_updated":"2026-04-11T08:41:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-11T08:41:33Z","title":"Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:09.834609Z"},"links":{"cited_paper":"/paper/2506.15704","citing_paper":"/paper/2604.10098"},"observation_digest":"sha256:549bbb48cc1573ef29fa772c84a4e07e94fa11263f678b3a053e5843fd8df57c","observation_id":"adc68189-911a-4ea2-bb71-b3f964fbeaf9","resolution":{"observed_at":"2026-05-11T09:05:57.988048Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"cited_work":{"arxiv_id":"2506.15704","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15704","snapshot_observed_at":"2026-06-30T07:04:20.888331Z","title":"Learn from the past: Fast sparse indexing for large language model decoding","venue":null,"work_id":"6ab074c0-906d-42d7-80ee-a137f5533fec","year":2025},"citing_paper":{"arxiv_id":"2606.30389","last_updated":"2026-06-29T14:43:25Z","snapshot_observed_at":"2026-08-07T13:47:26.810467Z","submitted_at":"2026-06-29T14:43:25Z","title":"Predict, Reuse, and Repair: Accelerating Dynamic Sparse Attention for Long-Context LLM Decoding","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-30T07:03:08.617257Z"},"links":{"cited_paper":"/paper/2506.15704","citing_paper":"/paper/2606.30389"},"observation_digest":"sha256:3e8662af50c10d7d0fc3e484dcf2d9348d7524de2eb9a31209a660fdaceb0efa","observation_id":"b692aa6d-3478-4390-a79c-b57fa3cd51c3","resolution":{"observed_at":"2026-06-30T07:04:20.890041Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.15704/citation-record","integrity":"/paper/2506.15704/integrity","json":"/paper/2506.15704/citation-record.json","paper":"/paper/2506.15704"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:38:33.909659Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:33.909659Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:014adf0965872e81aae215e53e3c568089b49072d98b94785394aee815c06a44","observation_id":"7e9b751b-e021-4306-9155-4dc11094e21f","resolution":{"observed_at":"2026-08-07T12:38:33.909659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14508","last_updated":"2024-06-19T04:00:32Z","snapshot_observed_at":"2026-08-08T03:49:18.086396Z","submitted_at":"2023-08-28T11:53:40Z","title":"LongBench: A Bilingual, Multitask Benchmark for Long Context Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14508","snapshot_observed_at":"2026-08-07T12:38:34.959797Z","title":"Longbench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:34.959797Z"},"links":{"cited_paper":"/paper/2308.14508","citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:76cdf50ad186514e1d17cb6c19d1598f8a95e71bcd6a01456bb93d57cd466daf","observation_id":"6905c1fa-97b4-4f8c-8379-e543693552b3","resolution":{"observed_at":"2026-08-07T12:38:34.959797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:38:42.400875Z","title":"Loki then and now: the trickster against civilization","venue":null,"work_id":"61ca2ab5-6708-4fd3-b20f-dedead07d275","year":2017},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:36.864775Z"},"links":{"citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:3dddaedb9cb6dabd0c58dd466ca4f6c103243a0c6c49819ba34fe53ae2b6913c","observation_id":"4818a542-f672-4751-9d18-0e618417980e","resolution":{"observed_at":"2026-08-07T12:38:42.432776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16179","last_updated":"2024-12-18T17:36:36Z","snapshot_observed_at":"2026-07-06T19:37:11.636987Z","submitted_at":"2024-10-21T16:44:51Z","title":"MagicPIG: LSH Sampling for Efficient LLM Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16179","snapshot_observed_at":"2026-08-07T12:38:37.033773Z","title":"Magicpig: Lsh sampling for efficient llm generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:37.033773Z"},"links":{"cited_paper":"/paper/2410.16179","citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:4d958255b644bde48a129a1a2481b32928d77534234faba56d902f84beb69022","observation_id":"fbc23119-1404-43fb-bcbe-a736885ebc2c","resolution":{"observed_at":"2026-08-07T12:38:37.033773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.03011","last_updated":"2021-05-07T00:12:34Z","snapshot_observed_at":"2026-08-05T23:00:05.031488Z","submitted_at":"2021-05-07T00:12:34Z","title":"A Dataset of Information-Seeking Questions and Answers Anchored in Research Papers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.03011","snapshot_observed_at":"2026-08-07T12:38:37.206520Z","title":"A dataset of information-seeking questions and answers anchored in research papers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:37.206520Z"},"links":{"cited_paper":"/paper/2105.03011","citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:b8ea7da81f0bb48de30d2e632b7953d35191b0ffc623442b318520076c1a1bb6","observation_id":"1b64cb96-4555-4e9f-96da-9b6ea86f7653","resolution":{"observed_at":"2026-08-07T12:38:37.206520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:38:37.366095Z","title":"Human-like episodic memory for infinite context llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:37.366095Z"},"links":{"citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:893d90c541159d3dd7ae9fb3c6c19b0a19d3da29194ff56e4db6d639396693dc","observation_id":"7c429e67-9fbe-4570-8558-ab2d3cd7d6ab","resolution":{"observed_at":"2026-08-07T12:38:37.366095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11421","last_updated":"2024-03-18T02:30:23Z","snapshot_observed_at":"2026-08-06T20:15:05.193939Z","submitted_at":"2024-03-18T02:30:23Z","title":"FastDecode: High-Throughput GPU-Efficient LLM Serving using Heterogeneous Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11421","snapshot_observed_at":"2026-08-07T12:38:37.472671Z","title":"Fastdecode: High-throughput gpu-efficient llm serving using heterogeneous pipelines","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:37.472671Z"},"links":{"cited_paper":"/paper/2403.11421","citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:18f3fb5d854eef32c1c99f941da4cadbded076f1dac614258fcc8e241b9fd4f4","observation_id":"a9c97e9d-4fe5-4fba-ba4d-0a63006dc951","resolution":{"observed_at":"2026-08-07T12:38:37.472671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-07T12:38:37.591170Z","title":"Ruler: What’s the real context size of your long-context language models? arXiv preprint arXiv:2404.06654, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:37.591170Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:27d6d65f8e606eee5879e51e55e66f618869dbc90d190569179754f629d4f5d1","observation_id":"550258a3-3477-4a84-96ab-1b4fb5775f14","resolution":{"observed_at":"2026-08-07T12:38:37.591170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17089","last_updated":"2025-06-04T16:08:50Z","snapshot_observed_at":"2026-07-06T19:57:01.568072Z","submitted_at":"2024-11-26T04:03:14Z","title":"KVPR: Efficient LLM Inference with I/O-Aware KV Cache Partial Recomputation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17089","snapshot_observed_at":"2026-08-07T12:38:37.745707Z","title":"Efficient llm inference with i/o-aware partial kv cache recomputation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:37.745707Z"},"links":{"cited_paper":"/paper/2411.17089","citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:314b2799e66bdf27b6228bfab86abb0e9003764d0ce244820a6fc2a499e07565","observation_id":"8dd36822-23d0-4a69-a797-88e0c5ff4a97","resolution":{"observed_at":"2026-08-07T12:38:37.745707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02490","last_updated":"2024-10-30T14:53:22Z","snapshot_observed_at":"2026-08-07T20:59:29.819833Z","submitted_at":"2024-07-02T17:59:56Z","title":"MInference 1.0: Accelerating Pre-filling for Long-Context LLMs via Dynamic Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02490","snapshot_observed_at":"2026-08-07T12:38:37.911487Z","title":"Minference 1.0: Accelerating pre-filling for long-context llms via dynamic sparse attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:37.911487Z"},"links":{"cited_paper":"/paper/2407.02490","citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:1488258e09bb8ee8339359ddc783526174da2454d65699fcb71f85e1fbfd3162","observation_id":"2f11bb7e-adc0-419b-9367-506515bf257a","resolution":{"observed_at":"2026-08-07T12:38:37.911487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01142","last_updated":"2024-11-02T05:15:44Z","snapshot_observed_at":"2026-07-06T19:43:59.326124Z","submitted_at":"2024-11-02T05:15:44Z","title":"NEO: Saving GPU Memory Crisis with CPU Offloading for Online LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01142","snapshot_observed_at":"2026-08-07T12:38:38.015826Z","title":"Neo: Saving gpu memory crisis with cpu offloading for online llm inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:38.015826Z"},"links":{"cited_paper":"/paper/2411.01142","citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:6d9c2f1b70638dbb57bf993362333048bbf9c4a3635139819e510c2c4f59fad7","observation_id":"9e46c474-80d9-4b1b-8ce7-4d9e4401fd52","resolution":{"observed_at":"2026-08-07T12:38:38.015826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03065","last_updated":"2025-02-20T23:28:01Z","snapshot_observed_at":"2026-08-04T08:18:44.624754Z","submitted_at":"2024-10-04T01:11:09Z","title":"Compute Or Load KV Cache? Why Not Both?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03065","snapshot_observed_at":"2026-08-07T12:38:38.180039Z","title":"Compute or load kv cache? why not both? arXiv preprint arXiv:2410.03065, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:38.180039Z"},"links":{"cited_paper":"/paper/2410.03065","citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:96d88ebaf2438d53991a582ed632aaf7089ce0840cc78fa7c3c87eb97eb5401e","observation_id":"a34eb7be-896c-4b89-b6ba-31cd8f00ef2a","resolution":{"observed_at":"2026-08-07T12:38:38.180039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:38:38.354119Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:38.354119Z"},"links":{"citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:9f5344afea57f2718daf8bf26ed0ff581ab78f4b68ab52e2e00b74391af3e585","observation_id":"c1bfc8f9-aeab-4816-b3b3-d2d996cf9159","resolution":{"observed_at":"2026-08-07T12:38:38.354119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:38:38.493837Z","title":"{InfiniGen}: Efficient generative inference of large language models with dynamic {KV} cache management","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:38.493837Z"},"links":{"citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:d06c3644c381dd17072bc0c0d834b48458cf5acb1a050dd8161d055ff9c24e02","observation_id":"661a023e-a340-4058-832c-8704d5177c46","resolution":{"observed_at":"2026-08-07T12:38:38.493837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:38:42.138241Z","title":"Snapkv: Llm knows what you are looking for before generation","venue":null,"work_id":"6d8ef366-2897-4d3c-8c27-8c4dcfa75a85","year":2024},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:38.606433Z"},"links":{"citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:c022b8aa3badc61269e46ef05a9e3650962f59dd49aa8f0578bdba64e78e608b","observation_id":"eada5741-34d4-4ef6-a9c4-bf9fa63b8c1a","resolution":{"observed_at":"2026-08-07T12:38:42.226835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T12:38:38.773218Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:38.773218Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:827fd2d1785b65c77a3f8f986cf798e9f2c633e58b8bf5992f28ca00abe8d383","observation_id":"16d82528-4536-421b-acd9-37cd4177d06c","resolution":{"observed_at":"2026-08-07T12:38:38.773218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10516","last_updated":"2024-12-31T07:11:00Z","snapshot_observed_at":"2026-08-07T09:13:28.333702Z","submitted_at":"2024-09-16T17:59:52Z","title":"RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10516","snapshot_observed_at":"2026-08-07T12:38:38.885050Z","title":"Retrievalattention: Accelerating long- context llm inference via vector retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:38.885050Z"},"links":{"cited_paper":"/paper/2409.10516","citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:e8ee7b0c63d4719a4e5b79ba418048546b582b1ef8573eee44c0cde4baa86661","observation_id":"977bba42-95d7-49de-a137-96176e3d0470","resolution":{"observed_at":"2026-08-07T12:38:38.885050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03213","last_updated":"2025-06-14T06:17:33Z","snapshot_observed_at":"2026-07-06T20:01:27.728631Z","submitted_at":"2024-12-04T10:58:27Z","title":"ClusterKV: Manipulating LLM KV Cache in Semantic Space for Recallable Compression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03213","snapshot_observed_at":"2026-08-07T12:38:39.010317Z","title":"Clusterkv: Manipulating llm kv cache in semantic space for recallable compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:39.010317Z"},"links":{"cited_paper":"/paper/2412.03213","citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:3d4885624a594000f5eaa82bb69bf1d9f1d8f9254707aaec725ba3e0f288c4f0","observation_id":"e878039f-0681-4e7b-9be6-f5d943c4b78e","resolution":{"observed_at":"2026-08-07T12:38:39.010317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13189","snapshot_observed_at":"2026-08-07T12:38:39.114620Z","title":"Moba: Mixture of block attention for long-context llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:39.114620Z"},"links":{"cited_paper":"/paper/2502.13189","citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:3e9558df2bb0b2c2b9a4619a99c787e59d058ef4eb1700f246ecea399387f99f","observation_id":"bc97e210-8720-4018-962e-cd4d98de5a87","resolution":{"observed_at":"2026-08-07T12:38:39.114620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04985","last_updated":"2024-09-04T10:04:52Z","snapshot_observed_at":"2026-07-06T16:58:47.790985Z","submitted_at":"2023-12-08T11:47:35Z","title":"SparQ Attention: Bandwidth-Efficient LLM Inference","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04985","snapshot_observed_at":"2026-08-07T12:38:39.247507Z","title":"Sparq attention: Bandwidth-efficient llm inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:39.247507Z"},"links":{"cited_paper":"/paper/2312.04985","citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:1f0bd73a60992dbc6ad647fd8bc42378fb209235752950baecbe01e7f306b37b","observation_id":"1e514596-25c8-486d-96ff-73b94b3258e6","resolution":{"observed_at":"2026-08-07T12:38:39.247507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-07T12:38:39.414534Z","title":"Code llama: Open foundation models for code","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:39.414534Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:62814f7b9aeaf9532d9442f917bc2e001290dacb14e5fcb8bf8871145bd196df","observation_id":"952fef15-d388-47c7-aa55-f96d7c1b1060","resolution":{"observed_at":"2026-08-07T12:38:39.414534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:38:39.514366Z","title":"Flexgen: High-throughput generative inference of large language models with a single gpu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:39.514366Z"},"links":{"citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:9b7133b6878d4d593320b37e91f17c6e639a75fa45f96beebc830c039d7531bd","observation_id":"cc38a9bf-8c56-45a5-abae-122c51efc83e","resolution":{"observed_at":"2026-08-07T12:38:39.514366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21465","last_updated":"2025-04-25T19:40:54Z","snapshot_observed_at":"2026-08-01T20:33:25.557711Z","submitted_at":"2024-10-28T19:08:12Z","title":"ShadowKV: KV Cache in Shadows for High-Throughput Long-Context LLM Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21465","snapshot_observed_at":"2026-08-07T12:38:39.632271Z","title":"Shadowkv: Kv cache in shadows for high-throughput long-context llm inference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:39.632271Z"},"links":{"cited_paper":"/paper/2410.21465","citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:933aaa934e79a0ae579fcba24645489427cafd3606aa530c2fa8eb335445873d","observation_id":"9545cbf4-34d8-46f4-9560-9cacafa53065","resolution":{"observed_at":"2026-08-07T12:38:39.632271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10774","last_updated":"2024-08-26T21:01:02Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-16T01:33:02Z","title":"Quest: Query-Aware Sparsity for Efficient Long-Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10774","snapshot_observed_at":"2026-08-07T12:38:39.786344Z","title":"Quest: Query-aware sparsity for efficient long-context llm inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:39.786344Z"},"links":{"cited_paper":"/paper/2406.10774","citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:97f2d5862ed75bceebd41916fd89b744c29dfb25e9eb4ececfbfd2194a023e38","observation_id":"04f60f49-951a-40a4-a26d-2e8c88f2a8bf","resolution":{"observed_at":"2026-08-07T12:38:39.786344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T12:38:39.932459Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:39.932459Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:06ea5aebd934812f7bc8f206f4b018e84f69ed2cab10b74049d4f0e57261b38a","observation_id":"bed9b6f2-dc40-4894-92bb-2aa4d92a1ff7","resolution":{"observed_at":"2026-08-07T12:38:39.932459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08454","last_updated":"2024-07-21T02:37:11Z","snapshot_observed_at":"2026-07-06T18:44:49.512236Z","submitted_at":"2024-07-11T12:50:42Z","title":"Model Tells You Where to Merge: Adaptive KV Cache Merging for LLMs on Long-Context Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08454","snapshot_observed_at":"2026-08-07T12:38:40.064295Z","title":"Model tells you where to merge: Adaptive kv cache merging for llms on long-context tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:40.064295Z"},"links":{"cited_paper":"/paper/2407.08454","citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:4bd66d2e824bddc10a02b68dcc05600623ff662b7b3aef74528451a7fe2316c2","observation_id":"6a23d7f7-75e2-45b2-9981-415acf380d00","resolution":{"observed_at":"2026-08-07T12:38:40.064295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:38:41.844717Z","title":"Infllm: Unveiling the intrinsic capacity of llms for under- standing extremely long sequences with training-free memory.arXiv e-prints, pages arXiv–2402, 2024","venue":null,"work_id":"bea59fa7-0807-4921-a867-0b3b85e1b020","year":2024},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:40.195808Z"},"links":{"citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:b3a69dff4117d58ae4ccdce8ef308479bd43d0842a56f8fec3d2ca10b90a79e2","observation_id":"9b3bc751-1820-4855-b643-3b526a4061b9","resolution":{"observed_at":"2026-08-07T12:38:41.973919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10819","last_updated":"2024-10-14T17:59:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-14T17:59:58Z","title":"DuoAttention: Efficient Long-Context LLM Inference with Retrieval and Streaming Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10819","snapshot_observed_at":"2026-08-07T12:38:40.368474Z","title":"Duoattention: Efficient long-context llm inference with retrieval and streaming heads","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:40.368474Z"},"links":{"cited_paper":"/paper/2410.10819","citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:e60121d807be5540a2828f0c4ace154d8a4f92eb5e6949ef105a3a7bc9dff26e","observation_id":"aa115202-2d34-45d5-9d2a-faa4234d69e4","resolution":{"observed_at":"2026-08-07T12:38:40.368474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-07T12:38:40.524261Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:40.524261Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:6191ff1c19d7a572398b21e3c8ad8f57f3595f771cf50cf9d2d19e8356cda475","observation_id":"d557360f-bcb7-4c09-9807-c01bc5effd5e","resolution":{"observed_at":"2026-08-07T12:38:40.524261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15383","last_updated":"2025-01-26T03:47:25Z","snapshot_observed_at":"2026-07-31T01:49:29.562668Z","submitted_at":"2025-01-26T03:47:25Z","title":"Qwen2.5-1M Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15383","snapshot_observed_at":"2026-08-07T12:38:40.663165Z","title":"Qwen2.5-1m technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:40.663165Z"},"links":{"cited_paper":"/paper/2501.15383","citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:7f3932480f6db36ca3187fbc8775e3ff1f273ceff41f3b4607628e305e6222fb","observation_id":"23115589-32d9-4e42-b217-8997271304a3","resolution":{"observed_at":"2026-08-07T12:38:40.663165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:38:40.778601Z","title":"Orca: A distributed serving system for {Transformer-Based} generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:40.778601Z"},"links":{"citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:d895f2c964f784dca123c5b5b80f00a2552e82e5ea73aa3b88f98b5db699b51d","observation_id":"5437d5b9-1181-4359-adaf-152295e111b3","resolution":{"observed_at":"2026-08-07T12:38:40.778601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12820","last_updated":"2025-03-30T08:13:50Z","snapshot_observed_at":"2026-07-06T18:48:00.070861Z","submitted_at":"2024-07-01T13:05:42Z","title":"PQCache: Product Quantization-based KVCache for Long Context LLM Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12820","snapshot_observed_at":"2026-08-07T12:38:40.900312Z","title":"Pqcache: Product quantization-based kvcache for long context llm inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:40.900312Z"},"links":{"cited_paper":"/paper/2407.12820","citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:ced4e6335a07bc56030c39d3542338253ccf0db3519d3d4f9f6ba244f2700ba3","observation_id":"0a5774c3-cbdc-4a02-aab5-6c6eaea9326c","resolution":{"observed_at":"2026-08-07T12:38:40.900312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:38:41.551993Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":"d1d5c77d-ec43-42da-b99d-dcba3d9fd8d2","year":2023},"citing_paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:41.059939Z"},"links":{"citing_paper":"/paper/2506.15704"},"observation_digest":"sha256:342abfc791994b3c12ff6e23d25bdf0db9d7001280c56b31fca54a4b6acaa802","observation_id":"0057c0b2-26c2-4e71-9083-60f8c3ffe1db","resolution":{"observed_at":"2026-08-07T12:38:41.662361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.15704","last_updated":"2025-05-30T02:35:59Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T12:30:17.322980Z","submitted_at":"2025-05-30T02:35:59Z","title":"Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 2 inbound Pith citation observations for arXiv:2506.15704."}